forumAbrir tema

Intentamos atrapar el tráfico de bots con un honeypot en nuestra web: ¿deberíamos confiar en los resultados y qué hacer?

SSultan A***Participante
Cargo
Especialista en pruebas
Sector
Transporte
Tipo de organización
Empresa de 300 empleados
Miembro desde
ago 2025
Mensaje
143

Doki · Consultoría de cumplimiento KVKK · 2023

#1

Tenemos un e-commerce de catálogo de repuestos B2B. Recibimos unos 4.000 visitantes únicos al día y unas 25.000 impresiones de página. En los últimos dos meses, los costes del servidor pasaron de 4.500 TL a 11.000 TL. Al revisar los logs, detectamos bots sospechosos rascando constantemente los precios de los productos y el stock. Como solución, pusimos un enlace falso (un honeypot) oculto con CSS en el formulario de contacto y en el pie de página.

En una prueba de tres semanas, registramos 1.400 IPs distintas que hicieron clic en estos campos ocultos o rellenaron el formulario. Sin embargo, al mirar la lista, parece que algunas IPs de proxies corporativos, escáneres de seguridad de empresas e incluso bots de caché de motores de búsqueda cayeron en la trampa.

Nos da miedo bloquear directamente por IP en el firewall fiándonos de estos logs de honeypot por si perdemos clientes reales o visibilidad SEO. ¿Cuál es el método correcto para filtrar este tráfico de bots cazado, separar los que son un riesgo real y tomar medidas de forma segura?

ÖÖzgür G***Participante
Cargo
Desarrollador de software
Sector
Cosmética
Tipo de organización
Equipo de 8 personas
Miembro desde
jun 2023
Mensaje
16
Más útil#2

Respuesta corta: Bloquear de forma permanente y directa las IPs que caen en un honeypot no es el enfoque adecuado. En los campos ocultos de la página también pueden tocar servidores proxy corporativos, lectores de pantalla para personas con discapacidad visual o rastreadores legítimos de motores de búsqueda. Por eso, en vez de banear de golpe las peticiones cazadas, debes pasarlas por un filtro de verificación gradual.

Para hacer una criba segura, sigue estos pasos: 1) En una primera fase, haz una consulta de DNS inversa para verificar si la IP pertenece a motores de búsqueda legítimos conocidos. 2) En lugar de bloquear directamente la dirección que cayó en la trampa, métela en una lista de sospechosos y pon una ligera barrera de verificación por Javascript a las siguientes peticiones que entren desde esa IP. 3) Como las IPs de los usuarios reales cambian constantemente por los pools dinámicos de internet, si vas a bloquear, no lo hagas permanente, limítalo a periodos temporales de 15 minutos o 1 hora. Así no dejas fuera a usuarios inocentes que compartan el mismo pool de IPs.

Los bots de scraping que aumentan tus costes suelen tener una frecuencia de rastreo concreta. En vez de mirar solo el clic en el honeypot, pon un límite de velocidad (rate limit) a las direcciones que pidan más de 50 páginas por minuto. Así proteges los recursos del servidor sin poner en riesgo a tus clientes reales o la indexación de los motores de búsqueda.

TTolga K***Participante
Cargo
Director de TI
Sector
Comercio electrónico
Tipo de organización
empresa dentro de un holding
Miembro desde
jul 2024
Mensaje
76
#3

Si al ocultar en CSS solo usaste display: none o visibility: hidden, los bots modernos ya lo detectan al leer el archivo de estilos y se lo saltan. Solo quedan o bots super rudimentarios o software de accesibilidad. Mover el campo oculto fuera de la pantalla (con text-indent o absolute position) y meterle un atributo aria-hidden reduce bastante los falsos positivos.

EEsra A***Participante
Cargo
Técnico de servicio
Sector
Servicios de salud
Tipo de organización
Empresa de 120 empleados
Miembro desde
dic 2025
Mensaje
9
#4

Nosotros montamos un honeypot en una estructura parecida el año pasado. Al revisar una a una las primeras 800 IPs que cazamos, vimos que 120 de ellas eran la IP de salida compartida de grandes clientes corporativos. Si ese día hubiéramos baneado a lo bruto, habríamos desconectado del sitio a tres de nuestros distribuidores que más piden.

edit: escrito desde el móvil, perdonad las erratas.

RRabia B***ExpertoMiembro de la comunidad
Miembro desde
mar 2025
Mensaje
232
#5

El método del honeypot ya no frena por sí solo a los scrapers de contenido. Las herramientas profesionales de scraping que sacan precios ejecutan navegadores headless completos y solo hacen clic en los botones que se ven de verdad en pantalla. Las 1.400 IPs que cazaste probablemente sean solo ruido inofensivo que rastrea internet al azar, puede que los bots que de verdad te roban los datos ni hayan tocado esa trampa.

AAylinParticipante
Cargo
CRM y correo electrónico
Tipo de organización
Empresa de 300 empleados
Miembro desde
jun 2024
Mensaje
118
#6

En vez de soltar un 403 Forbidden directo, pon un Javascript challenge a nivel de servidor a las IPs que pisen la trampa. Si es un humano real, el navegador lo resuelve en un décimo de segundo y entra al sitio. Si es un scraper básico en python o curl al no poder ejecutar Javascript se da contra un muro y deja de saturar tu servidor.

PPerihan M***ParticipanteMiembro de la comunidad
Miembro desde
abr 2024
Mensaje
83
#7

Calma y nada de hacer baneos masivos a nivel de IP. En Turquía se usa muchísimo CGNAT, si baneas una sola IP de bot de un pool dinámico puedes dejar fuera a la vez a cientos de usuarios inocentes de casas u oficinas. Evalúa el comportamiento sospechoso según la sesión, no por la IP.

Corrección: recordaba mal la cifra, era un poco más baja.

EEsra K***ParticipanteMiembro de la comunidad
Miembro desde
feb 2023
Mensaje
3
#8

a nosotros tb se nos coló un bot de buscador y casi se nos borran los índices, no metáis regla de bloqueo en el servidor sin control rdns ni de coña

LLale A***Participante
Cargo
Jefe de obra
Sector
Servicios de TI
Tipo de organización
cooperativa
Miembro desde
jul 2023
Mensaje
86
#9

¿El enlace oculto del pie de página tenía la etiqueta rel="nofollow" y definiste esa ruta como disallowed en el robots.txt? Si no lo pusiste en el robots.txt, es super normal que los rastreadores de los buscadores sigan ese link.

YYasemin Y***ParticipanteMiembro de la comunidad
Miembro desde
oct 2023
Mensaje
3
#10

En vez de añadir un campo invisible al formulario honeypot, pon un control de marca de tiempo (timestamp); las peticiones que rellenan el formulario en menos de 2 segundos se filtran de forma mucho más clara como bots.

RRıdvan K***ParticipanteMiembro de la comunidad
Miembro desde
oct 2024
Mensaje
2
#11

Estoy totalmente de acuerdo. Si intentas cambiarlo todo a la vez, nada termina de asentarse.

Ánimo.

GGürkan Y***Participante
Cargo
Especialista en recursos humanos
Sector
Química
Tipo de organización
distribuidor regional
Miembro desde
may 2023
Mensaje
234
#12

Gracias, esa era la respuesta que buscaba.

HHande B***Participante
Cargo
Director de operaciones
Sector
Deportes y fitness
Tipo de organización
agencia boutique
Miembro desde
jun 2023
Mensaje
353
#13

El año pasado nos pasó casi exactamente lo mismo. Las decisiones apresuradas son las que hay que corregir seis meses después.

No confíes en una sola medida; ve capa por capa. Ánimo.

HHalil K***Participante
Cargo
Director de clínica
Sector
Productos del mar
Tipo de organización
mediana empresa
Miembro desde
may 2024
Mensaje
208

Doki · Diseño de interfaz · 2026

#14

Tiene razón.

LLevent U***ParticipanteMiembro de la comunidad
Miembro desde
mar 2022
Mensaje
270
#15

De acuerdo incluso me gustaría recalcarlo. Antes de decidir, mirad qué datos tenéis en la mano.

Corrijanme si me equivoco.

DDilekNuevo miembro
Cargo
Pastelería
Tipo de organización
empresa dentro de un holding
Miembro desde
nov 2024
Mensaje
19
#16

guardado.

DDamla E***Veterano
Cargo
Agente de atención al cliente
Sector
Transporte
Tipo de organización
agencia boutique
Miembro desde
ago 2024
Mensaje
414
#17

Buen trabajo. Que la copia de seguridad sea accesible en la misma red y con la misma identidad la convierte en parte del objetivo.

Si el camino de la notificación es largo, la notificación no llega; una notificación que no llega significa un incidente detectado tarde. Corrijanme si me equivoco.

RRabia K***ParticipanteMiembro de la comunidad
Miembro desde
may 2022
Mensaje
16
#18

Yo también tengo curiosidad.

HHakan A***ExpertoMiembro de la comunidad
Miembro desde
ene 2024
Mensaje
3
#19

¿Creen que esto funciona a cualquier escala? Tomar notas durante dos semanas da mejores resultados que estimar seis meses.

Por supuesto, cambia si tu situación es diferente.

LLeyla P***ParticipanteMiembro de la comunidad
Miembro desde
oct 2022
Mensaje
2
#20

Buen trabajo.

Responder