forumNouveau sujet

On a essayé de piéger le trafic bot sur notre site avec un honeypot — peut-on se fier aux résultats et qu'est-ce qu'on doit faire ?

SSultan A***Membre actif
Poste
Expert en test
Secteur
Transport
Type d'organisation
Entreprise de 300 personnes
Membre depuis
août 2025
Message
143

Doki · Conseil en conformité RGPD · 2023

#1

On a un site e-commerce qui propose un catalogue de pièces détachées B2B. On a environ 4 000 visiteurs uniques par jour et à peu près 25 000 pages vues. Depuis deux mois, nos coûts serveur ont explosé, passant de 4 500 TL à 11 000 TL. En examinant les logs, on a repéré des bots suspects qui scrapent en permanence les prix des produits et les stocks. Comme solution, on a mis un faux lien caché en CSS dans le formulaire de contact et en bas de page, autrement dit un piège honeypot.

Sur trois semaines de test, on a loggé 1 400 adresses IP différentes qui ont cliqué sur ces champs cachés ou rempli le formulaire. Mais quand je regarde la liste, certaines IP de proxy d'entreprise, les scanners de sécurité des boîtes et même les bots de cache des moteurs de recherche semblent être tombés dans le piège.

Si on se fie à ces logs honeypot et qu'on bloque directement les IP au niveau du pare-feu, on a peur de perdre de vrais clients ou notre visibilité SEO. Quelle est la bonne méthode pour filtrer ce trafic bot capturé, trier ceux qui représentent un vrai risque et agir de façon sûre ?

ÖÖzgür G***Membre actif
Poste
Développeur logiciel
Secteur
Cosmétique
Type d'organisation
Équipe de 8 personnes
Membre depuis
juin 2023
Message
16
Plus utile#2

Réponse courte : bloquer définitivement et directement les IP tombées dans le piège honeypot n'est pas une bonne approche. Les serveurs proxy d'entreprise, les lecteurs d'écran conçus pour les malvoyants ou les crawlers légitimes des moteurs de recherche peuvent aussi toucher les champs cachés de la page. Donc au lieu de bannir immédiatement les requêtes capturées, vous devez les faire passer par un filtre de vérification progressif.

Pour faire un tri sûr, suivez ces étapes : 1) Dans un premier temps, faites une requête DNS inverse pour vérifier si l'adresse IP appartient à des moteurs de recherche légitimes connus. 2) Au lieu de bloquer directement l'adresse tombée dans le piège, mettez-la juste dans une liste suspecte et imposez un léger challenge Javascript aux requêtes suivantes venant de cette IP. 3) Comme les IP des vrais utilisateurs changent en permanence à cause des pools internet dynamiques, si vous bloquez, limitez ça à des durées temporaires de 15 minutes ou 1 heure, pas de façon permanente. Ainsi vous n'excluez pas les utilisateurs innocents qui partagent le même pool d'IP.

Les bots de scraping qui font grimper vos coûts ont généralement une fréquence de crawl précise. Plutôt que de regarder uniquement le clic honeypot, soumettez à une limitation de débit les adresses qui demandent plus de 50 pages par minute. Ainsi vous protégez vos ressources serveur sans risquer vos vrais clients ni vos index de moteurs de recherche.

TTolga K***Membre actif
Poste
Directeur des systèmes d'information
Secteur
E-commerce
Type d'organisation
filiale d'un groupe
Membre depuis
juil. 2024
Message
76
#3

Si côté CSS vous avez caché avec juste display: none ou visibility: hidden, les bots modernes le comprennent déjà en lisant le fichier de style et passent outre. Il ne reste alors que des bots très primitifs ou des logiciels d'accessibilité. Pousser le champ caché hors écran (avec text-indent ou position absolute) et ajouter l'attribut aria-hidden réduit nettement les faux positifs.

EEsra A***Membre actif
Poste
Technicien de maintenance
Secteur
Services de santé
Type d'organisation
Entreprise de 120 personnes
Membre depuis
déc. 2025
Message
9
#4

On avait installé un honeypot sur une structure similaire l'an dernier. En examinant une par une les 800 premières IP capturées, on a vu que 120 d'entre elles étaient l'IP de sortie internet commune de nos gros clients entreprise. Si on avait banni en masse ce jour-là, on aurait complètement coupé du site nos trois revendeurs qui commandent le plus.

edit : j'ai écrit depuis mon téléphone, désolé pour les fautes.

RRabia B***ExpertMembre de la communauté
Membre depuis
mars 2025
Message
232
#5

La méthode honeypot ne peut plus arrêter à elle seule les scrapers de contenu. Les outils de scraping pro qui récupèrent les prix font tourner des navigateurs headless complets et ne cliquent que sur les boutons réellement visibles à l'écran. Les 1 400 IP que vous avez capturées sont probablement du bruit inoffensif qui scanne internet au hasard, les bots qui pompent vraiment vos données n'ont peut-être même jamais touché ce piège.

AAylinMembre actif
Poste
CRM et e-mail
Type d'organisation
Entreprise de 300 personnes
Membre depuis
juin 2024
Message
118
#6

Au lieu de renvoyer directement un 403 Forbidden, affichez un challenge Javascript au niveau serveur aux IP qui tombent dans le piège. Si c'est un vrai humain, le navigateur le résout en un dixième de seconde et entre sur le site. Si c'est un scraper basique en python ou curl, il ne peut pas exécuter le Javascript, se casse les dents et arrête de fatiguer votre serveur.

PPerihan M***Membre actifMembre de la communauté
Membre depuis
avr. 2024
Message
83
#7

Calmez-vous et n'allez surtout pas bannir en masse au niveau IP. L'usage du CGNAT est très répandu en Turquie, quand vous bannissez une seule IP de bot issue d'un pool dynamique, vous pouvez exclure en même temps des centaines d'utilisateurs innocents chez eux ou au bureau. Évaluez le comportement suspect selon le comportement de session, pas selon l'IP.

Correction : je me suis trompé sur le chiffre, c'était un peu plus bas.

EEsra K***Membre actifMembre de la communauté
Membre depuis
févr. 2023
Message
3
#8

nous aussi on a eu un bot de moteur de recherche qui s'est coincé nos index ont failli être supprimés ne mettez jamais de règle de blocage sur le serveur sans vérif rdns obligatoire

LLale A***Membre actif
Poste
Chef de chantier
Secteur
Services informatiques
Type d'organisation
coopérative
Membre depuis
juil. 2023
Message
86
#9

Le lien caché que vous avez mis en bas de page avait-il l'attribut rel="nofollow" et avez-vous défini cette adresse en disallowed dans le fichier robots.txt ? Si vous ne l'avez pas ajoutée au robots.txt, il est tout à fait normal que les crawlers des moteurs de recherche suivent ce lien.

YYasemin Y***Membre actifMembre de la communauté
Membre depuis
oct. 2023
Message
3
#10

Au lieu d'ajouter un champ invisible au formulaire honeypot, mettez un contrôle d'horodatage ; les requêtes qui remplissent le formulaire en moins de 2 secondes se distinguent beaucoup plus clairement comme bots.

RRıdvan K***Membre actifMembre de la communauté
Membre depuis
oct. 2024
Message
2
#11

Je suis entièrement d'accord. Quand on essaie de tout changer en même temps rien ne prend.

Bon courage.

GGürkan Y***Membre actif
Poste
Chargé de ressources humaines
Secteur
Chimie
Type d'organisation
distributeur régional
Membre depuis
mai 2023
Message
234
#12

Merci, c'était exactement la réponse que je cherchais.

HHande B***Membre actif
Poste
Directeur des opérations
Secteur
Sport et fitness
Type d'organisation
agence boutique
Membre depuis
juin 2023
Message
353
#13

Nous avons vécu presque la même chose l'année dernière. Les décisions hâtives finissent par être corrigées six mois plus tard.

Ne comptez pas sur une seule mesure de sécurité ; allez par couches. Bon courage.

HHalil K***Membre actif
Poste
Directeur de clinique
Secteur
Produits de la mer
Type d'organisation
entreprise de taille moyenne
Membre depuis
mai 2024
Message
208

Doki · Design d'interface · 2026

#14

Vous avez raison.

LLevent U***Membre actifMembre de la communauté
Membre depuis
mars 2022
Message
270
#15

Je suis d'accord, j'aimerais même souligner ce point. Avant de décider regardez quelles données vous avez en main.

Corrigez-moi si je me trompe.

DDilekNouveau membre
Poste
Pâtisserie
Type d'organisation
filiale d'un groupe
Membre depuis
nov. 2024
Message
19
#16

enregistré.

DDamla E***Vétéran
Poste
Agent du service client
Secteur
Transport
Type d'organisation
agence boutique
Membre depuis
août 2024
Message
414
#17

Beau travail. Le fait que la sauvegarde soit accessible sur le même réseau et avec la même identité en fait une cible potentielle.

Si le chemin de notification est long, la notification n'arrive pas ; une notification manquante signifie un événement détecté tardivement. Corrigez-moi si je me trompe.

RRabia K***Membre actifMembre de la communauté
Membre depuis
mai 2022
Message
16
#18

Je me pose aussi la question.

HHakan A***ExpertMembre de la communauté
Membre depuis
janv. 2024
Message
3
#19

Pensez-vous que cela fonctionne à toutes les échelles ? Prendre des notes pendant deux semaines donne de meilleurs résultats qu'une estimation de six mois.

Bien sûr cela change si votre situation est différente.

LLeyla P***Membre actifMembre de la communauté
Membre depuis
oct. 2022
Message
2
#20

Beau travail.

Répondre