forumApri un argomento

Abbiamo provato a beccare il traffico bot con un honeypot sul sito — possiamo fidarci dei risultati e cosa dovremmo fare?

SSultan A***Partecipante
Ruolo
QA Engineer
Settore
Trasporti
Tipo di organizzazione
Azienda da 300 dipendenti
Iscrizione
ago 2025
Messaggio
143

Doki · Consulenza conformità KVKK · 2023

#1

Gestiamo un e-commerce B2B con catalogo di ricambi. Abbiamo circa 4.000 visitatori unici e circa 25.000 visualizzazioni di pagina al giorno. Negli ultimi due mesi i costi del server sono schizzati da 4.500 TL a 11.000 TL. Analizzando i log abbiamo notato bot sospetti che fanno continuamente scraping di prezzi e disponibilità a magazzino. Come soluzione abbiamo inserito una trappola honeypot: un link finto nascosto tramite CSS nel form di contatto e a fondo pagina.

In tre settimane di test abbiamo registrato 1.400 IP diversi che hanno cliccato su queste aree nascoste o compilato il form. Guardando la lista, però, sembra che nella trappola siano finiti anche alcuni IP di proxy aziendali, scanner di sicurezza aziendali e persino bot di cache dei motori di ricerca.

Abbiamo paura che fidandoci di questi log dell'honeypot e bloccando direttamente gli IP dal firewall rischiamo di perdere clienti veri o la visibilità SEO. Qual è il metodo giusto per filtrare questo traffico bot catturato, isolare i rischi effettivi e prendere contromisure sicure?

ÖÖzgür G***Partecipante
Ruolo
Sviluppatore software
Settore
Cosmetica
Tipo di organizzazione
Team di 8 persone
Iscrizione
giu 2023
Messaggio
16
Più utile#2

Risposta breve: bloccare direttamente e in modo definitivo gli IP che cadono nella trappola honeypot non è l'approccio corretto. I campi nascosti possono essere intercettati anche da server proxy aziendali, screen reader per ipovedenti o normali crawler dei motori di ricerca. Per questo, anziché bannare all'istante le richieste catturate, dovreste sottoporle a un filtro di verifica graduale.

Per fare una cernita sicura dovreste seguire questi passaggi: 1) In primo luogo, fate una query DNS inversa (rDNS) per verificare se l'indirizzo IP appartiene a motori di ricerca noti e legittimi. 2) Anziché bloccare subito l'indirizzo caduto nella trappola, inseritelo semplicemente in una lista di sospetti e mostrate un leggero controllo Javascript alle richieste successive da quell'IP. 3) Dato che gli IP degli utenti reali cambiano continuamente per via dei pool dinamici, se proprio dovete bloccare, non fatelo in modo permanente ma limitatevi a blocchi temporanei di 15 minuti o 1 ora. In questo modo evitate di tagliare fuori utenti innocenti che condividono lo stesso pool di IP.

I bot di scraping che vi fanno salire i costi hanno di solito una frequenza di scansione specifica. Anziché limitarvi a guardare il clic sull'honeypot, applicate un rate limiting agli indirizzi che richiedono più di 50 pagine al minuto. Così proteggerete le risorse del server senza mettere a rischio i clienti veri o l'indicizzazione sui motori di ricerca.

TTolga K***Partecipante
Ruolo
IT Manager
Settore
E-commerce
Tipo di organizzazione
azienda all'interno di un gruppo
Iscrizione
lug 2024
Messaggio
76
#3

Se per nascondere il campo via CSS avete usato solo display: none o visibility: hidden, i bot moderni leggono il foglio di stile, lo capiscono e lo evitano. Vi restano dentro solo bot primitivi o software di accessibilità. Spostare l'area nascosta fuori dallo schermo (con text-indent o absolute positioning) e aggiungere l'attributo aria-hidden riduce drasticamente i falsi positivi.

EEsra A***Partecipante
Ruolo
Tecnico di assistenza
Settore
Servizi sanitari
Tipo di organizzazione
Azienda da 120 dipendenti
Iscrizione
dic 2025
Messaggio
9
#4

L'anno scorso avevamo impostato un honeypot simile. Analizzando uno per uno i primi 800 IP catturati, abbiamo scoperto che 120 erano IP di uscita condivisi di nostri grandi clienti corporate. Se quel giorno avessimo bannato tutto all'ingrosso, avremmo tagliato fuori dal sito i tre concessionari che ci facevano più ordini in assoluto.

edit: ho scritto da telefono, scusate gli errori di battitura.

RRabia B***EspertoMembro della community
Iscrizione
mar 2025
Messaggio
232
#5

Il metodo honeypot da solo ormai non ferma più gli scraper. I tool professionali per estrarre i prezzi usano veri e propri browser headless e cliccano solo sui bottoni effettivamente visibili a schermo. I 1.400 IP che avete beccato sono probabilmente traffico spazzatura che scansiona il web a caso, i bot che vi rubano davvero i dati magari non ci sono nemmeno passati sopra.

AAylinPartecipante
Ruolo
CRM ed email
Tipo di organizzazione
Azienda da 300 dipendenti
Iscrizione
giu 2024
Messaggio
118
#6

Invece di restituire subito un 403 Forbidden, mostrate una Javascript challenge a livello di server agli IP che finiscono nella trappola. Se è un umano, il browser la risolve in un decimo di secondo ed entra nel sito. Se è un semplice scraper in Python o cURL non potendo eseguire JS sbatte contro un muro e smette di appesantire il server.

PPerihan M***PartecipanteMembro della community
Iscrizione
apr 2024
Messaggio
83
#7

Calma e non mettetevi assolutamente a fare ban di massa a livello di IP. In Turchia l'uso del CGNAT è diffusissimo: se bannate un singolo IP bot da un pool dinamico rischiate di bloccare contemporaneamente centinaia di normali utenti da casa o dall'ufficio. Valutate il comportamento sospetto in base alla sessione, non all'IP.

correzione: mi ricordavo male il numero, era un po' più basso.

EEsra K***PartecipanteMembro della community
Iscrizione
feb 2023
Messaggio
3
#8

è successo pure a noi con un bot di un motore di ricerca, stavamo x perdere tutte le pagine indicizzate.... mai mettere regole di blocco sul server senza prima fare il controllo rdns

LLale A***Partecipante
Ruolo
Capocantiere
Settore
Servizi IT
Tipo di organizzazione
cooperativa
Iscrizione
lug 2023
Messaggio
86
#9

Il link nascosto a fondo pagina aveva il tag rel="nofollow" ed era impostato come disallowed nel robots.txt? Se non l'avete inserito nel robots.txt, è normalissimo che i crawler dei motori di ricerca lo seguano.

YYasemin Y***PartecipanteMembro della community
Iscrizione
ott 2023
Messaggio
3
#10

Più che aggiungere campi invisibili al form honeypot, mettete un controllo sul timestamp: se il form viene inviato in meno di 2 secondi la probabilità che sia un bot è molto più netta e facile da isolare.

RRıdvan K***PartecipanteMembro della community
Iscrizione
ott 2024
Messaggio
2
#11

Concordo pienamente. Se cerchi di cambiare tutto insieme, niente si stabilizza.

Buon lavoro.

GGürkan Y***Partecipante
Ruolo
Specialista risorse umane
Settore
Chimica
Tipo di organizzazione
distributore di zona
Iscrizione
mag 2023
Messaggio
234
#12

Grazie mille, era la risposta che cercavo.

HHande B***Partecipante
Ruolo
Direttore operativo
Settore
Sport e fitness
Tipo di organizzazione
boutique agency
Iscrizione
giu 2023
Messaggio
353
#13

L'anno scorso abbiamo vissuto quasi la stessa cosa. Le decisioni affrettate diventano decisioni da correggere sei mesi dopo.

Non fidatevi di una sola misura di sicurezza; procedete per livelli. Buon lavoro.

HHalil K***Partecipante
Ruolo
Direttore clinico
Settore
Prodotti ittici
Tipo di organizzazione
media impresa
Iscrizione
mag 2024
Messaggio
208

Doki · Design interfaccia · 2026

#14

Ha ragione.

LLevent U***PartecipanteMembro della community
Iscrizione
mar 2022
Messaggio
270
#15

Sono d'accordo anzi vorrei sottolinearlo. Quando prendi una decisione, guarda prima quali dati hai a disposizione.

Correggetemi se sbaglio.

DDilekNuovo membro
Ruolo
Pasticceria
Tipo di organizzazione
azienda all'interno di un gruppo
Iscrizione
nov 2024
Messaggio
19
#16

salvato.

DDamla E***Veteran
Ruolo
Addetto al servizio clienti
Settore
Trasporti
Tipo di organizzazione
boutique agency
Iscrizione
ago 2024
Messaggio
414
#17

Ottimo lavoro. Avere il backup accessibile sulla stessa rete e con le stesse credenziali lo rende parte del bersaglio.

Se il percorso di notifica è lungo, la notifica non arriva; una notifica mancante significa un evento scoperto tardi. Correggetemi se sbaglio.

RRabia K***PartecipanteMembro della community
Iscrizione
mag 2022
Messaggio
16
#18

Mi chiedo anch'io.

HHakan A***EspertoMembro della community
Iscrizione
gen 2024
Messaggio
3
#19

Secondo voi funziona a tutte le scale? Prendere appunti per due settimane dà risultati migliori rispetto a una stima di sei mesi.

Naturalmente cambia se la vostra situazione è diversa.

LLeyla P***PartecipanteMembro della community
Iscrizione
ott 2022
Messaggio
2
#20

Ottimo lavoro.

Rispondi