Scansione, indice, risposta
Tre fasi e cosa fa ciascuna con le tue pagine, compreso dove si ferma.
HootyBot legge il sito
Non viene scaricato nulla finché qualcuno non aggiunge un sito come fonte nell’app. HootyBot non è un crawler di ricerca né di addestramento: non gira per il web in cerca di siti nuovi. Quando passa, chiede /robots.txt prima di ogni altra cosa e lo rispetta secondo la RFC 9309, inclusi i pattern * e $.
- Una pagina alla volta per sito, mai in parallelo, con almeno mezzo secondo di distanza. Rispetta Crawl-delay.
- Si ritira su 429 e 503 e rispetta Retry-After alla lettera. Se chiedi un’attesa lunga, rinuncia invece di tornare prima.
- Solo pagine HTML, e un numero limitato per sito. Non invia moduli, non effettua accessi, non tocca carrelli o checkout.
- Se /robots.txt restituisce un errore del server, non lo considera un permesso: smette di scansionare il sito finché il file non torna leggibile.
Hooty indicizza ciò che è tornato
Il testo delle pagine lette diventa il materiale che l’assistente può usare. Ciò che hai vietato non c’è. Ciò che non si è potuto scaricare non c’è. E non c’è niente che venga da altrove.
Le pagine non vengono usate per addestrare modelli.
L’assistente risponde con quel materiale
Il visitatore chiede con parole sue invece di indovinare le parole chiave. La risposta nasce dalle pagine indicizzate e cita quelle usate, così può essere verificata alla fonte.
Se il materiale non copre la domanda, è questo che il visitatore si sente dire. Hooty non riempie il vuoto.
Quando una scansione non legge nulla
I casi di fallimento veri, nell’ordine in cui capitano.
La protezione dai bot rifiuta il crawler
Il caso più frequente. Un WAF o un servizio anti-DDoS mette alla prova HootyBot, e il crawler non esegue JavaScript: non può superare un controllo del browser né risolvere un captcha, e non ci prova. Una challenge servita con stato 200 viene scartata invece che salvata come contenuto. Dove riconosce il prodotto, Hooty lo nomina nell’errore.
Consentire HootyBot nella protezione dai botLa pagina si costruisce nel browser
Se il tuo server manda un guscio vuoto e il testo compare solo dopo il JavaScript, lì non c’è niente da leggere. Al crawler serve HTML renderizzato dal server, oppure una copia prerenderizzata.
robots.txt vieta quelle pagine
Un disallow viene rispettato, anche uno che nessuno ricorda di aver scritto. Se una sezione deve essere leggibile, consenti l’accesso a HootyBot.
Il sito non ha risposto
Nessuna risposta. HootyBot si ferma invece di insistere contro un muro.
Come fermarlo
Due righe in robots.txt e HootyBot si ferma:
User-agent: HootyBot
Disallow: /Per tenerlo fuori da una sola sezione:
User-agent: HootyBot
Disallow: /internal/Le modifiche hanno effetto entro un’ora. Se serve prima, scrivi a bot@hooty.to. Rispondiamo a chi gestisce i siti che leggiamo.
Scrivere sul crawlerGuarda a cosa sanno rispondere le tue pagine
Aggiungi un sito nell’app e lascia che HootyBot lo legga.