Zum Inhalt springen

HootyBot

HootyBot ist der Webcrawler von hooty.to. Er liest öffentliche Seiten, damit der KI-Assistent einer Website Fragen aus deren Inhalten beantworten kann.

Wie Sie ihn erkennen

Jede Anfrage von HootyBot trägt diese Header:

User-Agent
Mozilla/5.0 (compatible; HootyBot/1.0; +https://hooty.to/bot)
From
bot@hooty.to

Das Produkt-Token für robots.txt lautet HootyBot. HootyBot gibt sich nie als Browser aus und verwendet nie einen anderen Namen.

Wann er vorbeikommt

HootyBot crawlt eine Website erst, nachdem jemand sie in hooty.to als Wissensquelle eingerichtet hat. Er ist kein allgemeiner Such- oder Trainings-Crawler: Er streift nicht durch das Web auf der Suche nach neuen Websites, und er verwendet die gelesenen Seiten nicht, um Modelle zu trainieren.

Wie er sich verhält

  • Er ruft zuerst /robots.txt ab und befolgt die Datei gemäß RFC 9309, einschließlich der Muster * und $.
  • Er beachtet Crawl-delay, wartet mindestens eine halbe Sekunde zwischen den Anfragen und ruft pro Website immer nur eine Seite gleichzeitig ab, nie parallel.
  • Bei 429 und 503 zieht er sich zurück und befolgt Retry-After exakt; er versucht es nie früher als von Ihnen verlangt. Verlangen Sie eine lange Wartezeit, gibt er lieber auf, als zu früh wiederzukommen.
  • Liefert /robots.txt einen Serverfehler, nimmt er keine Erlaubnis an. Er stellt das Crawlen der Website vollständig ein, bis die Datei wieder lesbar ist.
  • Antwortet Ihr Server nicht mehr, hört er auf, es zu versuchen, statt gegen eine Wand weiterzulaufen.
  • Er fordert nur HTML-Seiten an, folgt pro Website nur einer begrenzten Zahl davon und sendet nie Formulare ab, meldet sich nie an und rührt keine Warenkörbe oder Kassen an.
  • Er führt keine JavaScript-Prüfungen aus und versucht nicht, den Bot-Schutz zu umgehen. Blockiert Ihr Schutz ihn — auch bei einer Prüfseite mit Status 200 —, verwirft er die Seite und meldet die Blockade, statt die Prüfseite als Inhalt zu speichern.

HootyBot aussperren

Tragen Sie dies in Ihre robots.txt ein, und HootyBot hört auf:

User-agent: HootyBot
Disallow: /

Um ihn nur aus einem Bereich herauszuhalten:

User-agent: HootyBot
Disallow: /internal/

Änderungen greifen innerhalb einer Stunde. Soll er früher aufhören, schreiben Sie uns an bot@hooty.to.

HootyBot zulassen

Wenn Sie eine WAF oder einen Anti-Bot-Dienst einsetzen (Cloudflare, Qrator, DDoS-Guard und ähnliche), kann dieser HootyBot prüfen oder abweisen, selbst wenn Ihre robots.txt ihn erlaubt. Der Crawler führt kein JavaScript aus und kann eine Browserprüfung daher nicht bestehen. Damit Ihre eigene Website für Ihren Assistenten gelesen werden kann, setzen Sie den User Agent HootyBot in Ihren Schutzregeln auf die Positivliste. Schritt-für-Schritt-Anleitungen je Produkt finden Sie auf der Seite zum Freischalten.

Kontakt

Fragen, Beschwerden über die Crawl-Rate oder die Bitte aufzuhören: bot@hooty.to. Wir antworten den Menschen, die die Websites betreiben, die wir lesen.

hooty.to · Zuletzt aktualisiert am 26. Juli 2026