Crawlen, indexieren, antworten
Drei Schritte und was jeder mit Ihren Seiten macht — auch, wo er aufhört.
HootyBot liest die Website
Es wird nichts geholt, bevor jemand eine Website in der App als Quelle hinzufügt. HootyBot ist kein Such- oder Trainings-Crawler: er streift nicht durchs Web auf der Suche nach neuen Websites. Wenn er kommt, holt er zuerst /robots.txt und befolgt sie gemäß RFC 9309, samt der Muster * und $.
- Eine Seite pro Website zur Zeit, nie parallel, mindestens eine halbe Sekunde Abstand. Crawl-delay wird beachtet.
- Bei 429 und 503 wartet er und hält Retry-After exakt ein. Verlangen Sie eine lange Wartezeit, gibt er lieber auf, als früher wiederzukommen.
- Nur HTML-Seiten, und nur eine begrenzte Zahl pro Website. Er sendet keine Formulare, meldet sich nicht an und rührt keine Warenkörbe oder Kassen an.
- Liefert /robots.txt einen Serverfehler, nimmt er das nicht als Erlaubnis — er hört ganz auf zu crawlen, bis die Datei wieder lesbar ist.
Hooty indexiert, was zurückkam
Der Text der gelesenen Seiten wird zum Material, das der Assistent verwenden darf. Was Sie verboten haben, ist nicht darin. Was nicht abrufbar war, ist nicht darin. Und nichts von anderswo ist darin.
Die Seiten werden nicht zum Training von Modellen verwendet.
Der Assistent antwortet aus diesem Material
Ein Besucher stellt seine Frage in eigenen Worten, statt Stichwörter zu raten. Die Antwort entsteht aus den indexierten Seiten und nennt die verwendeten, damit sie an der Quelle geprüft werden kann.
Deckt das Material die Frage nicht ab, bekommt der Besucher genau das zu hören. Hooty füllt die Lücke nicht.
Wenn ein Crawl nichts liest
Die echten Fehlerfälle, in der Reihenfolge, in der sie vorkommen.
Der Bot-Schutz weist den Crawler ab
Der häufigste Fall. Eine WAF oder ein Anti-DDoS-Dienst stellt HootyBot eine Aufgabe, und der Crawler führt kein JavaScript aus — er kann eine Browserprüfung nicht bestehen und kein Captcha lösen, und er versucht es auch nicht. Eine mit Status 200 ausgelieferte Challenge wird verworfen statt als Inhalt gespeichert. Wo Hooty das Produkt erkennt, nennt es dessen Namen im Fehler.
HootyBot durch den Bot-Schutz lassenDie Seite entsteht erst im Browser
Wenn Ihr Server nur eine leere Hülle ausliefert und der Text erst nach dem JavaScript erscheint, gibt es darin nichts zu lesen. Der Crawler braucht serverseitig gerendertes HTML oder eine vorgerenderte Kopie.
robots.txt verbietet die Seiten
Ein Disallow wird befolgt, auch eines, an das sich niemand mehr erinnert. Soll ein Bereich lesbar sein, erlauben Sie HootyBot den Zugriff darauf.
Die Website hat nicht geantwortet
Gar keine Antwort. HootyBot hört auf, statt gegen eine Wand weiterzuversuchen.
Ihn stoppen
Zwei Zeilen in robots.txt, und HootyBot hört auf:
User-agent: HootyBot
Disallow: /Nur einen Bereich aussparen:
User-agent: HootyBot
Disallow: /internal/Änderungen wirken innerhalb einer Stunde. Muss es schneller gehen, schreiben Sie an bot@hooty.to. Wir antworten den Leuten, deren Websites wir lesen.
Zum Crawler schreibenSehen, was Ihre eigenen Seiten beantworten können
Fügen Sie in der App eine Website hinzu und lassen Sie HootyBot sie lesen.