Обход, индекс, ответ
Три этапа и что каждый делает с вашими страницами — включая то, где он останавливается.
HootyBot читает сайт
Ничего не загружается, пока кто-то не добавит сайт как источник в приложении. HootyBot не поисковый и не обучающий краулер: он не бродит по сети в поисках новых сайтов. Придя на сайт, он первым делом запрашивает /robots.txt и следует ему по RFC 9309, включая шаблоны * и $.
- По одной странице за раз на сайт, никогда параллельно, с паузой не меньше полусекунды. Crawl-delay учитывается.
- На 429 и 503 он отступает и соблюдает Retry-After буквально. Если вы просите долго ждать, он скорее откажется, чем вернётся раньше.
- Только HTML-страницы и ограниченное их число на сайт. Он не отправляет формы, не входит в аккаунты и не трогает корзины и оплату.
- Если /robots.txt отдаёт ошибку сервера, это не считается разрешением: обход сайта прекращается, пока файл снова не станет читаемым.
Hooty индексирует то, что вернулось
Текст прочитанных страниц становится материалом, которым ассистенту разрешено пользоваться. Того, что вы запретили, в нём нет. Того, что не удалось загрузить, в нём нет. И ничего со стороны в нём нет.
Страницы не используются для обучения моделей.
Ассистент отвечает по этому материалу
Посетитель спрашивает своими словами, а не угадывает ключевые слова. Ответ собирается из проиндексированных страниц и называет те, на которые опирается, — его можно сверить с источником.
Если материал не отвечает на вопрос, посетителю так и говорят. Hooty не заполняет пробел.
Когда обход ничего не читает
Честный список отказов — в том порядке, в каком они встречаются.
Защита от ботов не пускает краулер
Самый частый случай. WAF или анти-DDoS выдаёт HootyBot проверку, а краулер не выполняет JavaScript: он не может пройти браузерную проверку или решить капчу — и не пытается. Страницу-проверку, отданную со статусом 200, он выбрасывает, а не сохраняет как содержимое. Там, где продукт удаётся распознать, Hooty называет его в тексте ошибки.
Как пропустить HootyBot через защиту от ботовСтраница собирается в браузере
Если сервер отдаёт пустую оболочку, а текст появляется только после выполнения JavaScript, читать там нечего. Краулеру нужен HTML, отрендеренный на сервере, или предварительно отрендеренная копия.
robots.txt запрещает эти страницы
Запрет соблюдается — в том числе тот, о котором уже никто не помнит. Если раздел должен быть доступен, откройте его для HootyBot.
Сайт не ответил
Ответа нет вовсе. HootyBot прекращает попытки, а не стучится в стену.
Как его остановить
Две строки в robots.txt — и HootyBot останавливается:
User-agent: HootyBot
Disallow: /Чтобы закрыть только один раздел:
User-agent: HootyBot
Disallow: /internal/Изменения вступают в силу в течение часа. Если нужно быстрее, напишите на bot@hooty.to. Мы отвечаем тем, кто ведёт сайты, которые мы читаем.
Написать о краулереПосмотрите, на что могут ответить ваши страницы
Добавьте сайт в приложении и дайте HootyBot его прочитать.