Перейти к содержимому
Как это работает

Обход, индекс, ответ

Три этапа и что каждый делает с вашими страницами — включая то, где он останавливается.

Этап 1

HootyBot читает сайт

Ничего не загружается, пока кто-то не добавит сайт как источник в приложении. HootyBot не поисковый и не обучающий краулер: он не бродит по сети в поисках новых сайтов. Придя на сайт, он первым делом запрашивает /robots.txt и следует ему по RFC 9309, включая шаблоны * и $.

  • По одной странице за раз на сайт, никогда параллельно, с паузой не меньше полусекунды. Crawl-delay учитывается.
  • На 429 и 503 он отступает и соблюдает Retry-After буквально. Если вы просите долго ждать, он скорее откажется, чем вернётся раньше.
  • Только HTML-страницы и ограниченное их число на сайт. Он не отправляет формы, не входит в аккаунты и не трогает корзины и оплату.
  • Если /robots.txt отдаёт ошибку сервера, это не считается разрешением: обход сайта прекращается, пока файл снова не станет читаемым.
HootyBot в документации
Этап 2

Hooty индексирует то, что вернулось

Текст прочитанных страниц становится материалом, которым ассистенту разрешено пользоваться. Того, что вы запретили, в нём нет. Того, что не удалось загрузить, в нём нет. И ничего со стороны в нём нет.

Страницы не используются для обучения моделей.

Этап 3

Ассистент отвечает по этому материалу

Посетитель спрашивает своими словами, а не угадывает ключевые слова. Ответ собирается из проиндексированных страниц и называет те, на которые опирается, — его можно сверить с источником.

Если материал не отвечает на вопрос, посетителю так и говорят. Hooty не заполняет пробел.

Ограничения

Когда обход ничего не читает

Честный список отказов — в том порядке, в каком они встречаются.

Защита от ботов не пускает краулер

Самый частый случай. WAF или анти-DDoS выдаёт HootyBot проверку, а краулер не выполняет JavaScript: он не может пройти браузерную проверку или решить капчу — и не пытается. Страницу-проверку, отданную со статусом 200, он выбрасывает, а не сохраняет как содержимое. Там, где продукт удаётся распознать, Hooty называет его в тексте ошибки.

Как пропустить HootyBot через защиту от ботов

Страница собирается в браузере

Если сервер отдаёт пустую оболочку, а текст появляется только после выполнения JavaScript, читать там нечего. Краулеру нужен HTML, отрендеренный на сервере, или предварительно отрендеренная копия.

robots.txt запрещает эти страницы

Запрет соблюдается — в том числе тот, о котором уже никто не помнит. Если раздел должен быть доступен, откройте его для HootyBot.

Сайт не ответил

Ответа нет вовсе. HootyBot прекращает попытки, а не стучится в стену.

Ваше решение

Как его остановить

Две строки в robots.txt — и HootyBot останавливается:

User-agent: HootyBot
Disallow: /

Чтобы закрыть только один раздел:

User-agent: HootyBot
Disallow: /internal/

Изменения вступают в силу в течение часа. Если нужно быстрее, напишите на bot@hooty.to. Мы отвечаем тем, кто ведёт сайты, которые мы читаем.

Написать о краулере

Посмотрите, на что могут ответить ваши страницы

Добавьте сайт в приложении и дайте HootyBot его прочитать.