Rastrear, indexar, responder
Tres etapas y lo que cada una hace con tus páginas, incluido dónde se detiene.
HootyBot lee el sitio
No se descarga nada hasta que alguien añade un sitio como fuente en la app. HootyBot no es un rastreador de búsqueda ni de entrenamiento: no recorre la web buscando sitios nuevos. Cuando visita, pide /robots.txt antes que nada y lo cumple según la RFC 9309, incluidos los patrones * y $.
- Una página cada vez por sitio, nunca en paralelo, con al menos medio segundo de separación. Respeta Crawl-delay.
- Se retira ante un 429 o un 503 y cumple Retry-After al pie de la letra. Si pides una espera larga, prefiere rendirse a volver antes de tiempo.
- Solo páginas HTML, y un número limitado por sitio. Nunca envía formularios, ni inicia sesión, ni toca carritos o pagos.
- Si /robots.txt devuelve un error de servidor, no lo toma como permiso: deja de rastrear el sitio hasta que el archivo se pueda leer de nuevo.
Hooty indexa lo que ha llegado
El texto de las páginas que se han podido leer se convierte en el material que el asistente puede usar. Lo que has bloqueado no está. Lo que no se pudo descargar no está. Y nada de fuera está.
Las páginas no se usan para entrenar modelos.
El asistente responde con ese material
El visitante pregunta con sus propias palabras en lugar de adivinar palabras clave. La respuesta se compone a partir de las páginas indexadas y nombra las que ha utilizado, para poder contrastarla con la fuente.
Si el material no cubre la pregunta, eso es lo que se le dice al visitante. Hooty no rellena el hueco.
Cuando un rastreo no lee nada
Los fallos reales, en el orden en que sueles encontrarlos.
La protección contra bots rechaza al rastreador
El caso más frecuente. Un WAF o un servicio anti-DDoS le pone una prueba a HootyBot, y el rastreador no ejecuta JavaScript: no puede superar una comprobación de navegador ni resolver un captcha, y tampoco lo intenta. Una prueba servida con estado 200 se descarta en vez de guardarse como contenido. Cuando Hooty reconoce el producto, lo nombra en el error.
Permitir HootyBot en la protección contra botsLa página se arma en el navegador
Si tu servidor envía una cáscara vacía y el texto solo aparece después de ejecutar JavaScript, ahí no hay nada que leer. El rastreador necesita HTML renderizado en el servidor, o una copia prerrenderizada.
robots.txt no permite esas páginas
Un disallow se cumple, incluso uno que nadie recuerda haber escrito. Si una sección debe ser legible, permite el acceso a HootyBot.
El sitio no contestó
Ninguna respuesta. HootyBot se detiene en lugar de insistir contra un muro.
Cómo detenerlo
Dos líneas en robots.txt y HootyBot para:
User-agent: HootyBot
Disallow: /Para dejarlo fuera de una sola sección:
User-agent: HootyBot
Disallow: /internal/Los cambios surten efecto en menos de una hora. Si necesitas que pare antes, escribe a bot@hooty.to. Respondemos a quienes llevan los sitios que leemos.
Escribir sobre el rastreadorMira qué pueden responder tus propias páginas
Añade un sitio en la app y deja que HootyBot lo lea.