El robots.txt no es un candado: los 3 bots de OpenAI y quién decide que ChatGPT te cite
OpenAI documentó que su bot de fetch puede ignorar robots.txt, y que el que decide tus citas es OAI-SearchBot. Cómo armar tu política de crawlers de IA sin desaparecer de ChatGPT.
El robots.txt no es un candado: los 3 bots de OpenAI y quién decide que ChatGPT te cite
OpenAI documentó que robots.txt puede no aplicar al bot que ChatGPT usa para abrir páginas en vivo, y que el agente que decide si tu sitio aparece citado en ChatGPT Search es otro: OAI-SearchBot, con su propio token y sus propias reglas. Bloquear los tres bots de OpenAI para "frenar el tráfico de IA" no te hace invisible: te saca de las citas, que es justo la visibilidad que importa cuando el tráfico llega desde respuestas generadas. Acá está lo que dice la documentación, por qué tu robots.txt no es un candado y la política de acceso que usamos en las auditorías GEO de Mintec.
Qué cambió el 14 de agosto
El 14 de agosto Search Engine Journal reportó algo que muchos dimos por sabido hasta que leímos la letra chica: según la documentación de OpenAI, robots.txt puede no aplicar al bot de fetch de ChatGPT, y el agente responsable de que tu sitio aparezca en los resultados de búsqueda de ChatGPT se llama OAI-SearchBot, no ChatGPT-User.
OpenAI opera tres bots con funciones distintas, cada uno con su propio token de robots.txt:
| Bot | Para qué sirve | Qué controlás en tu robots.txt |
|---|---|---|
| GPTBot | Entrena los modelos de OpenAI | Si tu contenido se usa para training |
| OAI-SearchBot | Construye el índice de búsqueda de ChatGPT | Si aparecés citado en las respuestas |
| ChatGPT-User | Abre una página en vivo cuando un usuario hace clic en una cita | Casi nada, y ahí está el problema |
Los ajustes son independientes: podés permitir OAI-SearchBot para aparecer en resultados y bloquear GPTBot para que tu contenido no se use en training. La documentación también aclara que cuando cambiás robots.txt, el índice de búsqueda puede tardar unas 24 horas en reflejarlo.
Por qué tu robots.txt no es un candado
Robots.txt es parte del Robots Exclusion Protocol, formalizado como RFC 9309, y el protocolo es voluntario: documenta una convención, no la impone. Nada impide físicamente que un bot la ignore.
Y los bots de IA la ignoran cada vez más. Datos que circularon en la cobertura de esta semana: el 13% de las peticiones de bots de IA saltaron robots.txt en el cuarto trimestre de 2025, un 400% más que en el segundo, y Cloudflare llegó a quitarle la verificación a Perplexity después de detectar que se hacía pasar por un navegador Chrome. Los que respetan, respetan; los que no, no avisan.
El punto fino de la nota de SEJ es otro. Los sitios que bloquean a la vez OAI-SearchBot y ChatGPT-User para "prevenir tráfico de IA" renuncian a la mitad de visibilidad del trato y conservan un control que tiene una excepción: el fetch en vivo de ChatGPT-User, que es una acción iniciada por el usuario, no un crawl automatizado. En la práctica, el control que creías tener no protege lo que querías proteger.
Y hay una capa que ni siquiera aparece en tu robots.txt: Cloudflare movió sus controles de crawlers a la capa de red. Si activaste el toggle "Block AI Bots", eso pisa lo que diga tu archivo, incluido el Allow de OAI-SearchBot.
La asimetría entre motores también importa. Google mantiene su línea histórica: Googlebot respeta robots.txt y Google-Extended controla el uso de tu contenido para entrenar Gemini, sin excepciones documentadas para el fetch en vivo de AI Mode. OpenAI, en cambio, documenta la excepción. Perplexity tiene el historial más turbio de los tres, con episodios de crawlers haciéndose pasar por navegadores. Tu robots.txt no tiene un solo comportamiento: tiene uno por motor, y la política que armes tiene que asumir que algunos lo van a respetar al pie de la letra y otros lo van a negociar.
La matriz de acceso que usamos en las auditorías GEO
En Mintec, cuando auditamos un sitio para búsqueda generativa, el primer hallazgo casi nunca es de contenido: es de configuración. Sitios que bloquearon "todos los bots de IA" con un robots.txt genérico o con el toggle de Cloudflare, y después se preguntan por qué no aparecen en ChatGPT mientras sus competidores sí. La decisión no es binaria, son cuatro estrategias:
1. Bloquear todo (Disallow a GPTBot, OAI-SearchBot y ChatGPT-User). Desaparecés de ChatGPT Search y del training. Solo tiene sentido si no querés nada de tráfico de IA, y aun así no es garantía: los fetch en vivo de usuarios pueden llegar igual.
2. Citas sí, training no (la que recomendamos). Permitís OAI-SearchBot y ChatGPT-User, bloqueás GPTBot. Es la configuración por defecto para la mayoría de los sitios de empresas:
User-agent: GPTBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: /
3. Training sí, citas no. El caso raro: sitios que quieren vender acceso a su contenido para entrenar modelos. Si no tenés un acuerdo de licenciamiento firmado, no hagas esto.
4. Permitir todo. Máximo alcance, cero control. Para sitios que viven de la visibilidad y no tienen contenido propietario que proteger, es una opción legítima.
La regla que nos llevamos de cada auditoría: primero decidí si querés citas, después decidí sobre el training. Son dos decisiones, no una.
Y una nota sobre quién decide estos bloqueos: casi siempre es un equipo de infraestructura o seguridad que ve en los bots de IA una amenaza de scraping y aplica el bloqueo más amplio disponible, sin consultar al equipo que mide resultados. El resultado es una decisión de visibilidad tomada por quien no mide visibilidad. Si en tu empresa el robots.txt lo toca IT, esta nota es para pasársela antes de que el toggle gane por defecto.
Lo que ya estamos viendo en nuestros números
En nuestro reporte semanal de tráfico GEO venimos midiendo los referidos de LLM desde hace meses: sesiones chicas, decenas por semana, pero que convierten varias veces mejor que el orgánico. Lo nuevo es la separación entre citas y visitas: páginas que ChatGPT cita sin que el usuario entre, y que no aparecen en GA4 pero sí en el informe de IA de Search Console.
Esa separación cambia el cálculo del robots.txt. Cuando el tráfico era solo clics, bloquear un crawler era gratis. Ahora cada bloqueo es una decisión sobre citas futuras: si bloqueás OAI-SearchBot, no perdés visitas que ya tenías, perdés la chance de ser citado en respuestas que todavía no existen. Es la misma lógica de nuestro trabajo con crawlers que no ejecutan JavaScript: primero asegurate de que te puedan leer, después discutí las condiciones.
El mismo principio aplica a llms.txt: no es un archivo de bloqueo, es un archivo de presentación. Mientras robots.txt dice lo que no querés que lean, llms.txt dice lo que sí querés que lean y cómo citarlo. Bloquear todos los bots de IA y después publicar un llms.txt es contradictorio: le estás cerrando la puerta y dejando la ventana abierta de par en par.
Checklist para esta semana
- Abrí tu robots.txt y listá qué user-agents de IA están bloqueados. Si tenés un bloqueo genérico de "AI bots", probablemente incluya a OAI-SearchBot.
- Revisá Cloudflare o tu WAF: si el toggle "Block AI Bots" está activo, pisa tu robots.txt.
- Tomá la decisión explícita: ¿querés aparecer citado en ChatGPT? Si la respuesta es sí, Allow para OAI-SearchBot y ChatGPT-User.
- Verificá en los server logs qué bots llegan de verdad. robots.txt muestra lo que pediste; los logs muestran lo que pasó.
- Medí con el informe de IA de Search Console durante dos semanas antes y después del cambio, y comparalo con el perfil de citas de cada motor.
El robots.txt no es un candado, es una carta de preferencia. OpenAI la lee, la respeta en parte, y ahora documenta sus excepciones. Lo único que sigue siendo decisión tuya es si querés estar en la conversación. Nosotros ya sabemos cuál es nuestra respuesta: la cita es la nueva moneda, y conseguir que ChatGPT te cite empieza por no bloquearte a vos mismo.
Preguntas Frecuentes
¿El robots.txt bloquea que ChatGPT cite mi sitio?
No directamente. El bot que decide si tu sitio aparece citado en ChatGPT Search es OAI-SearchBot, que tiene su propio token y sus propias reglas. Bloquear solo GPTBot no afecta las citas, y el fetch en vivo de ChatGPT-User puede ocurrir aunque lo bloquees, porque es una acción iniciada por el usuario, no un crawl automatizado.
¿Debo bloquear GPTBot?
Solo si no querés que tu contenido se use para entrenar modelos de OpenAI. Es una decisión independiente de las citas: podés bloquear GPTBot y permitir OAI-SearchBot al mismo tiempo, porque OpenAI los trata como crawlers separados.
¿Cómo permito citas pero bloqueo el training?
En tu robots.txt: Allow para OAI-SearchBot y ChatGPT-User, Disallow para GPTBot. Y revisá que el toggle 'Block AI Bots' de Cloudflare no esté activo, porque ese control se aplica en la capa de red y pisa lo que diga tu robots.txt.



