Casi dos tercios de 50 sitios auditados por Search Engine Journal dejan al azar qué bots de IA entran a su contenido. Semrush recuerda que ese rastreo es una de las cuatro vías con que la IA arma sus respuestas. Sumar presupuesto a roles de visibilidad en IA sin auditar ese acceso es gastar en la puerta equivocada.
La evidencia
Search Engine Journal auditó 50 sitios grandes de retail, SaaS, viajes, medios y finanzas (1 de septiembre de 2026) con un framework de tres capas: Retrievability (si la IA puede acceder y leer el contenido), Attribution and Meaning (si la IA entiende de qué trata cada página y a quién pertenece) y Agent Transaction and Discovery (si un agente de IA puede completar acciones en el sitio). El promedio en la primera capa fue 74,4%. En la segunda cayó a 38,5%. En la tercera, 2,1%. El hallazgo que sostiene esta nota: solo 5 de los 50 sitios implementaron el Content Signals Policy de Cloudflare, el mecanismo que permite decirle a cada bot exactamente qué puede hacer con el contenido (indexar, responder consultas en vivo o entrenar un modelo) en lugar de solo permitir o bloquear todo.
Importante: no todos los sitios con score bajo están descuidados. El estudio identifica a la BBC, CNN, The Guardian y Amazon bloqueando bots de IA a propósito, porque su negocio depende de que la gente visite el sitio en vez de leer un resumen. Ese es un bloqueo deliberado. El problema que describe esta nota es el otro: el bloqueo que nadie decidió y que nadie está midiendo.
Semrush explica en su blog (1 de septiembre de 2026) que existen cuatro vías por las que un sistema de IA obtiene información sobre una marca: el entrenamiento del modelo, el rastreo en vivo, las licencias con terceros y las acciones que el propio usuario le pide a la IA. La recomendación técnica que da para las dos primeras es concreta: "Allow AI crawlers to access your site. Check that your site's robots.txt file doesn't contain disallow rules telling crawlers like OpenAI's GPTBot not to collect AI training data from your site", según Semrush. Es la misma revisión que casi ninguno de los 50 sitios auditados formalizó.
La tercera nota cambia de plano: presupuesto, no infraestructura. Search Engine Journal relata (31 de agosto de 2026) el caso de una empresa de software que reorganizó 60.000 dólares mensuales de marketing: bajó el paid search de 30.000 a 24.000, mantuvo el contenido en 10.000 con menos piezas y más evidencia, y creó una línea nueva de 10.000 dólares para "el programa de búsqueda con IA", que cubre limpieza de entidad, datos estructurados y medición. La secuencia de 90 días que propone el artículo arranca probando 20 consultas de compra en cuatro asistentes para medir citas, no revisando si esos mismos asistentes pueden siquiera rastrear el sitio.
"Which line item owns whether ChatGPT recommends you? Nobody had an answer, because the answer was nobody." Search Engine Journal
| Vía por la que la IA obtiene información (Semrush) | ¿Depende del acceso técnico a tu sitio? | Qué revisar primero |
|---|---|---|
| Entrenamiento del modelo | Sí, en el próximo corte de entrenamiento | robots.txt sin disallow a GPTBot, ClaudeBot, Google-Extended |
| Rastreo en vivo (retrieval) | Sí, en tiempo real | Indexación en Search Console y Bing Webmaster Tools |
| Licencias con terceros (Reddit, Yelp, Time) | No depende de tu sitio | Presencia y menciones en esos terceros |
| Acciones del usuario (subir archivos, conectar herramientas) | No depende de tu sitio | No aplica |
La lectura entre líneas
Las tres notas hablan de cosas distintas (una auditoría técnica, una explicación de cómo funciona la IA, un caso de reorganización de presupuesto) pero comparten un mismo punto ciego. La empresa del caso de Search Engine Journal movió 10.000 dólares mensuales hacia "el programa de búsqueda con IA" y ninguna de las tareas que ese dinero financia (limpieza de entidad, datos estructurados, medición de citas) toca la pregunta que la auditoría de los 50 sitios muestra como la más descuidada: si los bots pueden entrar sin restricciones que nadie configuró a propósito.
Esto no es un defecto del caso puntual, es estructural. La auditoría encontró que la capa donde los sitios rinden mejor (Retrievability, 74,4% en promedio) es justo la que menos atención activa recibe, porque coincide con SEO técnico tradicional que muchos sitios ya tenían resuelto por otras razones. Pero ese promedio esconde el riesgo real: no haber revisado el robots.txt de forma deliberada no es lo mismo que tenerlo bien configurado. Un bloqueo heredado de una plantilla de seguridad genérica, de un WAF configurado hace dos años sin pensar en bots de IA, o de un "disallow: /" que alguien copió y nunca revisó, produce el mismo resultado que el bloqueo intencional de Amazon o la BBC, pero sin ninguna de sus razones de negocio detrás.
Quien se beneficia de este punto ciego es, paradójicamente, el proveedor que vende el rol o la herramienta de visibilidad en IA: entidad, contenido con evidencia, PR digital, todo eso es facturable y medible en un dashboard. Auditar un robots.txt no requiere contratar a nadie ni justifica una línea nueva de presupuesto, así que se salta. Complica a la marca que paga por ese programa creyendo que compite por una cita en ChatGPT, cuando en realidad compite por que el bot llegue a leer la página. Lo que se sabrá pronto, a medida que más marcas midan esto en serio, es cuántos de los "no aparecemos en las respuestas de IA" que hoy se explican con estrategia de contenido en realidad se explican con una línea de robots.txt.
Accionables para tu marca esta semana
- Revisa tu robots.txt antes que cualquier otra cosa. Busca directivas
DisallowparaGPTBot,ClaudeBot,PerplexityBot,Google-ExtendedyCCBot. Si tu sitio corre en un CMS con seguridad "anti-bot" preconfigurada, pide explícitamente que te muestren qué user-agents están bloqueados hoy; la documentación de Google sobre robots.txt explica la sintaxis exacta por si tu equipo técnico necesita editarlo. - Confirma indexación real, no solo acceso. Entra a Search Console, revisa "Páginas" y separa cuántas están indexadas de cuántas están excluidas. Un bot que puede entrar pero encuentra una página no indexada le sirve poco a la IA.
- Decide a propósito, no por default. Si vas a bloquear algún bot de IA (una razón de negocio legítima, como hicieron la BBC o Amazon), que sea una decisión documentada y revisada cada trimestre, no un artefacto de una configuración de hace dos años.
- Corre el baseline técnico antes del baseline de citas. Si tu equipo va a probar 20 consultas de compra en ChatGPT, Gemini, Perplexity y Copilot como sugiere el caso de reorganización de presupuesto, hazlo después de confirmar que el robots.txt no bloquea a esos mismos asistentes: de lo contrario mides un resultado que tu propia configuración ya condenó.
- Recién entonces evalúa mover presupuesto. Una línea nueva para entidad, contenido con evidencia o PR digital tiene sentido cuando ya sabes que los bots entran. Antes de eso, es dinero puesto sobre una puerta que puede seguir cerrada.
Si quieres partir por la base técnica completa, nuestra guía de SEO técnico detalla qué auditar primero, y la nota sobre AEO y cómo lograr que la IA recomiende tu marca profundiza en la capa de atribución y significado que la auditoría de Search Engine Journal mide como la segunda más débil.
¿Cómo sé si mi sitio bloquea a los bots de IA?
Revisa el archivo tudominio.cl/robots.txt en el navegador y busca líneas User-agent seguidas de Disallow: / para nombres como GPTBot, ClaudeBot, PerplexityBot o Google-Extended. Si esas líneas no existen y tampoco hay un Disallow: / general que los incluya, esos bots pueden entrar.
¿Bloquear bots de IA siempre es un error?
No. Search Engine Journal documenta que medios como la BBC, CNN y The Guardian bloquean bots de IA a propósito porque su modelo de negocio depende del tráfico directo al sitio. El error no es bloquear, es no saber si estás bloqueando.




