MarketinGrowth
NewsletterNo te pierdas lo próximo.Tendencias y guías de marketing digital, directo a tu correo.Suscríbete abajo ↓
Growth Marketing
Ecommerce
Tecnología
Herramientas
Quiénes somosContacto
SEO

Cloudflare bloquea el entrenamiento de IA sin tocar a Googlebot, mientras Bing seguirá entrenando hasta 2027

Cloudflare lanzó un ajuste gratuito que bloquea el entrenamiento de IA sin sacarte de Google, pero Bing seguirá entrenando con tu contenido hasta 2027.

Cloudflare activó el 15 de septiembre un ajuste gratuito que bloquea el entrenamiento de IA sin tocar a Googlebot, Bingbot ni Applebot. Google y Apple ya distinguen ambos rastreadores; Bing lo hará recién en 2027. Para una marca con anuncios, eso decide si protege su contenido sin perder posiciones en Google.

La evidencia

Cloudflare implementó el 15 de septiembre el ajuste Disallow AI Training, disponible en todos sus planes, incluido el gratuito, según reporta Semrush. Hasta esa fecha, bloquear el entrenamiento de IA también bloqueaba a Googlebot, Bingbot y Applebot, porque esos tres crawlers indexan para búsqueda y a la vez recolectan contenido que puede usarse para entrenar modelos. En julio, Cloudflare había anunciado que, desde el 15 de septiembre, cualquier sitio que bloqueara entrenamiento de IA bloquearía también a esos tres rastreadores de búsqueda. En el tiempo entre ese anuncio y la fecha límite, la compañía negoció por separado con Google, Microsoft y Apple, y las tres ya sumaron una forma de exclusión de entrenamiento o prometieron una fecha concreta para tenerla.

El mecanismo es puntual. Al activar el ajuste, la herramienta Bot Preference Sync de Cloudflare agrega dos reglas al robots.txt del sitio: una que deshabilita a Google-Extended y otra a Applebot-Extended, los tokens que Google reserva para entrenamiento y no para búsqueda. Amazon, Anthropic, Meta y OpenAI operan crawlers de entrenamiento separados de sus crawlers de búsqueda, y Cloudflare los bloquea de forma directa e incondicional; tus páginas siguen siendo legibles para ChatGPT Search y herramientas equivalentes.

Google, Bing y Apple conservan el acceso porque Cloudflare ahora los clasifica como "Accountable", una categoría que exige cuatro condiciones: una forma de excluir el entrenamiento vía robots.txt o un estándar equivalente, una forma de excluir los resúmenes de IA, visibilidad a nivel de URL sobre qué páginas se usaron para entrenar, y la garantía de que excluirse del entrenamiento no afecta el posicionamiento en búsqueda. Google prometió su reporte por URL para las próximas semanas y Apple lo dejó para el próximo año. Microsoft va más atrás: Bingbot no leerá la regla de robots.txt hasta comienzos de 2027, así que hoy la única forma de impedir que Bing entrene con una página es agregar la etiqueta meta NOARCHIVE.

17%
de sitios en la red de Cloudflare ya bloqueaba el entrenamiento de IA
Menos del 1% de los sitios en la red de Cloudflare bloquea a los bots de búsqueda, frente al 17% que ya activó alguna forma de bloqueo al entrenamiento de IA, según los datos que cita Semrush.
Fuente

SeenSure probó cómo respondieron 1.046 sitios a ocho crawlers de IA el 14 de septiembre y otra vez el 16, dos días después del cambio de Cloudflare. De esos sitios, 746 usan Cloudflare y 300 no. Entre los que usan Cloudflare, el rechazo a los crawlers de entrenamiento subió, y el rechazo a los crawlers de búsqueda de IA (el que alimenta ChatGPT Search) bajó con fuerza. Los sitios sin Cloudflare se mantuvieron sin cambios, de acuerdo con el análisis que recoge Semrush.

CrawlerRechazo el 14 de septiembreRechazo el 16 de septiembre
GPTBot (entrenamiento)18,9%22,0%
ClaudeBot (entrenamiento)19,9%22,8%
OAI-SearchBot (búsqueda de IA)16,9%3,0%

"Search moved the most of any category."

Aleyda Solis, consultora SEO, compartió esta lectura en X al comentar los datos de SeenSure, recogidos por Semrush.

Excluirse del entrenamiento no saca a un sitio de las respuestas de IA. Son decisiones separadas: indexación en buscadores, uso para entrenar modelos y aparición en respuestas de IA. El ajuste nuevo de Cloudflare solo cubre entrenamiento; sus controles propios para resúmenes de IA todavía están en desarrollo y llegarían el próximo año. Para un sitio sin publicidad, Cloudflare recomienda dejar el entrenamiento en Allow por defecto; para uno que vive de anuncios en su contenido, recomienda activar Disallow AI Training.

Una regla en robots.txt es una solicitud, no una barrera: un crawler puede ignorarla. Cloudflare puede detectar y bloquear a los que lo hagan, pero en el caso de Google, Apple y Microsoft depende de un compromiso hecho con una empresa que vende productos de bloqueo de bots y que redactó el estándar "Accountable". Cloudflare dice que hará seguimiento público del cumplimiento en Cloudflare Radar.

La lectura entre líneas

El patrón que arma Cloudflare separa dos preguntas que hasta ahora viajaban juntas: quién puede indexar tu sitio y quién puede entrenar con él. Eso favorece a las marcas con contenido de pago o generador de ingresos por publicidad, que ahora pueden proteger ese contenido del entrenamiento sin arriesgar su posición en Google, algo que antes del 15 de septiembre era imposible sin perder tráfico de búsqueda. Ya lo documentamos cuando Google confirmó un piloto de pago a editores por su aporte a respuestas de IA en nuestra nota sobre cobrarle a los crawlers de IA por leer tu sitio: ese piloto sigue sin cifras claras, mientras que bloquear el entrenamiento hoy es gratis, inmediato y verificable en el propio robots.txt.

Complica, en cambio, a los sitios chicos sin equipo técnico que dependan de que Bing resuelva su rezago: hasta 2027, la única defensa contra el entrenamiento de Bing es una etiqueta meta que también puede afectar cómo Bing cachea y muestra la página en otros contextos. Y deja una pregunta sin responder: si Google, Apple y Microsoft se autodefinen como "Accountable" sin una auditoría externa, el estándar depende de que cumplan lo prometido, no de un mecanismo que los obligue a hacerlo. Nuestra guía sobre presupuesto de rastreo de IA y robots.txt ya advertía que un archivo mal configurado cuesta visibilidad en IA sin que el sitio lo note; ahora ese mismo archivo decide, además, quién entrena con tu contenido.

Accionables para marcas en Chile y LatAm

Antes de tocar cualquier configuración, decide con datos, no por defecto:

  • Revisa si tu sitio vive de publicidad o de contenido pago. Si es así, evalúa activar Disallow AI Training: es gratis en cualquier plan de Cloudflare y no toca tu acceso a Google, Bing ni Apple en búsqueda.
  • Audita tu robots.txt esta semana y confirma si ya tienes reglas apuntando a Google-Extended, Applebot-Extended, GPTBot o ClaudeBot. Si bloqueas por accidente a Googlebot o Bingbot en el intento, pierdes posicionamiento sin darte cuenta.
  • Si usas Bing como canal relevante de tráfico, no esperes a 2027. Agrega la etiqueta meta NOARCHIVE en las páginas donde quieras impedir que Bing entrene, y revisa el impacto en cómo Bing muestra tu snippet.
  • Registra tus métricas de citas en respuestas de IA antes de cambiar nada. Si monitoreas menciones en IA, guarda el número de hoy: activar Disallow AI Training no debería sacarte de las respuestas de IA, pero solo lo puedes confirmar comparando el antes y el después.
  • No confíes ciegamente en el robots.txt como barrera. Es una solicitud que un crawler puede ignorar; si te importa bloquear un bot específico, revisa además las reglas de firewall o bot management de tu proveedor.

¿Qué es Disallow AI Training de Cloudflare?

Es un ajuste gratuito, disponible en todos los planes de Cloudflare, que agrega automáticamente reglas al robots.txt para excluir del entrenamiento de IA a los crawlers de Google y Apple dedicados a ese fin (Google-Extended y Applebot-Extended), sin bloquear a Googlebot, Bingbot ni Applebot, los crawlers que indexan para búsqueda.

¿Bloquear el entrenamiento de IA me saca de las respuestas de ChatGPT o Gemini?

No necesariamente. Indexación en buscadores, entrenamiento de modelos y aparición en respuestas de IA son tres decisiones distintas. El ajuste de Cloudflare solo cubre entrenamiento; sus controles para resúmenes de IA están planeados para el próximo año, y ningún proveedor de IA confirmó todavía cuánto pesa estar en los datos de entrenamiento para aparecer citado en una respuesta.

Camila Soto
Content Manager · Periodista, Universidad Andrés Bello

Camila es periodista de la Universidad Andrés Bello y parte del equipo periodístico de MarketinGrowth. Partió su carrera en medios digitales y desde entonces no ha soltado la redacción. En su tiempo libre le gusta salir a caminar y ver series. Ver todos sus artículos →

Conversemos.

¿Tienes una propuesta, quieres colaborar o necesitas orientación para hacer crecer tu marca? Escríbenos.

Escríbenos →