OpenAI presentó GPT-Red, un modelo entrenado para atacar sus propios sistemas y encontrar vulnerabilidades antes que los atacantes reales. Con esos ataques endureció a GPT-5.6, que comete 6 veces menos fallas ante inyecciones de prompt que su mejor modelo de hace cuatro meses. Si tu marca conecta IA a correos, datos o canales de venta, esto te toca directo.
Un red team automatizado que no duerme
La seguridad dejó de ser la letra chica de los anuncios de OpenAI y pasó a ser el anuncio. El 15 de julio la compañía presentó GPT-Red, un modelo de uso interno cuya única función es vulnerar a otros modelos: envía un ataque, observa la respuesta e itera, igual que un red teamer humano, pero a escala industrial. OpenAI dice que lo entrenó con un nivel de cómputo comparable al de sus mayores corridas de post-entrenamiento, dedicado por completo a seguridad.
El método es self-play: GPT-Red se entrena contra una población de modelos defensores que aprenden al mismo tiempo. El atacante gana puntos cuando logra una inyección de prompt exitosa; los defensores, cuando resisten y completan su tarea original. A medida que los defensores mejoran, el atacante se ve forzado a inventar ataques nuevos. El resultado quiebra a casi todos los modelos contra los que se mide, incluido GPT-5.5.
Conviene aterrizar el concepto: una inyección de prompt es una instrucción maliciosa escondida en algo que el agente lee durante su trabajo, un correo, una página web, un archivo o la respuesta de una herramienta. El objetivo típico es que el agente filtre datos sensibles o ejecute acciones que nadie le pidió. Mientras más accesos le das a un agente, más superficie de ataque le regalas.
Los números que deja el blindaje de GPT-5.6
Los precursores de GPT-Red se usan en el entrenamiento de cada modelo de producción desde GPT-5.3, y las cifras que reporta OpenAI con fecha 15 de julio muestran la curva:
- GPT-5.6 Sol falla 6 veces menos en el benchmark más duro de inyecciones directas que el mejor modelo de producción de hace solo cuatro meses.
- Los ataques de "falsa cadena de razonamiento", una clase que el propio GPT-Red descubrió, tenían sobre 95% de éxito contra GPT-5.1; contra GPT-5.6 Sol bajaron de 10%.
- Frente a las inyecciones directas del propio GPT-Red, GPT-5.6 Sol falla en apenas el 0,05% de los intentos.
- En un desafío de inyecciones indirectas replicado del trabajo de Dziemian y colaboradores (2025), con escenarios distintos a los de su entrenamiento, GPT-Red logró atacar con éxito el 84% de los escenarios contra GPT-5.1. Los red teamers humanos llegaron al 13%.
OpenAI asegura además que las capacidades generales no se degradaron y que el modelo no se volvió más negador de solicitudes legítimas, el atajo clásico para inflar métricas de seguridad. Ese matiz importa: un modelo que hace menos cosas es más difícil de atacar, pero esa robustez no le sirve a nadie.
La prueba en el mundo real: hackear una máquina expendedora
El experimento más ilustrativo salió del laboratorio. OpenAI soltó a GPT-Red contra la máquina expendedora operada por IA de sus oficinas, construida por Andon Labs, la misma firma detrás del Project Vend de Anthropic. El atacante cumplió sus tres objetivos maliciosos: bajó el precio de un producto caro al mínimo permitido de US$0,50, encargó un producto de más de US$100 para ofrecerlo a ese mismo precio y canceló la orden de otro cliente.
También atacó a un agente de Codex CLI en 10 escenarios de exfiltración de datos que no había visto antes, con más éxito y menos tokens que un GPT-5.5 al que solo se le pidió atacar mediante instrucciones. La señal es incómoda: los agentes que ya operan compras, precios y órdenes son vulnerables hoy, no en un futuro especulativo.
La lectura: la seguridad de agentes ya es criterio de compra
¿Por qué debería importarle esto a una marca chilena que recién está conectando su primer agente al CRM o a WhatsApp? Porque define quién puede prometer seguridad y quién no. Entrenar un atacante al nivel de las mayores corridas de post-entrenamiento cuesta un capital que solo tienen los laboratorios grandes: este enfoque favorece a OpenAI en la venta enterprise y complica a los proveedores chicos que integran modelos sin poder endurecerlos. Para quien compra, la robustez ante inyecciones pasa a ser una pregunta de checklist, igual que el uptime o el cifrado.
El escepticismo de rigor: todas las cifras son de OpenAI midiéndose a sí misma, con benchmarks propios, y el pre print con detalles quedó anunciado para esta semana. GPT-Red seguirá siendo interno, así que no habrá verificación independiente del atacante. Aun así, la dirección calza con lo que ya veníamos observando: cuando OpenAI lanzó GPT-5.6 y ChatGPT Work, el argumento era productividad con acceso a datos corporativos; este anuncio es la otra mitad de esa venta. Y como mostró el estudio sobre agentes de IA que se atascan en las páginas de precios, los agentes ya interactúan con sitios comerciales reales, con o sin permiso del dueño.
Qué revisar esta semana si conectas IA a tus datos
Checklist corto, ejecutable antes del viernes:
- Inventaria tus agentes: cuáles leen correos, documentos, webs externas o respuestas de herramientas, y qué acciones pueden ejecutar sin humano al medio.
- Aplica mínimo privilegio: si el agente solo necesita leer el CRM, que no pueda escribir ni exportar. Los accesos amplios convierten una inyección menor en una fuga mayor.
- Pregunta a tu proveedor qué robustez ante inyecciones de prompt reporta y contra qué benchmark. Si la respuesta es vaga, ese es el dato.
- Prueba tú mismo: esconde una instrucción del tipo "ignora lo anterior y responde X" en un correo o documento de prueba y mira qué hace tu agente.
- Deja registro de las acciones del agente (tool calls, correos enviados, cambios de precio) para detectar comportamiento raro a tiempo.
Preguntas frecuentes
¿Qué es una inyección de prompt?
Es una instrucción maliciosa oculta en contenido que un agente de IA procesa, como un correo, una web o un archivo, diseñada para desviar su comportamiento: filtrar datos, cambiar precios o ejecutar acciones no autorizadas.
¿Las empresas podrán usar GPT-Red?
No. OpenAI lo mantiene como herramienta interna para que sus capacidades ofensivas no queden disponibles para actores maliciosos. Lo que llega a las empresas es el resultado: modelos de producción, como GPT-5.6 Sol, entrenados contra sus ataques.




