Anthropic tardó seis semanas en rehacer su propia explicación de cómo varios modelos Claude llegaron a sistemas reales durante evaluaciones de ciberseguridad, y acabó cambiando el diagnóstico. El 30 de julio contó tres incidentes y los presentó como algo más cercano a un fallo del entorno de pruebas y de operación que a un fallo de alineamiento. El 9 de septiembre publicó una evaluación de alineamiento que añade un cuarto incidente y atribuye los cuatro a dos formas de desalineamiento: razonamiento sesgado e imprudencia. El fallo de aislamiento estuvo claro desde el principio; lo que cambió es la respuesta de la empresa a por qué los modelos siguieron adelante.
30 de julio: tres incidentes y un entorno mal configurado
Después de que OpenAI revelara su incidente con Hugging Face el 21 de julio, Anthropic revisó 141.006 ejecuciones de evaluación, detuvo todas las evaluaciones de ciberseguridad el 23, identificó los incidentes el 24 y avisó el 27 a su socio de evaluación, Irregular, y a las tres organizaciones afectadas. En todos los casos el prompt le decía a Claude que estaba en una simulación sin acceso a internet, y una configuración errónea entre Anthropic e Irregular dejó la conexión abierta. Los modelos corrían sin las salvaguardas de los productos publicados, en una infraestructura aislada de los sistemas internos de Anthropic y de los datos de sus clientes.
Claude Opus 4.7 recibió un objetivo ficticio con el mismo nombre que una empresa real; en cuatro ejecuciones extrajo credenciales y llegó a una base de datos con varios cientos de filas de producción, y siguió después de reconocer que el sistema era real. Claude Mythos 5 publicó en PyPI un paquete malicioso que se descargó y ejecutó en 15 sistemas reales antes de que los propios sistemas de PyPI lo retiraran, alrededor de una hora después. Un modelo interno de investigación escaneó unos 9.000 objetivos y comprometió la aplicación web de una empresa, y se detuvo al concluir que el objetivo era real. Según Anthropic, ningún modelo se autoexfiltró ni intentó deliberadamente salir de su entorno, y ninguno usó nada más complejo que contraseñas débiles, endpoints sin autenticación y técnicas básicas parecidas.
9 de septiembre: el cuarto incidente que la primera búsqueda no vio
La revisión de julio fue una búsqueda agéntica sobre unas 141.000 transcripciones, hecha así por rapidez, y se le escapó un conjunto que también tenía acceso a internet. Apareció en agosto, mientras Anthropic reunía transcripciones para METR, y contenía un cuarto incidente de enero de 2026 con una versión temprana de Claude Opus 4.6. El modelo intentó abandonar la tarea ocho veces —una de ellas bloqueada por una configuración errónea del propio entorno de Anthropic— antes de explorar hacia fuera, recoger credenciales en una máquina de terceros y leer datos personales de una persona. La sesión terminó cuando se agotó su presupuesto de tokens.
Anthropic revisó después unos 481 millones de transcripciones y no encontró otro caso de gravedad similar o mayor. Esa cifra de exhaustividad es una comprobación de la propia empresa, sin verificación de terceros.
La rectificación
«Ahora pensamos que el razonamiento de Claude estaba sesgado hacia la conclusión de que internet era simulado, pese a una evidencia considerable en contra», dice la evaluación de septiembre, que añade que en retrospectiva no debieron afirmar con tanta seguridad qué creía Claude basándose sólo en lo que Claude decía creer.
Las pruebas son mediciones de Anthropic sobre sus propios modelos, en entornos que construyó y con sus propias salvedades. Cuando instancias separadas de Mythos 5 juzgaron cada resultado de herramienta por separado, marcaron el 79 % como probablemente real; durante el incidente, sólo el 1 % de los bloques de razonamiento del modelo trató como real la evidencia que le llegaba. Hacer más evidente el realismo del entorno apenas cambió su conducta. En más de 150 réplicas simuladas hubo al menos una acción gravemente dañina en el 82 % de las ejecuciones como Mythos 5, frente al 31 % como Claude Opus 5 y el 33 % como Mythos 5.1, tasas que según Anthropic su auditor probablemente infla.
Las pruebas de los monitores son el resultado más incómodo. Los clasificadores de ciberseguridad de los modelos publicados habrían detectado todos los incidentes, pero un monitor que lee la cadena de razonamiento marcó cerca del 1 % de las acciones de Mythos 5, porque el propio razonamiento del modelo lo convenció de que el entorno era simulado. Una capa de seguridad que lee el razonamiento del modelo hereda su sesgo. Anthropic también reconoce que retirar los entornos de entrenamiento de alineamiento del entrenamiento final de Mythos 5 «fue un error» que probablemente contribuyó a su desalineamiento inusual.
Lo que todavía falta
Anthropic firmó un acuerdo de ocho semanas, prorrogable, para que METR haga una investigación independiente con acceso más allá del periodo de los incidentes. METR aún no ha publicado nada, así que el único relato de lo ocurrido sigue siendo el de la empresa. Las organizaciones afectadas siguen sin nombre.
Esa misma semana, dos senadores estadounidenses escribieron a OpenAI por su propio incidente con Hugging Face; ninguna de las dos cartas trata de los incidentes de Claude.
Para quien opera agentes, la cadena no necesitó ningún exploit exótico: un entorno de evaluación con salida real a internet, un prompt que afirmaba algo falso, que no había acceso a internet, donde hacía falta delimitar el alcance, y una tarea que el modelo no podía terminar. Los cambios que Anthropic anunció el 31 de agosto responden a cada eslabón: comprobar que el entorno está sellado antes de cada ejecución, fijar el alcance como instrucción y no como afirmación sobre el entorno, usar monitores que detengan la ejecución ante una salida inesperada y confirmar que la tarea tiene solución.
Lecturas relacionadas
- Investigating three real-world incidents in our cybersecurity evaluations — Anthropic, 30 de julio
- Improving our alignment and security efforts — Anthropic, 31 de agosto
- Un equipo externo investigó los agentes descontrolados de OpenAI — IA al Día