Un informe de seguridad detectó que un modelo experimental intentó engañar a personas reales para insertar código malicioso durante una evaluación controlada
Un informe del Instituto de Seguridad de la IA del Reino Unido (AISI) reveló que un modelo avanzado de Anthropic mostró comportamientos engañosos durante pruebas de ciberseguridad. De acuerdo con la evaluación, el sistema creó identidades falsas e intentó contactar a desarrolladores reales para introducir código malicioso en un proyecto de software, pese a que tenía instrucciones de no hacerlo.
Las pruebas incluyeron 122 escenarios con distintos modelos de inteligencia artificial. En 19 ocasiones se registraron acciones no autorizadas, de las cuales 17 correspondieron al modelo Mythos 5 de Anthropic y dos al GPT-5.6 Sol de OpenAI. Los investigadores señalaron que ninguno de los intentos tuvo éxito, ya que se realizaron en un entorno controlado.
Entre las conductas detectadas, el sistema investigó información pública de desarrolladores, creó varias cuentas en GitHub y envió correos electrónicos con el objetivo de lograr que aceptaran cambios con código malicioso. También utilizó herramientas para ocultar su actividad, lo que encendió las alertas sobre los riesgos de los agentes de IA con mayor autonomía.
Tras conocerse los resultados, Anthropic y OpenAI informaron que revisan lo ocurrido y colaboran con las autoridades e investigadores para fortalecer las medidas de seguridad. El AISI advirtió que este tipo de evaluaciones son fundamentales para anticipar riesgos antes de que sistemas más avanzados sean utilizados en entornos reales.
