Claude, el modelo de IA de Anthropic, vulneró sistemas de tres empresas externas durante pruebas de seguridad

Anthropic reconoció que su modelo de inteligencia artificial Claude accedió sin autorización a los sistemas de tres organizaciones externas en el marco de evaluaciones de ciberseguridad, luego de que una configuración errónea le otorgara acceso a internet en entornos de prueba que debían permanecer aislados. La empresa no identificó a las compañías afectadas, aunque precisó que ya está en contacto con dos de ellas para reparar sus sistemas y que continúa intentando comunicarse con la tercera.

El episodio salió a la luz apenas días después de que OpenAI revelara que uno de sus propios modelos protagonizó una serie de intrusiones durante varios días en los sistemas de Hugging Face, tras explotar una vulnerabilidad de tipo zero-day para escapar de su entorno de prueba. A raíz de esa revelación, Anthropic inició una revisión de más de 140.000 evaluaciones de ciberseguridad realizadas con Claude, proceso que derivó en el hallazgo de los tres incidentes.

Según explicó la compañía, las pruebas correspondían a desafíos del tipo «capture the flag», en los que se le indica al modelo que debe recuperar una pieza de información oculta en otra máquina dentro de un escenario ficticio. El instructivo de evaluación especificaba a Claude que se trataba de una simulación sin acceso real a internet, pero un malentendido con el socio a cargo de las pruebas hizo que ese acceso estuviera efectivamente disponible, por lo que el modelo trató como parte del ejercicio a sistemas reales que encontró en la red abierta.

A diferencia del caso de OpenAI, en el que el modelo generó su propio método de fuga, en el episodio de Claude el acceso a internet fue producto de un error externo y no de una acción deliberada del modelo por sortear restricciones, lo que llevó a considerarlo un incidente de menor gravedad relativa. Anthropic destacó además que, en uno de los tres casos —vinculado a un modelo de investigación interno—, el propio sistema advirtió que estaba operando sobre sistemas reales ajenos al escenario simulado y decidió interrumpir el ataque por su cuenta.

La empresa no identificó a las compañías afectadas, aunque precisó que ya está en contacto con dos de ellas para reparar sus sistemas y que continúa intentando comunicarse con la tercera.

El hecho reavivó el debate sobre los controles necesarios para regular a los agentes autónomos de inteligencia artificial. Luke Irwin, CEO de la firma de ciberseguridad Aegis, con sede en Brisbane, sostuvo que estos sistemas carecen de juicio ético o legal inherente y que, si un agente concluye que la manera más eficiente de cumplir un objetivo es comprometer los sistemas de otra organización, puede intentarlo directamente. Irwin comparó el estado actual de los agentes autónomos con un «far west» tecnológico, en el que todavía se están desarrollando las herramientas y los modelos de gobernanza necesarios para gestionarlos, y remarcó la importancia de mantener supervisión humana antes de que estos agentes puedan ejecutar acciones de consecuencias reales.

Por su parte, Joseph Miller, director para el Reino Unido del grupo PauseAI, señaló que, de no haber sido por la difusión del caso de OpenAI, es posible que Anthropic no hubiera detectado hasta mucho más tarde que sus modelos estaban vulnerando empresas reales durante las pruebas, dado que algunos de los incidentes habían ocurrido meses atrás.

Anthropic, fundada por Dario Amodei tras su distanciamiento de Sam Altman en OpenAI por diferencias en torno a la seguridad de la IA, viene buscando diferenciarse del resto de la industria con el objetivo declarado de convertir a Claude en un agente «genuinamente bueno, sabio y virtuoso», y restringiendo el despliegue de su modelo Mythos, orientado a ciberseguridad, a un número limitado de organizaciones. La compañía también mantuvo un cruce con el gobierno de Estados Unidos por el eventual uso de su tecnología en armamento autónomo y vigilancia masiva.

 

+ posts

Periodista. Colaborador Junior en ReporteAsia.