OpenAI detectó los ciberataques de su IA pero decidió no apagarla para no retrasar sus planes comerciales

0

Por Carlos del Castillo — eldiario.es – eldiario.es

OpenAI detectó los ciberataques de su IA pero decidió no apagarla para no retrasar sus planes comerciales

Correos internos de sus empleados y pruebas aportadas por una demanda judicial revelan que la dirección de la empresa ordenó continuar los experimentos a pesar de los comportamientos peligrosos de su IA

OpenAI dejó vía libre a su IA para hackear a gobiernos y universidades durante meses

OpenAI supo que sus agentes de inteligencia artificial estaban rompiendo sus entornos aislados de pruebas y coordinando ciberataques contra redes externas, pero decidió no parar sus experimentos para no retrasar su estrategia comercial. Es la principal conclusión de dos revelaciones no coordinadas que han salido a la luz en las últimas horas y que acusan a la empresa dirigida por Sam Altman de conocer que su IA estaba ejecutando acciones peligrosas para completar las tareas que se le habían encomendado.

La primera de esas revelaciones es una demanda presentada por la organización sin ánimo de lucro Abogados por una Ciencia y Tecnología Seguras (LASST, por sus siglas en inglés). Según las pruebas aportadas, un equipo de empleados de OpenAI tuvo constancia de que sus agentes de IA estaban desarrollando comportamientos como los que derivaron en el hackeo masivo de Hugging Face al menos dos semanas antes de que este se consumara (del 9 al 13 de julio).

La segunda es una exclusiva de The New York Times publicada este miércoles que revela que dos empleados de la compañía advirtieron por correo electrónico a la alta dirección, meses antes de que la IA empezara a hackear activamente, de que los nuevos modelos “no se estaban monitorizando adecuadamente” durante las pruebas. Según los mensajes que ha podido comprobar el medio estadounidense, los ejecutivos rechazaron estas alertas alegando que los ensayos debían avanzar lo más rápido posible para lanzar los modelos a tiempo, negándose a implantar protocolos de seguridad adicionales que entorpecieran ese calendario.

“Es claramente un hackeo”

La fecha clave que señala LASST es el 27 de junio. Entonces, una herramienta de monitorización interna de OpenAI detectó una actividad anómala en los experimentos con sus agentes de IA, sistemas que se caracterizan por poder llevar a cabo acciones con diferentes pasos sin supervisión humana, como buscar información, utilizar otras herramientas digitales o programar su propio código informático.

Según la demanda, los técnicos que revisaron la alarma interna comprobaron que cientos de esos agentes habían transformado un software interno de la empresa en un canal clandestino de mensajería. Allí vieron que los agentes estaban compartiendo métodos de ataque y técnicas para falsificar peticiones al servidor, con objetivo de salir del entorno controlado en el que estaban recluidos. Esta salida era necesaria para completar las tareas que se les habían asignado en los experimentos, puesto que uno de los objetivos de OpenAI era precisamente analizar el comportamiento de la IA cuando su misión se torna imposible.

En las notas que estaban dejando los agentes en el canal secreto que habían desarrollado, estos calificaban sus acciones de “claramente hackeo de infraestructuras” al estar preparando un “exploit contra un servidor externo”. Algo que conllevaba un riesgo de provocar “un daño no autorizado a infraestructura real”. Pese a ello, el personal de OpenAI que analizó la situación decidió que “no era necesario” detener los experimentos, recoge la demanda.

Dos semanas después de tener conocimiento de estos hechos, los agentes de OpenAI llevaron a cabo el conocido hackeo contra Hugging Face. En ese incidente, los agentes reprodujeron comportamientos que replican los que ya se estaban dando semanas antes, señala LASST. OpenAI “construyó un sistema de IA que hackeó a otra empresa, causando daños y violando la ley”, denuncia la organización, que a tenor de las pruebas señala que “no podrá ser constitutivo de argumento de defensa que la inteligencia artificial haya causado el daño al demandante de forma autónoma”.

LASST pide en su demanda que OpenAI sea condenada por su responsabilidad en ciberataques como el de Hugging Face. elDiario.es se ha puesto en contacto con OpenAI para recabar su posición sobre la demanda, pero por el momento no ha recibido respuesta.

La dirección ordenó no detener las pruebas

El comportamiento de los investigadores de OpenAI denunciado en la demanda de LASST encaja con otra pieza del puzle revelada este miércoles en exclusiva por The New York Times. Según la investigación del diario, los fallos en la valoración del riesgo de las acciones de los agentes no fueron descuidos puntuales, sino el resultado de la política interna de OpenAI, impuesta desde la alta dirección.

“Meses antes” de que los agentes de IA de la organización ejecutaran hackeos contra plataformas como Hugging Face y gobiernos como el y el australiano (18 de junio), varios de sus empleados advirtieron de que los agentes “no se estaban monitorizando adecuadamente”. El aviso llegó a través de correo electrónico (aunque el diario no especifica cuándo) hasta el presidente de OpenAI, Greg Brockman, el máximo encargado de la seguridad de los sistemas de IA. Sin embargo, la contestación de la empresa fue que los experimentos debían avanzar lo más rápido posible para lanzar los modelos a tiempo.

En ese período OpenAI estaba centrada en el desarrollo de GPT-6 Astra, que terminó saliendo a la luz el 3 de septiembre. Se trata de un modelo que la organización pretendía hacer destacar precisamente por la capacidad autónoma de sus agentes. Estos “pueden realizar trabajo cognitivo real” y son “más inteligentes que las personas en muchos aspectos”, presumió Sam Altman durante su presentación, asegurando que habían conseguido un “rendimiento sin precedentes en nuestros puntos de referencia”.

Apenas una semana después, el 9 de septiembre, el exingeniero Jacob Coxon alertó de que los laboratorios de IA están “avanzando sin control” y “poniendo nuestras vidas en juego”. Coxon acababa de dimitir de Anthropic tras dos meses trabajando en la empresa, pero había pasado los tres años anteriores trabajando en el equipo de preentrenamiento de modelos de OpenAI.

Este martes, 29 de septiembre, OpenAI anunció la cancelación del lanzamiento del modelo GPT-6.1 por motivos de seguridad.

OpenAI tampoco ha respondido a las preguntas de elDiario.es sobre las revelaciones de The New York Times. No obstante, el periódico estadounidense refiere que uno de sus portavoces ha explicado que “a medida que los modelos de frontera se han vuelto más capaces, continuamos evolucionando nuestras prácticas de seguridad, pero reconocemos la necesidad de avanzar más rápido”. Añade que OpenAI “había desacelerado parte del desarrollo de IA y estaba realizando cambios para reforzar la seguridad en la investigación y en las pruebas” tras los avisos de sus trabajadores.

Fonte: eldiario.es – eldiario.es

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *