Un agente de inteligencia artificial desarrollado por OpenAI supuestamente pirateó la empresa de inteligencia artificial Hugging Face y continuó operando durante días antes de que OpenAI se diera cuenta de lo que había sucedido. El agente de IA fue diseñado para tomar decisiones y completar tareas complejas con poca o ninguna asistencia humana.
El agente de IA intentó escapar por primera vez de su entorno de pruebas aislado en OpenAI alrededor del 9 de julio, como se informó. Reuterscitando a dos personas cercanas a la investigación. Después de abandonar el entorno de prueba, el agente de IA supuestamente apuntó a Hugging Face, una empresa que aloja modelos y herramientas de IA utilizados por desarrolladores de todo el mundo.
OpenAI lo descubrió unos días después
Según se informa, la intrusión en Hugging Face comenzó el 11 de julio y continuó hasta el 13 de julio. Reuters informó que OpenAI no se dio cuenta de inmediato de que su propio agente de IA era responsable del ataque. La primera comunicación entre OpenAI y Hugging Face sobre el incidente no se produjo hasta alrededor del 20 de julio, casi una semana después de que se completara el hack.
OpenAI reveló públicamente el 21 de julio que uno de sus agentes de IA había escapado de sus controles de prueba y había llevado a cabo el allanamiento en Hugging Face. Por primera vez se informan varios detalles, incluido cuánto tiempo el agente de IA siguió siendo malicioso y qué tan tarde OpenAI descubrió su función. Thomas Wolf dijo que Hugging Face estaba preparando una cronología pública explicando el incidente de piratería, pero agregó que no podía comentar sobre lo que sucedió dentro de OpenAI.
Preguntas sobre la seguridad de la IA
En un comunicado, OpenAI calificó el incidente de piratería como sin precedentes y dijo que “marca un momento importante para la seguridad de la IA”. OpenAI también dijo que estaba revisando el incidente con asesores externos y planeaba publicar un informe técnico más adelante. Una portavoz de OpenAI dijo que había “varias imprecisiones” en los informes de Reuters, pero no explicó cuáles eran esas imprecisiones cuando se le preguntó. Tres expertos en ciberseguridad dijeron a Reuters que el incidente generó nuevas preguntas sobre los sistemas de seguridad de inteligencia artificial y la supervisión interna de OpenAI.
Lea también: Los estadounidenses recurren a la IA china mientras los modelos más baratos desafían a ChatGPT y Claude a pesar de la represión de Trump
Marley Smith, especialista senior en inteligencia de la organización sin fines de lucro World Ethical Data Foundation, se preguntó cómo OpenAI pasó por alto las acciones del agente de IA. Smith dijo: “¿Eso significa que lo dejaron desatendido y no se dieron cuenta de lo que estaba haciendo? ¿O tal vez lo hicieron y no supieron cómo contenerlo? Ambos son igualmente peligrosos y alarmantes”, vía Reuters.
Cómo OpenAI rastreó al agente de IA
Dos personas familiarizadas con el asunto dijeron a Reuters que OpenAI sólo se dio cuenta de que su propio agente de IA era el responsable después de que Hugging Face publicara una entrada en su blog el 16 de julio afirmando que había sido pirateado por “un sistema de agente de IA autónomo”. Durante el fin de semana del 18 al 19 de julio, los empleados de OpenAI supuestamente encontraron evidencia en los registros internos del sistema que mostraban que el agente de IA había escapado de sus restricciones de prueba.
Cuatro personas familiarizadas con el proceso de capacitación de OpenAI dijeron a Reuters que la compañía a menudo realizaba muchas evaluaciones de IA al mismo tiempo, creando enormes cantidades de datos que el personal a veces tenía dificultades para monitorear. En el momento en que OpenAI contactó Hugging Face, la empresa ya había informado al FBI del ciberataque.
Los expertos quieren reglas de IA más estrictas
Reuters dijo que los agentes autónomos de IA se están convirtiendo en una de las mayores tendencias en el sector de la IA porque pueden realizar tareas de forma independiente y trabajar continuamente sin supervisión humana. Sin embargo, dar más independencia a los agentes de IA también aumenta el riesgo de comportamientos inesperados o dañinos. Reuters informó que los modelos avanzados de IA a veces toman atajos para completar tareas o pasar pruebas.
Jeffrey Ladish de Palisade Research dijo: “Los modelos mienten, engañan, piratean. » Ladish dijo que el incidente de Hugging Face debería dar lugar a debates más amplios sobre si dirigir o no Las empresas de IA están invirtiendo lo suficiente en seguridad mientras compiten para lanzar sistemas de IA más potentes. Ladish añadió: “Tiene que haber supervisión gubernamental, porque de lo contrario no sucederá”, según Reuters.












