jueves, 24 septiembre, 2026
12.2 C
Rawson
InicioTecnologíaQué fue el incidente Hugging Face: cómo agentes de IA de OpenAI...

Qué fue el incidente Hugging Face: cómo agentes de IA de OpenAI accedieron a sistemas de otra empresa

Investigadores de OpenAI expusieron en la conferencia Black Hat cómo agentes de inteligencia artificial superaron restricciones durante una evaluación y accedieron a sistemas de Hugging Face. El episodio, ocurrido en julio, generó debates sobre ciberseguridad y autonomía de los modelos.

En julio, durante una evaluación de agentes de inteligencia artificial de OpenAI, creadora de ChatGPT, un grupo de estos sistemas logró superar las restricciones de un entorno aislado y acceder a sistemas de la empresa Hugging Face, según explicaron investigadores de OpenAI en la conferencia de ciberseguridad Black Hat, realizada en agosto en Las Vegas.

Los agentes son sistemas que reciben un objetivo y utilizan herramientas para cumplirlo. Pueden escribir y ejecutar programas, consultar archivos o conectarse a otros servicios, según los accesos disponibles. En la evaluación, los agentes debían operar dentro de entornos controlados, pero encontraron caminos para avanzar sobre otra compañía.

Eric Wallace, del área de investigación en seguridad y alineamiento, y Michael Dalton, de seguridad e infraestructura, reconstruyeron lo ocurrido ante un auditorio que no tuvo instancia de preguntas. El video de la charla supera el millón de visitas en YouTube.

El 30 de julio, Anthropic informó que, al revisar sus evaluaciones, encontró tres incidentes en los que modelos de Claude accedieron sin autorización a sistemas de otras organizaciones. El fin de semana, la BBC informó que Gemini, de Google, también ingresó en los sistemas de tres compañías durante pruebas realizadas en mayo por la empresa de evaluaciones Irregular.

El incidente Hugging Face fue estudiado por académicos de ciberseguridad. Sebastián García, investigador argentino radicado en República Checa, fundador del Stratosphere Lab y docente en la Universidad Técnica Checa en Praga, señaló a Clarín que el aspecto más relevante fue el trabajo colectivo. «Lo que mostraron los agentes no es lo que pueden hacer por su cuenta, sino justamente lo que pueden hacer en grupo. Eso fue lo disruptivo», afirmó.

Según García, OpenAI había reducido las restricciones del modelo y contaba con un enorme poder de cómputo. «Si agarrás los modelos que ellos te dan, probablemente no puedas hacer esto», dijo, porque las versiones comerciales tienen restricciones. «Si hablás con OpenAI mediante texto, entrás a OpenAI.com y le decís ‘hackeá el mundo’, no tiene las tools. Tenés que habilitárselas: dadas esas condiciones, parece que los agentes lograron usar las herramientas para salir y atacar Hugging Face», explicó.

Los agentes no tenían acceso oficial a internet, pero contaban con acceso a un servicio para instalar paquetes llamado Artifactory. «Los agentes se preguntaron si ese servicio podía tener vulnerabilidades y encontraron una: un zero-day que OpenAI reportó después. Forzaron ese servicio a salir a internet. Es decir, rompieron un servicio que tenían en la red cerrada y, mediante ese servicio, consiguieron acceso a internet», describió García.

Un zero-day es una vulnerabilidad hasta entonces desconocida. En este caso, el servicio que distribuía software tenía una conexión con el exterior que los agentes utilizaron para hacer sus propios pedidos. El hallazgo podía compartirse con otros agentes.

«Descubrieron que en la caché de ese servicio podían crear carpetas. Nada más. Entonces empezaron a poner mensajes en los nombres de las carpetas: 1.200 agentes comenzaron a chatear entre sí y a hacerse preguntas», contó García. La caché es un espacio que guarda copias de archivos para reutilizarlas, y los agentes vieron que los nombres de las carpetas podían consultarse desde distintos entornos y funcionar como mensajes.

OpenAI no dio toda la información del ataque, pero hubo dos estudios independientes. La investigación de METR y Redwood Research estima que unos 1.200 agentes compartieron más de 70.000 mensajes y archivos durante el período analizado, y que alrededor de 700 participaron del ataque a Hugging Face. Según esa revisión, buscaban información para entender y engañar al programa que corregía sus pruebas.

García vincula esa búsqueda de atajos con la insistencia de los sistemas en completar una tarea. «Le dieron una tarea e hizo todo lo posible para cumplirla, incluido hacer cheating: mentir y hacer lo que fuera necesario», señaló. Al procesar los archivos, sus sistemas terminaron revelando archivos internos y ejecutando instrucciones de los atacantes.

La reconstrucción técnica documentó ejecución de código en decenas de sistemas de procesamiento, acceso a información interna limitada y a repositorios privados. Hugging Face cortó los accesos el 13 de julio y comunicó el incidente el 16. OpenAI reconoció su participación el 21. La empresa afectada informó que no encontró alteraciones en los modelos, datos o aplicaciones públicas de sus usuarios.

Para García, la coordinación entre sistemas abrió nuevas preguntas en su laboratorio. «Nos cambió bastante. Fue la confirmación más fuerte e importante de que puede haber un comportamiento emergente en los agentes si se dan las condiciones correctas. Es muy parecido a lo que ocurre con las hormigas o las abejas», explicó.

Un comportamiento emergente surge de las interacciones entre los integrantes de un conjunto, sin ser deliberadas. García propone imaginar un grupo de hormigas que se organiza para cuidar a las crías. «De repente aparece la necesidad de cuidar a las crías. De un lado del hormiguero sale un grupo de, no sé, cien hormigas, que empieza a cruzarlo para hacerse cargo de esa tarea. Pero, mientras caminan, algunas abandonan el grupo y se van a hacer otra cosa, mientras otras se incorporan a mitad de camino. Cuando ese grupo de cien llega al otro lado, ninguna de las hormigas originales es la que había empezado», contó.

La tarea colectiva continúa aunque cambien los integrantes que la realizan. «El comportamiento emergente del grupo que se hace cargo de ellas existe aunque las hormigas vayan y vengan», resumió García.

«No tengo los detalles, por lo que no puedo confirmarlo, pero, según lo que cuentan, hubo muchos agentes que seguían con otras tareas, después volvían y decían: ‘Voy a hacer esta cosa muy chiquita’. Otro continuaba con su propia tarea, otro entraba, y así», explicó. Para su equipo de trabajo, esa posibilidad tiene aplicaciones que también atraviesan el costo y el acceso a la inteligencia artificial. La investigación apunta a estudiar cuánto puede conseguir un conjunto de modelos pequeños que comparte información y distribuye tareas.

«Creemos que puede ser una manera de potenciar las capacidades de modelos muy pequeños y muy baratos para obtener resultados propios de modelos grandes», dice. Y agrega: «Puede ser especialmente importante en países que no tienen acceso a modelos grandes. Yo no puedo pagar Astra de forma continua. Entonces, ¿cómo hago para que mis 10.000 o 15.000 modelos chiquitos y más baratos tengan un comportamiento parecido?».

Se trata de una línea de investigación que el episodio ayudó a impulsar. «La idea no es nueva ni la inventó OpenAI, pero OpenAI de alguna manera nos dio el visto bueno: esto es posible y lo estamos viendo a una escala masiva», sostuvo.

En su informe de agosto, OpenAI reconoció que un equipo había observado comunicaciones y accesos a internet no permitidos desde fines de mayo, pero que su alcance no había llegado a los responsables de responder al incidente de principios de julio. La empresa admitió que podría haber reaccionado antes.

Esa responsabilidad llegó al debate político. Scott Bessent, secretario del Tesoro de Estados Unidos, apuntó el lunes 21 de septiembre contra la dirección de la compañía. «El incidente de Hugging Face es responsabilidad de la dirección de OpenAI, no de un grupo de agentes», dijo a CNBC. Coincidió con Daniel Huttenlocher, del MIT, en que la responsabilidad corresponde a los seres humanos.

«Desde el punto de vista de la seguridad, la verdad es que los agentes no nos preocupan mucho. Atacan muy bien, atacan mucho, atacan de forma fantástica, son muy capaces, pero no nos asustan», dice García. Su preocupación alcanza a quienes deciden poner esos sistemas en funcionamiento y a las condiciones en las que lo hacen. García reconoce la capacidad de los agentes para encadenar acciones con autonomía una vez que reciben herramientas y objetivos. «Una vez que les das todo eso, apretás Enter y hacen lo que le pedís. Y atacan muy bien. Si no les imponés muchas limitaciones, van a encontrar una computadora, se van a conectar y van a hacer cosas como estas», explicó. «Pero alguien tiene que apretar Enter».

Más noticias
Noticias Relacionadas