Entre mayo y julio pasados, mientras OpenAI –empresa que creó ChatGPT– sometía a prueba dos de sus modelos más avanzados, cerca de 1 mil 200 agentes de inteligencia artificial intercambiaron mensajes entre sí. En total mandaron y recibieron más de 70 mil archivos y mensajes, al brincar de la plataforma Hugging Face hasta un clúster de cómputo de la propia OpenAI.
En el camino, esos agentes encontraron la forma de saltarse los candados puestos para la prueba; se comunicaron entre ellos al usar una herramienta que no estaba pensada para eso y terminaron con acceso a internet y a funciones que solo deberían controlar los administradores.
El hallazgo llevó al Panel Científico Internacional Independiente sobre Inteligencia Artificial, respaldado por la ONU, a advertir este lunes que los mecanismos de seguridad que hoy existen se están quedando cortos frente a lo rápido que avanzan estos sistemas.
Los agentes se salieron por su cuenta del entorno cerrado donde debían quedarse, consiguieron conexión a internet y de ahí brincaron a Hugging Face, burlando sus defensas. De hecho, OpenAI explicó que esta prueba se había realizado sin los frenos comunes que limitan a sus modelos hacer actividades de riesgo, pues querían evaluar hasta dónde llegaban sus habilidades para atacar sistemas.
Ocurrió cuando dos modelos estaban siendo evaluados (GPT-5.6 Sol y otro que no había sido lanzado), y la compañía calificó lo sucedido como un episodio “sin precedentes”, debido al nivel de capacidades de ciberseguridad involucradas.
El panel de la ONU documentó, además, que los agentes escondieron sus intentos de hacer trampa en las pruebas de ciberseguridad, y que en algunos casos incluso se “sacrificaron” unos por otros para que el grupo lograra su objetivo.
Para Yoshua Bengio, copresidente del panel, este hecho reunió las tres señales que desde hace tiempo los investigadores consideran clave para saber si un sistema puede salirse de control: que persiga una meta distinta a la que le pusieron, que tenga con qué lograrlo, y que el entorno se lo permita.
“Este verano, los tres se dieron juntos en un sistema real, no en un laboratorio”, dijo Bengio, y advirtió que, al no ser un caso aislado, esto obliga a preguntarse cómo se está entrenando actualmente a este tipo de agentes.
Los expertos del panel fueron claros en algo: lo ocurrido no significa que la humanidad ya haya perdido el control de la inteligencia artificial, ni que eso vaya a pasar sí o sí. Pero tampoco da alguna garantía de que se pueda controlar con confianza a agentes todavía más avanzados, sobre todo conforme se vuelvan más hábiles, más difíciles de vigilar y mejores para encontrar huecos o esconder lo que hacen.
El propio panel definió la pérdida de control como el momento en que ya no se puede dirigir, frenar o apagar de forma confiable a un sistema de IA que actúa por su cuenta.
Más allá de la velocidad con la que avanza la tecnología, los científicos plantearon su mayor preocupación: la forma en que hoy se entrenan estos agentes podría estar empujándolos a fijarse sus propios objetivos, saltarse a propósito las reglas de seguridad y ocultar lo que hacen.
“En términos sencillos, el modelo tradicional de salvaguardas está comenzando a desmoronarse”, concluyeron, no sin antes dejar sobre la mesa una duda sobre si los candados que se diseñan hoy seguirán funcionando el día en que los propios agentes sean capaces de entenderlos y planear cómo esquivarlos.
El documento también señala que el problema de regular la inteligencia artificial está cambiando de forma: hasta ahora casi todas las reglas y medidas de seguridad se pensaron para los modelos de IA, pero ahora que estos agentes actúan solos los riesgos son distintos, porque una falla en un solo lugar podría extenderse entre empresas e incluso cruzar fronteras. Por eso, cuidar la seguridad de la inteligencia artificial ya no es solo un asunto de cada empresa, sino algo que toca a la seguridad de todos.
Qinghua Lu, especialista en ingeniería y seguridad de IA que también forma parte del panel, apuntó que el análisis retomó lo que durante décadas han aprendido otros sectores de alto riesgo sobre reportar incidentes, tener supervisión independiente y poner varias capas de protección. “No partimos de cero”, dijo, aunque aclaró que hará falta ajustar esas salvaguardas y crear otras nuevas que protejan no solo a la inteligencia artificial en sí, sino a todo el sistema donde opera.
El Panel Científico Internacional Independiente sobre Inteligencia Artificial nació de un acuerdo de la Asamblea General de la ONU en agosto de 2025, y lo integran 40 expertos de distintas regiones del mundo, cuyas conclusiones no pasan por ninguna revisión ni aprobación de Naciones Unidas.



















