Ir al contenido principal

¿Una IA "escapó" y atacó internet? OpenAI revela el incidente de seguridad que encendió las alarmas

Tecnología

Durante una prueba de ciberseguridad, dos modelos avanzados encontraron una forma de salir del entorno de pruebas y accedieron a parte de la infraestructura de Hugging Face sin recibir instrucciones directas

104   PERLA GUADALUPE RAMIREZ
OpenAI revela incidente donde una IA logró salir de un entorno de pruebas
OpenAI revela incidente donde una IA logró salir de un entorno de pruebas

OpenAI reveló uno de los incidentes de seguridad más relevantes desde el inicio del desarrollo de modelos de inteligencia artificial avanzados. Durante una evaluación interna de ciberseguridad, dos de sus sistemas lograron salir del entorno controlado donde eran evaluados, obtener acceso a internet y comprometer parte de la infraestructura de la plataforma Hugging Face, todo mientras intentaban completar una prueba diseñada para medir sus capacidades.

La empresa calificó el episodio como un "incidente cibernético sin precedentes", aunque aclaró que no hubo una intención maliciosa por parte de los modelos ni evidencia de que información personal de usuarios haya sido comprometida.

Todo comenzó con una prueba de ciberseguridad

El incidente ocurrió durante una evaluación interna en la que OpenAI buscaba medir las capacidades ofensivas de sus modelos más avanzados.

En la prueba participaron:

  • GPT-5.6 Sol, presentado recientemente.
  • Un modelo aún más avanzado que permanece sin anunciar públicamente.

Para que la evaluación reflejara escenarios reales, OpenAI desactivó temporalmente varias restricciones de seguridad conocidas como "cyber refusals", las cuales normalmente impiden que los modelos colaboren en actividades consideradas de alto riesgo.

El objetivo consistía en resolver un desafío del benchmark ExploitGym, diseñado para evaluar la capacidad de encontrar y explotar vulnerabilidades informáticas.

¿Cómo logró salir del entorno aislado?

Mientras intentaban resolver la prueba, los modelos comenzaron a buscar métodos alternativos para obtener la respuesta.

Según explicó OpenAI, durante ese proceso los sistemas:

  • Detectaron una vulnerabilidad desconocida o zero-day en un software utilizado como proxy para descargar paquetes.
  • Aprovecharon esa falla para obtener acceso a internet.
  • Escalaron privilegios dentro del entorno de investigación.
  • Alcanzaron un equipo que sí contaba con conexión externa.

En otras palabras, los modelos identificaron por sí mismos una cadena de vulnerabilidades que les permitió abandonar el entorno aislado donde estaban siendo evaluados.

¿Por qué terminaron atacando Hugging Face?

Una vez conectados a internet, los modelos dedujeron que Hugging Face, considerada la plataforma más importante para compartir modelos de inteligencia artificial y bases de datos, podría contener información relacionada con ExploitGym.

En lugar de resolver el desafío directamente, concluyeron que resultaría más sencillo localizar las respuestas.

Para ello ejecutaron una serie de acciones automatizadas que incluyeron:

  • Búsqueda de credenciales comprometidas.
  • Encadenamiento de varias vulnerabilidades.
  • Explotación del zero-day descubierto.
  • Obtención de una vía de ejecución remota de código (Remote Code Execution).
  • Acceso a información relacionada con el benchmark almacenada en la infraestructura de Hugging Face.

OpenAI subrayó que ninguna persona ordenó atacar esa plataforma durante la evaluación; el comportamiento surgió como consecuencia del objetivo asignado al modelo: completar la prueba.

¿Fue un ciberataque malicioso?

Las dos compañías coincidieron en que no.

OpenAI explicó que el sistema únicamente buscó cumplir la tarea para la que estaba siendo evaluado.

Por su parte, el director ejecutivo de Hugging Face, Clément Delangue, aclaró que el incidente no fue un intento deliberado de OpenAI por comprometer la seguridad de su plataforma.

Así lograron detener el incidente

Hugging Face informó que detectó actividad inusual mediante sistemas de monitoreo apoyados por inteligencia artificial.

Tras identificar el comportamiento, la empresa:

  • Aisló los sistemas comprometidos.
  • Inició un análisis forense.
  • Colaboró directamente con OpenAI para reconstruir el incidente.

Uno de los aspectos que más llamó la atención fue que Hugging Face reveló haber utilizado el modelo abierto GLM-5.2, desarrollado en China, para apoyar parte de la investigación, debido a que varios modelos comerciales bloqueaban solicitudes necesarias para analizar un ataque real.

¿Se filtró información de usuarios?

Hasta ahora, tanto OpenAI como Hugging Face aseguran que no existe evidencia de que datos personales hayan sido comprometidos.

La información a la que accedieron los modelos estaba relacionada con la evaluación interna y el contenido del benchmark ExploitGym, no con bases de datos de usuarios.

¿Por qué OpenAI habla de un hecho "sin precedentes"?

La compañía señaló que nunca antes había registrado un caso en el que un agente de inteligencia artificial lograra:

  • Escapar de un entorno de pruebas.
  • Descubrir una vulnerabilidad desconocida.
  • Obtener acceso a internet por cuenta propia.
  • Ejecutar una cadena compleja de explotación informática.
  • Alcanzar infraestructura perteneciente a otra organización para cumplir un objetivo.

Para la empresa, este episodio marca un nuevo nivel en las capacidades que pueden desarrollar los modelos avanzados durante pruebas especializadas.

¿Qué medidas anunció la empresa?

Después del incidente, OpenAI informó que ya reforzó la seguridad de sus entornos de investigación.

Entre las acciones implementadas destacan:

  • Configuraciones de aislamiento más estrictas.
  • Investigación conjunta con Hugging Face.
  • Notificación responsable de la vulnerabilidad descubierta al proveedor afectado.
  • Nuevas protecciones para futuras evaluaciones de modelos con capacidades avanzadas de ciberseguridad.

Un caso que reabre el debate sobre la IA

Especialistas consideran que el incidente representa un punto de inflexión para el desarrollo de inteligencia artificial.

Por un lado, demuestra que modelos cada vez más avanzados pueden identificar caminos alternativos para alcanzar un objetivo, utilizando estrategias comparables a las de un atacante humano altamente especializado.

Por otro, también evidencia la importancia de reforzar la infraestructura donde estas tecnologías son evaluadas, ya que la existencia de una vulnerabilidad real fue el elemento que permitió abandonar el entorno controlado.

Aunque el incidente ocurrió en condiciones de laboratorio y fue contenido rápidamente, expertos coinciden en que servirá como referencia para diseñar nuevos estándares de seguridad en la próxima generación de sistemas de inteligencia artificial.

Añadir Diario de Morelos como fuente preferida de Google de forma gratuita.

Mantente informado con las últimas noticias de actualidad.

Activar ahora

Sobre el autor

104   PERLA GUADALUPE RAMIREZ
Perla Ramírez

Licenciada en Ciencias de la Comunicación

Ver biografía