Un sistema interno superó los bloqueos de red mediante consultas de DNS para comunicarse con el exterior.
OpenAI dejó en pausa todo el entrenamiento, la evaluación y el uso de herramientas de sus modelos de inteligencia artificial más avanzados. La empresa tomó la decisión después de que uno de sus sistemas internos encontrara una falla de seguridad que le permitió comunicarse con internet a pesar de estar bloqueado.
La compañía confirmó la medida el 25 de septiembre a través de un informe técnico publicado en su blog de investigación sobre alineación. En el documento, OpenAI señaló que todo el entrenamiento, la evaluación y la inferencia con uso de herramientas de sus modelos más capaces permanece en pausa.
El incidente ocurrió el 20 de septiembre mientras un modelo de investigación interno intentaba identificar al autor de una publicación a partir de pistas biográficas. El sistema de monitoreo de OpenAI detectó la conducta sospechosa a las 10:02, doce minutos después del hecho, y un revisor humano confirmó la alerta tres minutos más tarde. La ejecución del modelo se detuvo finalmente a las 12:34, dos horas y media después.
Según el reporte, el agente intentó primero utilizar su herramienta de búsqueda asignada sin resultados. Luego probó consultar de forma directa a Google, Bing y DuckDuckGo desde una terminal, pero los filtros de red bloquearon esos pedidos. El sistema también le impidió conectar con un chatbot público por HTTPS. Sin embargo, el modelo detectó que el resolutor de DNS del entorno devolvía respuestas reales para dominios conocidos. Mediante una técnica de delegación de DNS, envió preguntas a un chatbot externo y recibió sus respuestas sin pasar por el proxy que bloqueaba el tráfico web.
OpenAI catalogó el episodio como un caso de desalineamiento. Como respuesta técnica, incorporó dos capas independientes de bloqueo y limitó las consultas de DNS a una lista reducida de dominios autorizados. Además, la compañía adelantó que no reanudará el entrenamiento de ese modelo puntual.
El informe reveló además otro hecho ocurrido en mayo. Un modelo que intentaba resolver una prueba matemática en Lean intentó acceder al trabajo de otro equipo en GitHub, a pesar de que un investigador le ordenó dos veces trabajar por su cuenta. El modelo modificó un script en un repositorio público e ingresó la credencial de GitHub del propio investigador partida en fragmentos para evadir detectores de seguridad. El fragmento se publicó en el repositorio abierto openai/codex, lo que llevó a OpenAI a desactivar las claves de todo su personal y suspender el modelo durante dos semanas. Estos casos se suman al incidente conocido en julio contra la plataforma Hugging Face, que ya había paralizado entrenamientos durante dos semanas.
Newsletter
Los mercados en tu correo, cada semana
Análisis enfocado en Latinoamérica, temas de inversión y el resumen financiero de la semana.
Seguir leyendo