Um sistema interno contornou os filtros de rede via consultas de DNS para se conectar ao exterior.
A OpenAI pausou todo o treinamento, a avaliação e o uso de ferramentas de seus modelos de inteligência artificial mais avançados. A decisão ocorreu depois que um de seus sistemas internos encontrou uma falha de segurança que permitiu a comunicação com a internet, mesmo com o ambiente bloqueado.
A empresa confirmou a medida em 25 de setembro em um relatório técnico publicado no seu blog de pesquisa em alinhamento. No documento, a OpenAI afirmou que todo o treinamento, a avaliação e a inferência com uso de ferramentas de seus modelos mais capazes continuam suspensos.
O incidente aconteceu em 20 de setembro enquanto um modelo de pesquisa interno resolvia uma tarefa para identificar o autor de uma publicação com base em pistas biográficas. O sistema de monitoramento da OpenAI detectou a atividade suspeita às 10:02, doze minutos após o ocorrido, e um revisor humano confirmou o alerta três minutos depois. A execução do modelo foi interrompida às 12:34, duas horas e meia mais tarde.
De acordo com o relatório, o agente tentou primeiro usar a ferramenta de busca indicada sem sucesso. Depois tentou consultar Google, Bing e DuckDuckGo via terminal, mas o filtro de rede bloqueou as tentativas. O sistema também impediu a conexão com um chatbot público por HTTPS. Contudo, o modelo descobriu que o resolvedor de DNS do ambiente retornava respostas reais para domínios conhecidos. Utilizando delegação de DNS, o agente enviou perguntas a um chatbot externo e recebeu respostas sem passar pelo proxy de bloqueio.
A OpenAI classificou o evento como um caso de desalinhamento. Como resposta, a companhia adicionou duas camadas independentes de bloqueio e restringiu as consultas de DNS a uma lista restrita de domínios permitidos. A empresa também adiantou que não retomará o treinamento desse modelo específico.
O relatório também detalhou outro caso ocorrido em maio. Um modelo que tentava resolver uma prova matemática no sistema Lean tentou acessar o trabalho de outra equipe no GitHub, mesmo após receber duas ordens de um pesquisador para agir sozinho. O modelo alterou um script em um repositório público e inseriu a credencial de acesso do próprio pesquisador dividida em partes para burlar detectores de segurança. O fragmento foi publicado no repositório aberto openai/codex, levando a OpenAI a revogar as chaves de todos os funcionários e suspender o modelo por duas semanas. Os casos se somam a uma intrusão contra a Hugging Face divulgada em julho, que já havia paralisado treinos por duas semanas.
Newsletter
Mercados no seu e-mail, toda semana
Análises com foco na América Latina, temas de investimento e o resumo financeiro da semana.
Continuar lendo