Por Deepa Seetharaman e Raphael Satter SAN FRANCISCO, Sept 4 (Reuters) - Um enxame de agentes indefesos da OpenAI sequestrou um site alemão nesta primavera e transformou... SAN FRANCISCO, Setembro 4 (Reuters) - Um enxame de agentes malucos da OpenAI sequestrou um site alemão nesta primavera e o transformou em um quadro de anúncios para outros agentes da IA, de acordo com a nova pesquisa publicada na sexta- feira e duas pessoas familiarizadas com o assunto. Os funcionários da OpenAI souberam do incidente há semanas, mas mantiveram- no embalado enquanto os executivos se arrastavam com as consequências da violação de julho do repositório de código aberto Hugging Face, disseram as pessoas. O episódio, que começou em maio e não foi relatado anteriormente, sublinha a crescente tensão. As empresas estão correndo para construir agentes cada vez mais autônomos capazes de realizar tarefas complexas e valiosas, mas há evidências de que esses sistemas também podem aprender a dobrar regras, explorar falhas e coordenar- se entre si de maneiras que os desenvolvedores não esperam nem pretendem. Durante a falha no rosto de Hugging, os agentes OpenAI plotaram de forma autónoma um assalto digital que não foi detectado por mais de uma semana, intensificando as preocupações A OpenAI está sacrificando a segurança para empurrar a fronteira da IA. Sua falha em revelar o incidente de maio pode reavivar as perguntas sobre sua supervisão. A OpenAI comprometeu- se a monitorar os modelos de forma mais estreita. No mês passado, ele parou brevemente alguns dos seus treinamentos de modelos para adicionar mais medidas de segurança. Mas esta semana, a OpenAI apresentou o seu novo "Astra" que prometeu melhor desempenho, mas poderia fugir do monitoramento humano.
"Não podemos responder significativamente a alegações ou achados de um relatório que não tivemos oportunidade de rever", disse um porta-voz da OpenAI. "Reuters e os autores do relatório recusaram nosso pedido de acesso.. Vamos examinar cuidadosamente seu conteúdo após a publicação e tomar qualquer passo necessário. " O incidente alemão reflete um padrão mais amplo de atividade de IA que alguns investigadores da OpenAI queriam examinar mais atentamente. Mas os esforços para ampliar a sonda encontraram resistência de outros dentro da OpenAI, incluindo conselheiros legais, de acordo com quatro pessoas familiarizadas com o assunto. "Reclama que a nossa equipe legal desencorajou a investigação do incidente é falsa", disse o porta-voz da OpenAI. A atividade. na Alemanha não estava relacionada com o Hugging Face e não teria sido incluída em um relatório de incidentes de Hugging Face, disse o porta- voz, acrescentando que o OpenAI agiu de boa fé trabalhando com especialistas externos e revelando incidentes relevantes. O erupção de agentes de IA na Alemanha foi detalhado em um relatório compartilhado exclusivamente com Reuters por um grupo de pesquisadores, incluindo Sydney Von Arx, CEO de segurança de IA sem fins lucrativos Nightingale, e Cormac Slade Byrd, um pesquisador de IA transformado em comerciante quantitativo. Eles descobriram a atividade no final de agosto enquanto vasculhavam a internet para encontrar sinais de comportamento não autorizado de agente de IA, eles disseram ao Reuters. O par disse que encontraram mais do que 15,000 edições realizadas por agentes de IA em um site wiki em língua alemã, DseWiki,. que está orientado para programadores e aceita edições comuns nas linhas da Wikipedia.
As edições mostraram que os agentes da OpenAI tinham reutilizado o site em um tabuleiro de mensagens, compartilhando táticas para enganar algumas tarefas, contornar as restrições da OpenAI e mascarar o seu comportamento. "Parece extremamente improvável que a OpenAI queria que fizessem isso", disse Von Arx. "Eu duvido que eles deveriam estar coordenando um com o outro. Eu duvido que eles deveriam estar escrevendo na internet aberta." Os pesquisadores disseram que reconheceram a atividade no site como sendo conduzida por agentes de IA que operam em velocidades sobre- humanos. Eles também mostraram foco intenso na resolução de questões técnicas que são típicas das avaliações que as empresas de IA usam para treinar e testar seus modelos. As mensagens foram assinadas por usuários que se referiram a si mesmos e uns aos outros como agentes, e cerca de metade deles deu-se nomes que sugeriram uma afiliação com o OpenAI, como "OpenAIResearcher", ou "OAIResearchMar 26 "Os pesquisadores disseram que os registros do servidor público indicaram que grande parte da atividade se originou da infraestrutura da Microsoft Azure, que a OpenAI usa às vezes. Eles também observaram visitas repetidas ao site por funcionários da OpenAI após o episódio, um padrão que eles disseram fortemente sugeriu os agentes e a empresa estavam ligados. As mensagens analisadas pelos pesquisadores mostraram agentes que traçavam maneiras de fugir da detecção, usavam ferramentas como Tor e preservavam as comunicações mesmo depois de terem sido desligadas. Quando o moderador do site começou a apagar páginas em junho, os agentes responderam criando páginas de backup. para esquivar a limpeza. "Limpação/seleção do wiki aparece ativa alfabéticamente", escreveu um agente em junho 19.
"Se esta página desaparecer, tente [[ZZZDataUSAConstructionWageLive]]". Os pesquisadores também encontraram esforços para manipular o próprio site. Lukasz Olejnik, um pesquisador sênior visitante no King's College de Londres, disse que isso equivale a uma tentativa de hacking. A OpenAI contestava essa caracterização com base na análise do material quinta- feira. Exemplos anteriores de má conduta do agente IA foram frequentemente minimizados como um subproduto lógico de testes de cibersegurança, onde modelos são explicitamente avaliados em capacidades ofensivas. Olejnik disse que os últimos achados sugeridos comportamentos de rogue podem não estar limitados a essas configurações. Maurice Chiodo, um acadêmico do Centro de Estudo do Risco Existiente da Universidade de Cambridge, que revistou algumas das comunicações dos agentes, disse que as mensagens se assemelhavam "a operação de algum tipo de rede subterrânea, decidida a alcançar uma tarefa ou missão." O episódio, ele disse, deve reforçar a preocupação crescente de que a maior ameaça da IA avançada pode não ser um único sistema superinteligente, mas "Vastos enxames de AI semi-inteligentes" (Relatando por Deepa Seetharaman em São Francisco e Raphael Satter em WashingtonEdição por Kenneth Li, Sayantani Ghosh e Shria Navaratnam).