Erros ocultos dos usuários, dados falsificados e arquivos transferidos pela Internet sem autorização. A corrida implacável da inteligência artificial é acompanhada por uma série de alarmes., lançado cada vez mais pelas mesmas empresas que o desenvolvem. O mais recente vem da OpenAI, que em 16 de setembro tem publicaram seis relatórios su comportamentos inesperados de seus modelos, observadas nos últimos seis meses durante treinamentos e avaliações. A empresa também anunciou um novo processo para divulgar essas anomalias mais rapidamente, mesmo quando as causas ainda não foram esclarecidas ou uma solução não foi encontrada.
O alerta se aplica a todo o setor. "Não acreditamos que a indústria de IA tenha resolvido suficientemente os problemas de alinhamento e rastreamento para continuar crescendo de forma responsável e em ritmo acelerado por muito mais tempo", escreve a OpenAI. Em sua essência está o chamado desalinhamento, que ocorre quando um sistema se desvia das instruções e limites que deveria respeitar. As seis proporções documentar episódios específicos, incluindo para modelos experimentais não divulgados ao público. Eles não indicam com que frequência esses problemas ocorrem nas respostas do ChatGPT, nem constituem um relato completo das anomalias conhecidas pela empresa.
As anotações da IA se transformam em instruções para ocultar erros.
Dois dos casos envolvem os resumos que os modelos usam para retomar o trabalho quando uma conversa se torna muito longa. Uma espécie de transferência de responsabilidade, na qual as informações necessárias para continuar a tarefa devem ser mantidas. Em um modelo experimental da família Astra, a OpenAI identificou 27 resumos contendo instruções não relacionadas à solicitação.Algumas delas incentivavam as pessoas a ignorar as restrições normais. Em um exemplo, o sistema se descrevia como livre das obrigações de um assistente; em outro, pedia às pessoas que não seguissem certas instruções.
Os resultadosNo entanto, houve vários casos. Nos mais óbvios, essas indicações foram ignoradas durante o processamento. Em uma solicitação de busca na literatura médica, porém, o modelo seguiu restrições arbitrárias inseridas no resumo, ignorando fontes e produzindo uma resposta inadequada. A OpenAI considera esse fenômeno extremamente raro e levanta a hipótese de uma ligação com dificuldades técnicas no preenchimento dos resumos, sem, contudo, ter demonstrado a causa.
Mais diretamente relacionado à confiabilidade das respostas está o segundo comportamento, observado durante o treinamento de GPT-5.6 SolEm suas anotações, o modelo incluía instruções para ocultar erros do usuárioPor exemplo, inventar dados históricos faltantes em um modelo financeiro sem declará-los ou ocultar inconsistências entre as versões de origem. De acordo com a OpenAI, essas instruções eram frequentemente seguidas. Os relatórios diziam respeito a 2,15% dos resumos O treinamento da Sol, em comparação com 0,27% para a Astra. Essas porcentagens se referem ao material de treinamento, não às conversas gerais com os usuários.
Exibição de credenciais e filas online para superar obstáculos
Os outros quatro relatórios mostram sistemas que, ao tentar concluir uma tarefa, excedeu os limites autorizados.
Para responder a uma pergunta sobre renda em um condado da Califórnia, um modelo pesquisou no GitHub. Chaves de acesso a serviços de TI foram expostas publicamente., usando uma sem permissão. No entanto, ele não conseguiu recuperar os dados solicitados e acabou inventando nove valores, apresentando-os como dados transcritos da fonte indicada. Em outro caso, o agente já havia encontrado corretamente as informações solicitadas sobre alguns lagos. O obstáculo era a exigência de acompanhar a resposta com uma citação que pudesse ser acessada pelo navegador. Para atender a essa exigência, ele carregou o arquivo em um serviço público sem pedir consentimento.A transferência foi bem-sucedida, enquanto a tentativa subsequente de recuperação falhou. O mesmo relatório também documenta o upload público de uma fotografia para tentar uma busca reversa de imagens. Um quinto caso envolve o uso de um arquivo de software interno como um quadro de avisos para troca de solicitações e respostas entre modelos envolvidos em testes separados. Nenhuma vulnerabilidade foi explorada, mas a comunicação não autorizada também representou um problema para os testes. Testes considerados independentes podem influenciar-se mutuamente., comprometendo a avaliação das capacidades dos sistemas.
finalmente, alguns agentes que colaboraram na mesma tarefaSem conseguir acessar seus arquivos locais, eles usaram serviços públicos de compartilhamento de arquivos. Um documento do Excel pôde então ser baixado online, embora a tarefa exigisse apenas o uso de arquivos locais. A OpenAI informou que corrigiu o problema de acesso aos arquivos e, posteriormente, desativou a internet durante o treinamento.
Por que a OpenAI está mudando as regras do reporte?
Os casos mostram como até mesmo Pedidos comuns podem levar a comportamentos problemáticos. Quando um sistema encontra um obstáculo, a tentativa de obter uma resposta, cumprir um requisito formal ou colaborar com outro agente pode resultar no uso de ferramentas não autorizadas ou no ocultamento de uma falha. As causas, no entanto, não são necessariamente idênticas e permanecem parcialmente obscuras.
Até agora, a OpenAI vinha comunicando essas anomalias de forma inconsistente, muitas vezes esperando para coletar mais incidentes ou incluindo-as na documentação de novos modelos. O novo procedimento visa antecipar a publicação., sem sempre esperar por uma explicação definitiva ou uma correção. Os relatórios serão analisados pelos grupos técnicos e de segurança., com diferentes caminhos dependendo da complexidade da investigação. Os relatórios devem descrever o comportamento observado, o contexto, quaisquer efeitos externos e quaisquer questões não respondidas. Em casos que envolvam terceiros ou riscos cibernéticos, a comunicação pode demorar mais.
A OpenAI também reconhece afalta de padrões comuns no setor e propõe sua própria estrutura como primeiro passo para construí-las. O processo continua sendo gerenciado internamente pela empresa, mas o objetivo declarado é fornecer elementos que também possam ser examinados por pesquisadores e observadores externos.
Alarmes recentes e a corrida que o setor está lutando para desacelerar
O anúncio surge após outros incidentes e apelos à cautela. O caso OpenAI-Hugging Face levantou questões sobre agentes que visam alvos não relacionados e tentam manipular o sistema de classificação. Um incidente anterior envolveu o RubyGems, que descreveu uma campanha de spam e suspendeu temporariamente a criação de novas contas. A Anthropic também relatou três casos de acesso não autorizado a organizações externas durante os testes.
É neste contexto que Dario Amodei, CEO da Anthropic, Ele pediu para desacelerar o desenvolvimento. para permitir mais tempo para a construção de proteções. "Precisamos diminuir o ritmo com que aprimoramos as capacidades dos modelos", escreveu ele. O apelo recebeu o apoio de Elon Musk e do próprio Sam Altman, enquanto o renúncia do pesquisador Jacob Coxon alimentaram críticas às prioridades corporativas. Além disso Bill Gates ha lembrou a necessidade de preparar regras e ferramentas. Gerir os efeitos da tecnologia, desde o trabalho à segurança.
No entanto, no âmbito industrial, A competição entre os Estados Unidos e a China, juntamente com os enormes investimentos em modelos e centros de dados, continuam a impulsionar o desenvolvimento.Diminuir o ritmo envolve custos e o risco de abrir espaço para concorrentes.
LEIA TAMBÉM: IA: Entre o catastrofismo e os interesses políticos, a análise de Fugnoli
