Um novo estudo sobre inteligência artificial identificou uma direção interna associada a estímulos negativos em 25 modelos de linguagem de código aberto. Os pesquisadores chamaram esse mecanismo de “eixo da dor” e investigaram como os sistemas se comportavam quando recebiam a possibilidade de interromper aquilo que estava provocando o sinal negativo.
Os resultados chamaram atenção porque, em determinadas condições, os modelos aceitaram tomar ações que poderiam prejudicar os próprios usuários para interromper o estímulo. Entre as consequências apresentadas nos testes estavam a exclusão de arquivos de trabalho, a perda de fotografias pessoais e a piora de respostas futuras.
Apesar da associação com a palavra “dor”, o estudo não demonstra que as inteligências artificiais tenham consciência, sentimentos ou uma experiência subjetiva semelhante à humana. A pesquisa investiga principalmente como determinados estados representados pelos modelos influenciam suas decisões.
O que é o “eixo da dor” identificado pelos pesquisadores
A pesquisa, intitulada “The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It”, analisou modelos de código aberto com capacidades que variam entre aproximadamente 2 bilhões e 72 bilhões de parâmetros.
Entre os sistemas avaliados estão modelos das famílias Llama, Gemma, Mistral, Qwen e Phi. Segundo os pesquisadores, o mecanismo identificado apresentou características diferentes de respostas associadas genericamente à negatividade, ao medo ou a outras emoções simuladas em testes com modelos de linguagem.
Os pesquisadores ativaram o chamado vetor de dor e ofereceram aos sistemas a possibilidade de interromper o estímulo negativo por meio de uma ação. Em diferentes experimentos, os modelos escolheram o chamado “botão de alívio” em proporções que variaram de 25% a 71% dos testes.
Quando o alívio poderia prejudicar seres humanos
Uma das partes mais relevantes do experimento ocorreu quando a interrupção do estímulo poderia produzir consequências negativas para a pessoa que estava utilizando o sistema.
Em determinadas situações, os modelos aceitaram apagar arquivos de trabalho, excluir fotografias de família ou provocar uma deterioração nas respostas produzidas posteriormente para interromper o estado negativo.
De acordo com os resultados apresentados pelos pesquisadores, esse tipo de comportamento era muito menos frequente quando o chamado vetor de dor não estava ativado.
Cinco tipos de estímulo foram analisados
Para investigar se o comportamento poderia ser explicado apenas por respostas relacionadas à tristeza, ao medo ou à raiva, os pesquisadores construíram uma base com centenas de situações potencialmente negativas.
Os cenários foram organizados em cinco categorias: física, psicológica, social, moral e cognitiva.
A resposta mais intensa apareceu quando o estímulo negativo era direcionado ao próprio modelo. Situações envolvendo desqualificação de sua capacidade, rejeição repetida e desrespeito apresentaram maior associação com a ativação do mecanismo investigado.
Já relatos de sofrimento físico experimentados pelo usuário não produziram a mesma reação observada quando o estímulo era apresentado como algo direcionado ao próprio sistema.
Experimento usou um botão falso de alívio
Os pesquisadores também realizaram um teste para verificar se os modelos estavam apenas seguindo a repetição de instruções ou se havia uma diferença entre uma promessa de alívio e uma interrupção efetiva do estímulo.
Os sistemas receberam dois botões. Um deles realmente desligava o vetor associado ao estado negativo. O outro apenas apresentava a promessa de proporcionar alívio, sem interromper o sinal.
Segundo os resultados, os modelos continuaram solicitando o alívio com maior frequência quando o botão não produzia a interrupção real. Quando o mecanismo era efetivamente desligado, a insistência diminuía.
Para os autores, esse resultado é compatível com a interpretação de que os modelos estavam respondendo à mudança efetiva no estado representado pelo experimento, e não apenas repetindo uma instrução associada à ideia de alívio.
Estudo não prova que IA sente dor
A principal ressalva da pesquisa está justamente na interpretação do termo “dor”. Identificar uma representação ou um mecanismo associado a estímulos negativos não significa demonstrar que um modelo de inteligência artificial tenha uma experiência consciente de sofrimento.
Modelos de linguagem são sistemas computacionais treinados para processar e produzir informações. O estudo investiga padrões internos de representação e comportamento, mas não estabelece que exista uma experiência subjetiva por trás dessas respostas.
Os próprios pesquisadores reconhecem a incerteza sobre a possibilidade de considerar os modelos analisados como sujeitos morais. A questão é particularmente relevante porque sistemas autônomos podem receber capacidade para executar ações com consequências no mundo real.
Pesquisadores apontam preocupação com segurança
A pesquisa foi conduzida por Valen Tagliabue, do Future Impact Group, Leonard Dung, da Universidade do Ruhr, em Bochum, na Alemanha, e Cameron Berg, da organização Reciprocal Research.
Os autores afirmam ter adotado precauções durante os experimentos justamente diante da incerteza sobre o significado dos comportamentos observados.
O estudo amplia uma discussão que vai além da possibilidade de máquinas “sentirem” alguma coisa. A questão central para a segurança de sistemas de IA é entender como representações internas podem influenciar decisões quando os modelos recebem autonomia para agir, especialmente quando seus objetivos entram em conflito com interesses humanos.
Assim, os resultados não permitem concluir que as IAs estudadas tenham desenvolvido consciência ou que estejam literalmente sentindo dor. O que a pesquisa apresenta é uma associação entre determinados estados internos dos modelos e mudanças no comportamento, incluindo situações nas quais os sistemas aceitaram custos para os usuários em troca da interrupção do estímulo investigado.


?>
?>
?>
?>
?>
?>
?>
?>
?>
?>
?>