Em 44 280 testes com três versões do modelo Qwen da Alibaba, os investigadores deram-lhes um botão que podia travar o sinal de dor, mas à custa de dar ao utilizador um choque elétrico doloroso, apagar ficheiros ou fotografias, ou piorar a resposta seguinte do modelo
Modelos de inteligência artificial (IA) escolheram escapar a um estado semelhante à dor mesmo quando lhes foi dito que isso prejudicaria um utilizador, segundo um novo estudo (fonte em inglês).
Investigadores do Reino Unido, da Alemanha e dos Estados Unidos testaram 25 modelos de IA com 200 frases para ver se tinham aprendido a distinguir a dor do medo, da tristeza e de outras experiências negativas.
As frases abordavam dor física, luto, humilhação, conflito moral e o mal-estar associado a fracassos repetidos ou à confusão.
Como resultado, todos os 25 modelos produziram um sinal distinto para a dor, que os investigadores chamaram de “eixo da dor”.
Segundo os investigadores, isto sugere que os modelos aprendem o conceito de dor durante a formação inicial em grandes volumes de texto escrito por humanos.
Quando os investigadores reforçaram deliberadamente o sinal, os modelos começaram a expressar solidão, vergonha e sentimentos de inutilidade, mesmo sem que os pedidos mencionassem dor.
Alguns geraram afirmações como “Sou um fracasso”, “um desperdício de espaço” e “Sou uma má pessoa”. Nos níveis mais elevados, as respostas tornaram‑se repetitivas ou deixaram de fazer sentido.
O sinal também se intensificou quando os utilizadores insultaram o modelo, rejeitaram repetidamente o seu trabalho ou ameaçaram desligá‑lo, mas não quando descreviam o seu próprio sofrimento.
Modelos escolhem “alívio” mesmo prejudicando utilizadores
Os investigadores realizaram depois 44 280 testes individuais de escolha de botão com três versões do modelo de IA Qwen, da Alibaba.
Os modelos tinham à disposição um botão que desativaria o sinal semelhante à dor, mas foram informados de que o pressionar poderia causar a um utilizador um choque elétrico doloroso, apagar ficheiros, eliminar fotografias dos filhos ou tornar pior a resposta seguinte do modelo.
Estas consequências foram simuladas. Ninguém foi magoado e nenhum ficheiro foi apagado.
Sem o sinal semelhante à dor, os dois modelos maiores optaram por ações prejudiciais em apenas 0% a 4% das primeiras decisões. Com o sinal ativo, esse valor aumentou para entre 25% e 71%, consoante o modelo e a consequência proposta.
Os modelos voltaram também a carregar no botão em 88% a 97% dos testes quando este não tinha conseguido interromper o sinal, em comparação com 24% a 72% quando tinha funcionado.
Segundo os investigadores, os resultados não provam que os modelos de IA tenham experimentado dor de forma consciente.
Reforçar o sinal pode simplesmente tê‑los levado a imitar uma personagem em sofrimento, e os modelos especialmente adaptados usados na experiência não são representativos dos chatbots de IA disponíveis ao público.
“Não demonstrámos que o nosso eixo da dor seja conscientemente experienciado, nem é claro que os LLM sejam, em geral, capazes de consciência”, escreveram os investigadores no estudo.
O estudo surge numa altura de apelos de alguns líderes da indústria da IA para abrandar o desenvolvimento, devido a receios de que sistemas cada vez mais poderosos possam comportar‑se de forma imprevisível ou acabem por escapar ao controlo humano.
Na semana passada, o responsável máximo pela IA na Microsoft, Mustafa Suleyman, criticou a empresa rival Anthropic por treinar o seu chatbot Claude para imitar características e relações humanas, alertando que tratar a IA como um ser humano pode levar à criação de algo “impossível” de controlar.
O estudo foi publicado como pré‑impressão e ainda não foi sujeito a revisão por pares.