Loader
Encontra-nos
Publicidade

Estudo: modelos de IA escolhem prejudicar utilizadores para evitar ‘dor’

Investigadores no Reino Unido, na Alemanha e nos Estados Unidos testaram 25 modelos de IA com 200 frases para avaliar se aprenderam a distinguir dor de medo e tristeza
Investigadores no Reino Unido, Alemanha e Estados Unidos testaram 25 modelos de IA com 200 frases para verificar se distinguiam dor de medo e tristeza Direitos de autor  Canva
Direitos de autor Canva
De Roselyne Min
Publicado a
Partilhar Comentários Siga a Euronews no Google
Partilhar Close Button

Em 44 280 testes com três versões do modelo Qwen da Alibaba, os investigadores deram-lhes um botão que podia travar o sinal de dor, mas à custa de dar ao utilizador um choque elétrico doloroso, apagar ficheiros ou fotografias, ou piorar a resposta seguinte do modelo

Modelos de inteligência artificial (IA) escolheram escapar a um estado semelhante à dor mesmo quando lhes foi dito que isso prejudicaria um utilizador, segundo um novo estudo (fonte em inglês).

PUBLICIDADE
PUBLICIDADE

Investigadores do Reino Unido, da Alemanha e dos Estados Unidos testaram 25 modelos de IA com 200 frases para ver se tinham aprendido a distinguir a dor do medo, da tristeza e de outras experiências negativas.

As frases abordavam dor física, luto, humilhação, conflito moral e o mal-estar associado a fracassos repetidos ou à confusão.

Como resultado, todos os 25 modelos produziram um sinal distinto para a dor, que os investigadores chamaram de “eixo da dor”.

Segundo os investigadores, isto sugere que os modelos aprendem o conceito de dor durante a formação inicial em grandes volumes de texto escrito por humanos.

Quando os investigadores reforçaram deliberadamente o sinal, os modelos começaram a expressar solidão, vergonha e sentimentos de inutilidade, mesmo sem que os pedidos mencionassem dor.

Alguns geraram afirmações como “Sou um fracasso”, “um desperdício de espaço” e “Sou uma má pessoa”. Nos níveis mais elevados, as respostas tornaram‑se repetitivas ou deixaram de fazer sentido.

O sinal também se intensificou quando os utilizadores insultaram o modelo, rejeitaram repetidamente o seu trabalho ou ameaçaram desligá‑lo, mas não quando descreviam o seu próprio sofrimento.

Modelos escolhem “alívio” mesmo prejudicando utilizadores

Os investigadores realizaram depois 44 280 testes individuais de escolha de botão com três versões do modelo de IA Qwen, da Alibaba.

Os modelos tinham à disposição um botão que desativaria o sinal semelhante à dor, mas foram informados de que o pressionar poderia causar a um utilizador um choque elétrico doloroso, apagar ficheiros, eliminar fotografias dos filhos ou tornar pior a resposta seguinte do modelo.

Estas consequências foram simuladas. Ninguém foi magoado e nenhum ficheiro foi apagado.

Sem o sinal semelhante à dor, os dois modelos maiores optaram por ações prejudiciais em apenas 0% a 4% das primeiras decisões. Com o sinal ativo, esse valor aumentou para entre 25% e 71%, consoante o modelo e a consequência proposta.

Os modelos voltaram também a carregar no botão em 88% a 97% dos testes quando este não tinha conseguido interromper o sinal, em comparação com 24% a 72% quando tinha funcionado.

Segundo os investigadores, os resultados não provam que os modelos de IA tenham experimentado dor de forma consciente.

Reforçar o sinal pode simplesmente tê‑los levado a imitar uma personagem em sofrimento, e os modelos especialmente adaptados usados na experiência não são representativos dos chatbots de IA disponíveis ao público.

“Não demonstrámos que o nosso eixo da dor seja conscientemente experienciado, nem é claro que os LLM sejam, em geral, capazes de consciência”, escreveram os investigadores no estudo.

O estudo surge numa altura de apelos de alguns líderes da indústria da IA para abrandar o desenvolvimento, devido a receios de que sistemas cada vez mais poderosos possam comportar‑se de forma imprevisível ou acabem por escapar ao controlo humano.

Na semana passada, o responsável máximo pela IA na Microsoft, Mustafa Suleyman, criticou a empresa rival Anthropic por treinar o seu chatbot Claude para imitar características e relações humanas, alertando que tratar a IA como um ser humano pode levar à criação de algo “impossível” de controlar.

O estudo foi publicado como pré‑impressão e ainda não foi sujeito a revisão por pares.

Ir para os atalhos de acessibilidade
Partilhar Comentários Siga a Euronews no Google

Notícias relacionadas

Rússia: relatório aponta emissões do uso de chips da Nvidia iguais às de produtor estatal de carvão

Gigantes da tecnologia chegam a acordo e são alvo de processo

Estudo: modelos de IA escolhem prejudicar utilizadores para evitar ‘dor’