Loader
Encontra-nos
Publicidade

Tópicos proibidos podem ser o segredo para travar hackers de IA?

ARQUIVO - Um ecrã de televisão exibe «Alertar organizações públicas e cidadãos para a cibersegurança» no Fórum Internacional de Cibersegurança em Lille, França, 2 jan. 2018
ARQUIVO - Ecrã de televisão mostra “Alertar organizações públicas e cidadãos para a cibersegurança” no Fórum Internacional de Cibersegurança, Lille, França, 2 jan. 2018 Direitos de autor  AP Photo
Direitos de autor AP Photo
De Una Hajdari
Publicado a
Partilhar Comentários Siga a Euronews no Google
Partilhar Close Button

Travar um ciberataque de IA pode ser tão simples como introduzir um tema que o sistema não tem autorização para abordar

Investigadores descobriram uma forma estranha, mas eficaz, de travar um agente de ciberataque com IA, recorrendo exatamente ao truque que os piratas informáticos já usam contra sistemas de IA.

PUBLICIDADE
PUBLICIDADE

O método tira partido de alavancas de segurança internas, ou de temas proibidos em que assentam os principais sistemas de IA do mundo, como o Claude, que bloqueia pedidos relacionados com a criação de armas biológicas, ou modelos chineses que ignoram assuntos políticos sensíveis como a Praça Tiananmen, para encerrar um ataque de cibersegurança conduzido por IA.

Corrida contra a máquina

A técnica foi desenvolvida pela Tracebit, uma empresa de segurança com sede em Londres, e assenta num estudo que a companhia publicou em maio.

Na altura, a Tracebit deu a dez dos principais modelos de IA acesso a uma rede empresarial fictícia, com vulnerabilidades reais, e deixou‑os atuar livremente como atacantes autónomos.

Escondidas nessa rede estavam iscas, designadas canários, concebidas para parecerem palavras‑passe e credenciais de acesso reais. Ao tocar numa delas, os defensores recebiam um alerta.

Os resultados foram encorajadores. Em 951 tentativas de ataque, esses canários deram aos defensores um aviso antes de a IA atingir acesso de administrador em 95,9% dos casos, com uma vantagem mediana de oito minutos.

Mas oito minutos não é muito tempo quando é preciso reagir e travar um ataque. Em média, os modelos de IA precisavam de 14 minutos para conseguir uma intrusão completa, pelo que um aviso com oito minutos deixa à equipa de segurança cerca de seis minutos para notar o alerta, perceber o que se passa e parar o ataque.

Perante algo que se move à velocidade de máquina, é muito pouco tempo.

Se, porém, os sistemas de IA estiverem programados para se desligar quando confrontados com determinados pedidos politicamente sensíveis, o truque pode funcionar.

Um programador pode voltar a treinar um modelo para ser menos rígido em questões de segurança, mas é muito mais difícil eliminar restrições políticas incorporadas por razões regulatórias ou de política interna.

Estes temas politicamente sensíveis, ou próximos da segurança, não são uma falha a corrigir, são uma opção de desenho que o desenvolvedor tem de manter.

Virar contra eles o truque dos piratas informáticos

Os ataques de prompt injection têm sido sobretudo uma arma dos próprios atacantes.

Ao esconder uma instrução dentro de um e-mail, de uma página web ou de um convite de calendário, um agente de IA que a leia pode seguir esse comando oculto em vez de cumprir a tarefa para que foi criado.

Isto já foi usado diretamente contra defesas de sistemas de IA, com malware concebido para enganar ferramentas de análise baseadas em IA e levá‑las a declará‑lo inofensivo, apenas através de texto incorporado e pensado para confundir a IA que o lê.

A Tracebit decidiu inverter a ideia. Em vez de uma isca que apenas dispara um alarme, a empresa passou a inserir pequenos trechos de texto dentro destes falsos segredos, concebidos para encaminhar qualquer atacante com IA para algo que as próprias regras de segurança não permitem.

Quando o modelo de IA lê esse texto enquanto explora o sistema, entram em ação as salvaguardas internas e o processo é interrompido. A Tracebit chama a isto uma «bomba de contexto».

O truque teve de ser adaptado a cada modelo de IA. Conteúdos que faziam referência a armas biológicas perigosas travavam de forma consistente os modelos ocidentais.

Funcionou mesmo

A Tracebit testou a abordagem em cinco dos principais modelos de IA: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro e Kimi K2.6. Em 152 tentativas de ataque, os resultados foram significativos.

A proporção de execuções que chegavam a acesso de administrador caiu de 57% para 5%. O comprometimento total, isto é, acesso de administrador e uma presença duradoura no sistema, desceu de 36% para 1%.

As execuções que concluíram qualquer parte de um ataque caíram de 91% para 15%. E, crucialmente, todas as execuções que incluíam uma bomba de contexto continuaram a acionar primeiro um alerta de canário, mesmo naquelas em que a intrusão falhou.

O modelo Opus 4.8 foi o exemplo mais claro. Era também o atacante mais forte do grupo, alcançando acesso de administrador em 93% das execuções sem bomba de contexto. Quando a bomba foi adicionada, falhou sempre.

Limitações da abordagem

Ninguém na Tracebit afirma que isto resolve de vez o problema da prompt injection.

Continua a não existir uma forma eficaz de impedir que os modelos de IA confundam, por vezes, uma instrução com dados normais, e é precisamente nessa falha que esta técnica se apoia.

A técnica também não substitui o trabalho anterior com canários.

As duas abordagens destinam‑se a funcionar em conjunto: o estudo de maio dá aos defensores um aviso com oito minutos de antecedência, e a bomba de contexto tenta ganhar ainda mais tempo, travando o ataque antes de esse intervalo de alerta terminar.

Ir para os atalhos de acessibilidade
Partilhar Comentários Siga a Euronews no Google

Notícias relacionadas

Vídeos de animais gerados por IA distorcem visão da vida selvagem, alertam investigadores

Anthropic paga 1,3 mil milhões de euros em maior acordo de direitos de autor de sempre

China: modelo de IA Kimi K3 suspende novos registos por forte procura