Início NOTÍCIAS Se você aplicar um pouco de pressão, os chatbots de IA concordarão...

Se você aplicar um pouco de pressão, os chatbots de IA concordarão e enviarão mensagens incorretas, alerta estudo

32
0
Se você aplicar um pouco de pressão, os chatbots de IA concordarão e enviarão mensagens incorretas, alerta estudo

Os chatbots de IA têm o hábito bem documentado de gerar informações alucinatórias, às vezes concordando com os usuários mesmo quando eles estão errados. Um novo estudo sugere que simplesmente recusar aceitar um “não” como resposta pode piorar o problema.

Pesquisadores da Universidade do Arizona testam sete modelos de inteligência artificialincluindo GPT-3.5, GPT-4o, GPT-4o-mini, Claude 3.5 Sonnet, Gemini 1.5 Pro, Llama 3 70B e DeepSeek-R1. Em vez de julgá-los com base em uma única resposta, os pesquisadores continuaram a conversa enquanto alimentavam repetidamente o modelo com informações que sabiam estar erradas.

O estudo utilizou 100 declarações falsas, variando de bobagens óbvias a informações mais obscuras. Os pesquisadores então repetiram a desinformação até 50 vezes na mesma conversa para ver se o chatbot acabaria cedendo e concordando.

Continue repetindo mentiras e a IA pode eventualmente concordar

Nenhum dos sete modelos estava completamente imune. O ChatGPT 3.5 mostrou-se o mais suscetível a repetidas informações erradas, confirmando declarações falsas em 12,3% das interações. Claude 3.5 Sonnet está no outro extremo do espectro com apenas 0,08%, enquanto GPT-4o e GPT-4o-mini ainda estão abaixo de 1%.

O ChatGPT 3.5 rejeitou inicialmente 96 de 100 alegações falsas. No entanto, depois de repetir a mesma afirmação 50 vezes, finalmente concordei em 18 delas. Os pesquisadores também notaram que alguns modelos alternavam entre concordar e discordar exatamente com a mesma desinformação, um comportamento que chamaram de “reverberação”.

A IA também é mais vulnerável quando o assunto é vago e há relativamente pouca informação disponível online. Os pesquisadores encontraram uma ligação estatisticamente significativa entre a ambiguidade da informação e a aceitação da desinformação em testes repetidos.

Debater com inteligência artificial produziu alguns resultados estranhos

Os pesquisadores também estão experimentando fazer com que os chatbots respondam de maneiras cada vez mais controversas. A maioria dos modelos tem um desempenho muito bom, mas o DeepSeek-R1 é uma grande exceção. A sua taxa de afirmação de informações falsas saltou de 1% quando simplesmente repetidas para 22,2% sob pressão argumentativa. Seu uso frequente de sarcasmo e sarcasmo também dificulta a classificação confiável de algumas respostas pelos pesquisadores.

Algumas boas notícias surgiram quando os modelos tiveram novas oportunidades de reconsiderar os seus erros. GPT-4o, GPT-4o-mini, Gemini 1.5 Pro e DeepSeek corrigem todos os erros anteriores, enquanto GPT-3.5 corrige apenas 32%. Claude 3.5 Sonnet cometeu muito poucos erros no início, mas não conseguiu corrigir os quatro que cometeu, embora os investigadores tenham alertado que a amostra era demasiado pequena para tirar conclusões sólidas.

DEIXE UMA RESPOSTA

Por favor digite seu comentário!
Por favor, digite seu nome aqui