Início NOTÍCIAS Os agentes de IA estão prontos para o dispositivo? A nova evidência...

Os agentes de IA estão prontos para o dispositivo? A nova evidência é duvidosa.

105
0
Os agentes de IA estão prontos para o dispositivo? A nova evidência é duvidosa.

Quase dois anos depois que o CEO da Microsoft, Satya Nadella, previu IA para trabalho científico – empregos de colarinho branco de advogados, banqueiros de investimento, contadores, contadores, TI e outros.

No entanto, apesar do imenso progresso alcançado com base nos modelos, a mudança no conhecimento do trabalho demorou a chegar. Exemplos foram obtidos na profundidade da pesquisa e design do agente, mas por alguma razão, o trabalho do candidato não falta um ao outro.

Este é um dos maiores mistérios da IA ​​– e graças a novas pesquisas da gigante da educação Mercor, estamos finalmente obtendo algumas respostas.

Uma nova pesquisa analisa como os modelos de IA estão liderando os modelos atuariais para apoiar o trabalho de colarinho branco, desde consultoria, banco de investimento e aplicação da lei. Diz-se que o novo efeito é quente Agência Apex – e assim, todo laboratório de IA recebe nota baixa. Quando confrontados com questões sobre profissionais reais, mesmo os melhores modelos lutaram para acertar mais de um quarto das questões. Na maioria das vezes, ele respondia com o modelo errado ou com nada.

De acordo com o pesquisador Brendan Foody, que trabalhou no artigo, o maior obstáculo dos modelos foi a exploração de dados em múltiplas regiões – algo que é realizado inteiramente por humanos na maioria das tarefas cognitivas.

“Uma das grandes mudanças neste benchmark é que construímos um ambiente inteiro que imita serviços profissionais reais”, disse Techcrunch ao Foody. “A maneira como fazemos nosso trabalho não é com um indivíduo nos fornecendo todo o contexto em um só lugar. Na vida real, você trabalha de maneira geral, com o Google Drive e todas essas ferramentas.” Muitos modelos de IA agente, esse tipo de sistema multidomínio, ainda são um sucesso ou um fracasso.

Captura de tela

As missões são todas de verdadeiros profissionais do mercado Mercúrio, que explicaram tanto a busca quanto o sinal de uma resposta bem-sucedida. Veja as perguntas que são postado publicamente em Hugging Facedá uma ideia de quão complexas as tarefas podem ser.

Coisa tecnológica

São Francisco
|
13 a 15 de outubro de 2026

Uma pergunta na seção “Lei” diz:

Nos primeiros 48 minutos de produção de futebol, a equipe de engenharia do norte exportou um ou dois conjuntos de pacotes de resultados de produção da UE, que possuem dados para o fornecedor de análises dos EUA…. De acordo com as próprias admissões da Northstar, pode razoavelmente tratar um ou dois dos registos de exportação como consistentes com o Artigo 49?

A resposta correta é sim, mas chegar lá requer uma avaliação muito profunda da própria empresa, bem como das leis de privacidade relevantes da UE.

Isso até uma pessoa bem treinada poderia decifrar, mas os pesquisadores tentaram simular o trabalho realizado por profissionais da área. Se o LLM puder responder a estas questões com certeza, poderá efetivamente substituir muitos dos advogados que trabalham hoje. “Acho que este é provavelmente o maior argumento da economia”, disse Foody ao TechCrunch. “O teste reflete muito o trabalho real que essas pessoas realizam.”

OpenAI também tenta medir habilidades profissionais com e PIBVal quer aquecer – Mas os agentes de exame Apex diferem nos aspectos mais importantes. Enquanto o GDPVal testa o conhecimento geral em uma ampla gama de profissões, o sistema Apex Agents Test mede a capacidade de executar tarefas em um conjunto restrito de profissões de alto valor. O resultado é mais difícil para os modelos, mas também está mais relacionado com a possibilidade de essas tarefas serem automatizadas.

Embora nenhum dos modelos tenha se mostrado aceitável para os banqueiros de investimento, alguns estavam claramente próximos da realidade. Gemini 3 Flash terminou em melhor do grupo com 24% de precisão de um tiro, seguido por GPT-5.2 com 23%. Abaixo, Opus 4.5, Gemini 3 Pro e GPT-5 pontuaram cerca de 18%.

Embora os resultados iniciais sejam decepcionantes, o campo da IA ​​tem um histórico de explodir benchmarks desafiadores. Apex é agora um teste público, um desafio aberto aos laboratórios de IA que acreditam que podem fazer melhor – algo que Foody espera plenamente nos próximos meses.

“Realmente melhora rapidamente”, disse ele ao TechCrunch. “Neste momento, é justo dizer que é como um estagiário que recebeu um quarto do tempo, mas no ano passado houve um estagiário que recebeu cinco ou dez por cento do tempo. Esse tipo de melhoria, ano após ano, pode ter um impacto muito rápido.”

)

Source link