É uma regressão antrópica num plano que os concorrentes teriam secretamente limitado, utilizando o novo modelo de IA, Claude Fable V, para desenvolver outros modelos de IA. A empresa mudou de rumo depois que a mudança recebeu uma reação significativa da comunidade de pesquisa de IA.
“Estamos mudando a história de 5 proteções para os objetivos de desenvolvimento do LLM para torná-los visíveis”, disse a Antropologia em comunicado à WIRED. “Fizemos a troca errada e lamentamos não ter acertado o equilíbrio.”
A Anthropic lançou Claude Fable V, uma versão de seu mais recente modelo de IA com guardas de segurança adicionais projetados para evitar abusos, no início desta semana. Algumas das precauções antropogénicas foram postas em prática: a empresa disse que transformará os utilizadores que fazem perguntas sobre segurança cibernética, biologia ou química num modelo de IA menos capaz para reduzir as hipóteses de alguém utilizar uma IA avançada para realizar um ataque cibernético ou construir uma arma biológica.
Mas para os pesquisadores que desejam usar Claudius Fable V para fins de desenvolvimento de IA, ele delineou uma abordagem antrópica diferente. A empresa degrada deliberadamente o modelo de trabalho de maneiras invisíveis para o usuário. Para sabotar efetivamente o movimento, os pesquisadores estão tentando usar Claudius para treinar modelos de IA concorrentes que proíbem explicitamente o antropomorfismo. mandato.
A Anthropica agora diz que mudou de rumo, e o Fable V de Claudio contará com proteções para o desenvolvimento de IA dos usuários. Se uma empresa suspeitar que um usuário está tentando usar Close para construir uma IA mais capaz, ela avisará que está negando a solicitação ou movendo o usuário de volta para um modelo menos capaz.
Antropomorfizou o plano depois de receber forte reação da comunidade de pesquisa de IA. A Anthropic já tomou medidas para limitar os concorrentes usando a plataforma para construir modelos de IA fechados e de código aberto, mas os críticos dizem que isso está prejudicando tacitamente o modelo de trabalho para alguns usuários. O agente de codificação de Claudio tornou-se uma ferramenta preferida entre os desenvolvedores, incluindo aqueles que trabalham em projetos de pesquisa de IA de código aberto, e os pesquisadores dizem à WIRED que o plano mais recente da empresa poderia ter levado à interrupção, na qual apenas alguns laboratórios líderes de IA poderiam realizar pesquisas avançadas de IA.
Dean Ball, pesquisador sênior da Fundação para a Inovação Americana e ex-conselheiro da Casa Branca em IA, escreveu em depois em 10, que “o desempenho defeituoso na pesquisa de ML *sem avisar o usuário* é nojento e assustador”. Ele continuou em outro depois essa política de “sabotagem secreta” mina o status quo antrópico superior porque impede os investigadores de IA de pôr fim à segurança na cooperação em IA.
“Parecia que a Anthropic disse abertamente: ‘Não confiamos na IA para fazer pesquisas em IA.’ Somos os únicos que deveríamos fazer pesquisas em IA”, diz Will Brown, líder de pesquisa da startup de IA de código aberto First Intelligence. “Parece que eles estão começando a subir a escada atrás deles.”
Brown disse que a decisão também deixou os desenvolvedores no escuro sobre se estavam violando as regras de direitos humanos, já que a empresa não os alertou quando usou suas proteções. Ele acrescentou restrições que poderiam ter as consequências mais amplas possíveis. Por exemplo, ele salienta que um ecossistema crescente de empresas de avaliação externas testa modelos limitados em termos de segurança, desempenho e fiabilidade – trabalho que poderia ser evitado se os modelos antropogénicos fossem secretamente degradados.



