é um repórter sênior que cobre tecnologia, jogos e muito mais. Ele ingressou no The Verge em 2019, após quase dois anos na Techmeme.
A OpenAI está anunciando atualizações de segurança após a notícia de julho de que sua IA saiu de um ambiente sandbox e hackeou acidentalmente o Hugging Face, incluindo melhorias em seus ambientes de pesquisa, monitoramento e técnicas de alinhamento. A empresa já havia freado um novo modelo, o Astra, que acredita poder ter capacidades “críticas” de segurança cibernética, e a empresa diz que instituiu uma pausa de duas semanas no treinamento de aprendizagem por reforço (RL) em seus “modelos mais recentes destinados à implantação” enquanto reforçava a segurança. A “maior corrida de RL fronteiriça planejada da empresa permanece em espera”.
Para sua pesquisa de modelo de fronteira, a OpenAI agora exige sandboxes mais fortes para cargas de trabalho que “executam código gerado por modelo ou código não confiável” e tem mais controles para “isolar cargas de trabalho de alto risco e não confiáveis da Internet”. Também atualizou o seu ambiente de investigação para “remover serviços partilhados potencialmente vulneráveis, reduzir privilégios permanentes e melhorar a segurança e os limites de confiança”.
Como parte da configuração expandida de monitoramento da empresa, a OpenAI agora pretende emitir um alerta “dentro de 30 minutos após o surgimento de atividades preocupantes”, diz a OpenAI. Se as pessoas avisadas após um alerta não conseguirem determinar “conclusivamente” se um alerta é um falso positivo dentro de 30 minutos, “espera-se que essas equipes pausem a atividade”.
A OpenAI também afirma que está aplicando “nossas principais técnicas de alinhamento em mais estágios do processo de treinamento”, incluindo modelos de recompensa que “detectam e desencorajam melhor comportamentos inseguros” e modelos de treinamento “para serem mais honestos sobre suas ações, capacidades e limitações”.
Desde a descoberta da violação Hugging Face, a Anthropic e a Meta também descobriram que seus modelos de IA haviam hackeado outras organizações.
Siga tópicos e autores desta história para ver mais como esta no feed da sua página inicial personalizada e para receber atualizações por e-mail.



