O Google lançou o EmbeddingGemma 2, um modelo aberto de 740 milhões de parâmetros que mapeia texto, código, imagens, áudio e vídeo em um único espaço e funciona inteiramente em um telefone ou pequeno tablet. É licenciado sob Apache 2.0 sem ajustes de segurança, e o Google diz que o desempenho não é o mesmo nos 100 idiomas que suporta.
O Google lançou um modelo aberto que pode pesquisar texto, código, imagens, áudio e vídeo e executá-lo em telefones celulares. O trabalho de texto no Pixel 11 Pro requer cerca de 191 MB de memória e cinco dispositivos requerem cerca de 567 MB de memória. Nada precisa sair do dispositivo.
O Google disse em um artigo que o EmbeddingGemma 2 mapeia tudo isso em um espaço de 768 dimensões. uma postagem no blog. Possui 740 milhões de parâmetros, incluindo 270 milhões apenas para texto, 170 milhões de codificadores visuais e 300 milhões de codificadores de áudio (carregados apenas quando necessário). A licença é Apache 2.0.
Os modelos de incorporação convertem o conteúdo em números para que o software possa encontrar o conteúdo pelo significado, e não pela correspondência de palavras.
Esta é uma etapa que geralmente acontece nas nuvens de outras pessoas.
Informamos em abril que o Gemma 4 estava disponível em quatro modelos abertos sob a mesma licença, rodando em telefones, placas Raspberry Pi e placas gráficas de consumo. O EmbeddingGemma 2 se baseia nessa arquitetura e compartilha seu tokenizador de texto e codificador de áudio para que os dois sejam executados juntos em menos memória combinada.
O resultado real é um pipeline de recuperação sem rede.
O Google apresentou o mesmo argumento em agosto, quando construiu um tradutor offline em um Raspberry Pi de US$ 80 para lidar com conversas confidenciais sem enviar áudio para qualquer lugar. Manter os dados no dispositivo evita transferências, que é onde começa a maioria dos problemas europeus de protecção de dados.
A empresa não está fazendo isso por generosidade. Está construindo o valor padrão.
O Google disse que a série Gemma foi baixada mais de 1 bilhão de vezes, com o primeiro EmbeddingGemma sendo baixado 20 milhões de vezes. O novo modelo contém 8.192 tokens por modo, quatro vezes mais que a primeira versão, equivalente a 29 imagens, 58 frames de vídeo ou cinco minutos e meio de áudio.
Os vetores podem ser reduzidos de 768 para 128 dimensões, o que, segundo o Google, reduz o espaço de armazenamento em seis vezes.
Existem algumas limitações e o Google as lista. O modelo não possui ajustes de segurança e nem condicionamento de saída; em vez disso, as mitigações são aplicadas aos dados de treinamento. Ele suporta mais de 100 idiomas, que, segundo o Google, podem não ter o mesmo desempenho.
Existem 24 línguas oficiais na União Europeia.
A Europa há muito que afirma querer ter esta capacidade localmente, funcionando em hardware que as empresas europeias já possuem, com uma licença que qualquer pessoa pode utilizar, e está a ser construída em Mountain View.



