EmbeddingGemma 2: il modello multimodale che gira sul tuo telefono

Venti milioni di download. Sì, avete letto bene. EmbeddingGemma — il modello per embeddings testuali lanciato l’anno scorso — ha fatto il botto ben oltre le aspettative di Google. Ora arriva la versione 2, che alza il tiro in modo considerevole.

Stavolta non si parla solo di testo. EmbeddingGemma 2 unifica testo, codice, immagini, video e audio in uno spazio di embedding condiviso. Tutto gestito da un singolo modello, che gira sul vostro smartphone. Non su un server remoto. Sul dispositivo. Con 740 milioni di parametri.

Apache 2.0 e ottimizzato per girare ovunque

Costruito sull’architettura Gemma 4 e rilasciato sotto licenza Apache 2.0 — fateci quello che volete, anche commercialmente — questo modello è pensato per l’inferenza on-device. Su un Google Pixel 11 Pro, i pesi text-only girano con 191MB di RAM attiva. Il modello multimodale completo ne usa 567MB. Numeri che rendono possibile ciò che fino a ieri richiedeva hardware dedicato o chiamate a server esterni.

La modularità è parte del progetto. Serve solo testo? Bastano 270 milioni di parametri. Volete aggiungere la visione? Altri 170M. Audio? 300M in più. Componete il modello come vi serve, senza portarvi dietro zavorra inutile.

Matryoshka learning e compressione intelligente

Google ha fatto una scelta furba. Con Matryoshka Representation Learning (MRL), potete troncare dinamicamente i vettori di output da 768 dimensioni fino a 128: fino a 6x di riduzione nello storage per i database vettoriali locali. Se avete mai gestito un vector store, sapete quanto questo pesi sulla memoria del dispositivo.

Il contesto è stato esteso a 8K token, quattro volte più grande della prima versione: 5,5 minuti di audio, 29 immagini, 58 frame video o combinazioni interleaved di tutto questo. Processati localmente, senza mandare nulla in cloud.

Performance da primo della classe

Su MTEB Code, EmbeddingGemma 2 segna un balzo di quasi 10 punti rispetto alla v1: da 68.76 a 78.68. Per chi lavora con code search semantico o indicizzazione di codebase locali, è un salto che si sente.

Mantiene le prestazioni multilingua del predecessore e supera in diverse task modelli specializzati con più del doppio dei parametri, restando sotto il miliardo.

Code, audio, video: tutto nello stesso spazio

Cercate un momento specifico in un video con una query testuale? Volete ritrovare una clip partendo da un memo vocale? Con EmbeddingGemma 2 questi scenari funzionano già. Google AI Edge Gallery offre demo operative: Instant Media Search per cercare nella vostra libreria, Video Moments Finder per localizzare segmenti precisi.

Accoppiato con Gemma 4 per il reasoning contestuale, diventa il motore di pipeline RAG completamente on-device. Siccome condivide con Gemma 4 il tokenizer testuale e l’encoder audio, farli girare insieme richiede meno memoria totale di quanto vi aspettereste.

Privacy, latenza, offline-first

Generare embeddings localmente ha tre vantaggi concreti. I dati non escono dal dispositivo: la privacy non è una promessa, è un fatto architetturale. La latenza è ridotta, senza andata e ritorno verso server remoti. E funziona offline, sempre, anche in aereo.

Per chi costruisce strumenti di ricerca semantica, motori decisionali real-time o agent con retrieval contestuale, questa combinazione cambia le carte in tavola.

Ecosistema e tool pronti all’uso

I pesi sono su Hugging Face e Kaggle, con versioni ottimizzate per on-device su LiteRT Community. Deployment cross-platform via MediaPipe o LiteRT, oppure nel browser con transformers.js e WebGPU.

Volete usare i vostri tool preferiti? Transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio: tutto supportato. I vettori li gestisce Qdrant. Per il fine-tuning, Unsloth ha già pubblicato le guide. La documentazione è disponibile con guide separate per inferenza e fine-tuning.

Cosa significa per chi sviluppa

EmbeddingGemma 2 non è l’ennesimo modello multimodale gigante che gira solo su cluster A100. È un modello sub-1B pensato per stare sul telefono, con performance che sfidano modelli molto più grandi. Potete davvero deployarlo oggi su hardware consumer.

Il fatto che condivida architettura e componenti con Gemma 4 significa pipeline unificate, footprint ridotto, meno complessità operativa. Per chi costruisce applicazioni edge-first, è esattamente il tipo di integrazione che serve.

Vedremo se l’adozione replica i numeri della prima versione. Ma 740 milioni di parametri che gestiscono testo, codice, immagini, video e audio su un Pixel, con licenza permissiva e tooling già pronto, sono un punto di partenza piuttosto solido.

AI LABELS_3x2_3_black