← Tutti gli articoli

Notizie sull’AI

Google apre EmbeddingGemma 2: la ricerca multimodale arriva sui dispositivi

Il modello open-weight confronta testi, immagini, video e audio nello stesso spazio vettoriale. È pensato per ricerca e recupero, non per generare risposte.

Una persona fotografa il tramonto con uno smartphone tenuto davanti al sole.
Immagine di contesto. Fotografia di Debraj Maji, Wikimedia Commons, CC BY-SA 4.0.Foto: Debraj Maji / Wikimedia Commons (CC BY-SA 4.0)

EmbeddingGemma 2 porta la ricerca tra testi, immagini, audio e video su dispositivi locali. Ecco il modello, i requisiti e i limiti per le imprese.

Google presenta EmbeddingGemma 2, un modello open-weight progettato per trovare contenuti simili tra testo, immagini, video e audio. La novità può aiutare chi gestisce archivi di documenti e media a costruire ricerche multimodali anche su dispositivi locali, senza inviare ogni elemento a una catena di servizi cloud.

Il modello non scrive risposte come un chatbot: trasforma i contenuti in rappresentazioni numeriche confrontabili, utili per recuperare materiale pertinente. La distinzione conta per imprese e professionisti, perché una ricerca più flessibile può migliorare l’accesso agli archivi, ma richiede comunque un indice, un’applicazione e controlli sui risultati.

Che cosa è successo

Secondo Google, EmbeddingGemma 2 conta fino a 740 milioni di parametri e mappa testo, codice, immagini, fotogrammi video e audio in uno spazio vettoriale condiviso a 768 dimensioni. L’architettura è modulare: gli sviluppatori possono caricare soltanto le parti necessarie, ad esempio testo e codice oppure anche gli encoder visivi e audio. Il modello è distribuito con licenza Apache 2.0.

Un embedding è una rappresentazione numerica che consente di confrontare una domanda con documenti o contenuti per vicinanza semantica. In un archivio di assistenza, per esempio, una query può trovare una procedura anche se le parole non coincidono esattamente. La stessa idea può mettere in relazione una descrizione testuale con una fotografia o un frammento audio, se i contenuti sono stati indicizzati con il modello.

Google riporta un uso di memoria attiva di circa 191 megabyte per il modello solo testo e 567 megabyte per la versione multimodale su un Pixel 11 Pro. Sono misure dichiarate dall’azienda su un dispositivo specifico: non vanno lette come requisiti universali per ogni telefono o come una garanzia di velocità equivalente su hardware più vecchio.

L’azienda descrive inoltre un’integrazione con ML Kit in arrivo nelle settimane successive e la disponibilità per gli sviluppatori attraverso i repository e le piattaforme indicate nei materiali ufficiali. La guida tecnica di Google mostra l’impiego con strumenti di ricerca e sistemi RAG, nei quali il recupero dei passaggi precede la generazione di una risposta da parte di un altro modello.

Il punto che rischia di passare inosservato

La parola locale non garantisce da sola la riservatezza. Per mantenere l’elaborazione sul dispositivo bisogna controllare anche l’app che usa il modello, la sincronizzazione degli indici, i log, i backup e gli eventuali servizi chiamati a valle. Un’organizzazione deve sapere dove finiscono sia i file originali sia i vettori derivati, che possono comunque rivelare relazioni tra contenuti.

Un buon embedding non rende automaticamente corretto il sistema di ricerca. La qualità dipende da come si segmentano e aggiornano i documenti, dai permessi applicati ai risultati e dalla soglia scelta per definire una corrispondenza. Un risultato semanticamente vicino può essere irrilevante o appartenere a un archivio che l’utente non dovrebbe consultare.

La ricerca multimodale migliora l’accesso ai contenuti solo se indice, permessi e aggiornamenti sono progettati bene.

Che cosa cambia per imprese e professionisti

Per studi professionali, redazioni, musei e PMI con archivi misti, il modello apre una prova concreta: cercare in un unico flusso documenti, immagini e registrazioni. Un prototipo può iniziare con un insieme limitato di file non sensibili e misurare se gli utenti trovano più rapidamente ciò che serve rispetto alla ricerca per parole chiave.

I team dovrebbero stimare non solo la memoria del modello, ma anche spazio per l’indice, tempi di elaborazione, aggiornamenti, dispositivi supportati e costi di integrazione. Se i risultati alimentano un assistente generativo, bisogna mantenere i controlli di accesso anche dopo il recupero: il modello linguistico non deve ricevere documenti che l’utente non è autorizzato a leggere.

Che cosa osservare adesso

Nelle prossime settimane andranno verificati il rilascio dell’integrazione ML Kit, i dispositivi compatibili e le misure indipendenti di qualità su raccolte italiane, documenti scansiti e registrazioni reali. I dati di Google forniscono indicazioni iniziali, ma non sostituiscono prove sul proprio archivio.

Per valutare l’utilità, un’organizzazione può preparare domande note e verificare precisione, risultati mancati e accesso improprio. La metrica decisiva non è soltanto la dimensione del modello: è la quota di ricerche in cui la persona trova il contenuto corretto senza esporre materiale riservato.

Per approfondire

Per il contesto ANPAI: Come gestire i dati aziendali usati con strumenti AI

Le fonti

Google Blog — EmbeddingGemma 2, 6 ottobre 2026 · Google Developers Blog — EmbeddingGemma 2: The Developer Guide, 6 ottobre 2026


Questa analisi della redazione ANPAI aiuta a leggere fatti e conseguenze operative. Non sostituisce una valutazione tecnica o legale riferita a un caso specifico.

Parliamone

Hai una domanda
o un progetto sull’AI?

Parla con ANPAI

Newsletter

Le notizie AI che contano, direttamente via email.

Ricevi una selezione chiara delle novità più importanti sull’intelligenza artificiale.