Aller au contenu
geekus
ActuModèles·6 min de lecture

EmbeddingGemma 2 : embeddings multimodaux en local

EmbeddingGemma 2 permet de chercher dans texte, images, audio et vidéo avec un seul modèle local. Il compte 740 millions de paramètres, sous licence Apache 2.0. Sur un Pixel 11 Pro, il demande environ 191 Mo de RAM en texte seul, quantifié.

deepmind.google/blog/embeddinggemma-2-an-open-lightweight-multimodal-embedding-model/
Capture de la page de EmbeddingGemma 2
Sommaire11 parties

EmbeddingGemma 2 est un modèle d’embeddings ouvert, publié par Google DeepMind le 6 octobre 2026. Il transforme du texte, du code, des images, de l’audio et de la vidéo en vecteurs comparables entre eux, avec 740 millions de paramètres et une licence Apache 2.0. Il est conçu pour tourner directement sur l’appareil, sans envoyer tes données à un serveur.

En bref

  • 740 millions de paramètres, licence Apache 2.0, architecture Gemma 4
  • Un seul espace de vecteurs pour texte, code, images, audio et vidéo
  • Version texte seul de 270M, avec encodeurs vision (170M) et audio (300M) en option
  • Vecteurs réductibles de 768 à 128 dimensions, jusqu’à 6 fois moins de stockage
  • Environ 191 Mo de RAM en texte seul sur un Pixel 11 Pro, avec quantification

Ce qu’est EmbeddingGemma 2

Un modèle d’embeddings convertit un contenu en une longue liste de nombres, un vecteur. Deux contenus proches par le sens donnent des vecteurs proches, ce qui permet de les retrouver ou de les comparer. EmbeddingGemma 2 applique cette idée à plusieurs types de contenus à la fois : texte, code, images, vidéo et audio partagent le même espace.

Google DeepMind cite deux exemples : retrouver un extrait vidéo précis à partir d’une note vocale, ou fouiller des heures d’enregistrements audio à partir d’une requête écrite. Un seul modèle, multimodal de façon native, traite l’ensemble.

Il succède à EmbeddingGemma, sorti l’an dernier et limité au texte. Selon Google, cette première version a dépassé 20 millions de téléchargements, notamment pour des outils de recherche sur appareil et des systèmes RAG respectueux de la vie privée. EmbeddingGemma 2 repose sur l’architecture Gemma 4 et sur la même technologie que les modèles Gemini Embedding.

Un modèle modulaire pensé pour tourner sur l’appareil

EmbeddingGemma 2 compte 740 millions de paramètres au total, mais il n’est pas obligatoire de tout charger. Pour du texte seul, 270 millions de paramètres suffisent. Les parties dédiées à l’image (170M) et à l’audio (300M) s’ajoutent seulement si l’usage le demande.

Pour limiter l’espace disque et la mémoire, le modèle utilise l’apprentissage de représentations en poupées russes (Matryoshka Representation Learning). Les développeurs peuvent raccourcir les vecteurs de 768 dimensions à 512, 256 ou 128. Google annonce jusqu’à 6 fois moins de stockage pour une base de vecteurs locale.

  • Texte seul : 270M de paramètres
  • Encodeur vision en option : 170M
  • Encodeur audio en option : 300M
  • Dimensions des vecteurs : 768, 512, 256 ou 128

Mémoire, contexte et vitesse d’EmbeddingGemma 2

Avec quantification, sur un Google Pixel 11 Pro, EmbeddingGemma 2 demande environ 191 Mo de RAM active pour les poids texte seul et environ 567 Mo pour le modèle multimodal complet. Le projet ne donne pas de configuration minimale pour d’autres appareils.

La fenêtre de contexte atteint 8K tokens, soit 4 fois celle de la première version. Elle permet de traiter jusqu’à 5,5 minutes d’audio, 29 images, 58 images de vidéo, ou une combinaison de ces contenus. Selon The Decoder, une requête prend environ 20 à 70 millisecondes via WebGPU dans le navigateur, sans clé d’API.

Les résultats annoncés, en code comme en audio

Google indique que EmbeddingGemma 2 obtient des scores en tête parmi les modèles multimodaux de moins d’un milliard de paramètres, sur des tests comme MTEB Code et MAEB (le test équivalent pour l’audio). Il égalerait ou dépasserait aussi de nombreux modèles plus gros en texte, vision et audio. Ces comparaisons viennent de Google ; les mesures complètes figurent dans la fiche du modèle.

Le gain le plus net concerne le code : 78,68 sur MTEB Code, contre 68,76 pour la première version, soit 9,92 points de plus. Pour le texte multilingue, Google dit que les performances restent au niveau de l’ancien modèle. Cela vise l’indexation d’un code source en local, la recherche sémantique dans du code et la recherche de documents par des agents de programmation.

Chercher dans ses vidéos, ses sons et ses fichiers hors ligne

Produire les embeddings sur l’appareil garde les données chez toi, réduit la latence et permet une recherche qui fonctionne hors ligne. Associé à un modèle génératif comme Gemma 4, EmbeddingGemma 2 sert à bâtir des pipelines RAG locaux : le modèle retrouve d’abord des passages pertinents dans tes contenus, puis une réponse est rédigée à partir d’eux. Les deux modèles partagent le même tokenizer texte et le même encodeur audio, ce qui réduit la mémoire totale quand on les fait tourner ensemble.

Google propose plusieurs démonstrations. Dans Google AI Edge Gallery, Instant Media Search retrouve des éléments d’une médiathèque à partir d’un texte ou d’une image, et Video Moments Finder repère des moments précis d’une vidéo par texte ou par audio. Selon 9to5Google, ces démos existent sur Android et iOS. L’application Google AI Edge Foresight, pour Mac, prend des notes pendant des réunions, traite transcription et audio sur l’appareil, et répond à des questions sur tes dossiers de projet, tes documents, tes schémas et ton agenda, en local ou sur Google Drive.

Télécharger et utiliser EmbeddingGemma 2

Les poids du modèle sont disponibles sur Hugging Face et Kaggle. Une disponibilité dans le Model Garden de la plateforme Gemini Enterprise Agent est annoncée comme prochaine, sans date. Des versions optimisées pour l’appareil se trouvent dans la communauté LiteRT sur Hugging Face.

Pour l’intégrer, Google cite MediaPipe pour des tâches clés en main de vectorisation et de recherche, et LiteRT pour une intégration sur mesure. Dans le navigateur, transformers.js et WebGPU sont possibles. Côté outils, le modèle fonctionne avec transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama et LMStudio ; Qdrant peut stocker les vecteurs. Unsloth publie un guide pour l’affiner à ses propres usages.

  • Poids : Hugging Face et Kaggle
  • Appareil : MediaPipe ou LiteRT
  • Navigateur : transformers.js ou WebGPU
  • Serveur ou poste local : Ollama, llama.cpp, vLLM, LMStudio, MLX

Pourquoi la licence Apache 2.0 compte pour les embeddings

EmbeddingGemma 2 est publié sous licence Apache 2.0, décrite par Google comme permissive pour un usage commercial. Sur Hacker News, le développeur Simon Willison souligne que ce point est particulièrement important pour ce type de modèle. Une application calcule souvent des milliers, voire des millions de vecteurs, puis les conserve pour les comparer plus tard.

Selon lui, si un éditeur retire un modèle propriétaire, il faut payer pour recalculer tous les vecteurs déjà stockés. Il préfère pouvoir passer par un fournisseur tout en sachant qu’il pourrait faire tourner lui-même les poids ouverts si l’hébergement s’arrêtait. C’est un avis personnel, non une mesure du modèle.

Quelques repères

  • Embedding : Représentation d’un contenu (texte, image, son) sous forme d’une liste de nombres. Deux contenus de sens proche ont des listes proches, ce qui permet de chercher par le sens plutôt que par mots exacts.
  • RAG : Méthode où un modèle de langage va d’abord chercher des passages pertinents dans une base de documents, puis rédige sa réponse à partir d’eux.
  • Quantification : Technique qui réduit la précision des nombres d’un modèle pour qu’il occupe moins de mémoire et s’exécute plus facilement sur un appareil modeste.

Questions fréquentes

EmbeddingGemma 2 est-il open source ?

Oui, EmbeddingGemma 2 est publié sous licence Apache 2.0, que Google décrit comme permissive pour un usage commercial. Les poids se téléchargent sur Hugging Face et Kaggle.

EmbeddingGemma 2 peut-il fonctionner hors ligne ?

Oui, EmbeddingGemma 2 est conçu pour générer les embeddings localement, sans envoyer de données à un serveur. Selon The Decoder, il tourne sans clé d’API.

Combien de mémoire demande EmbeddingGemma 2 ?

Sur un Pixel 11 Pro, avec quantification, EmbeddingGemma 2 demande environ 191 Mo de RAM active en texte seul et environ 567 Mo en version multimodale complète. Google ne donne pas de configuration minimale pour d’autres appareils.

EmbeddingGemma 2 est-il utilisable pour indexer du code source ?

Oui, Google le recommande pour l’indexation locale de code et la recherche sémantique de code. Son score sur MTEB Code passe de 68,76 à 78,68 par rapport à la première version.

À retenir

EmbeddingGemma 2 réunit texte, code, images, audio et vidéo dans un même espace de vecteurs, avec un modèle ouvert sous Apache 2.0 qui peut tourner localement, de 270M de paramètres en texte seul à 740M en multimodal. Les résultats de comparaison cités viennent de Google, et la fiche du modèle détaille les mesures.

Sources

embeddingsmultimodalraggemmaon-deviceapache 2.0
Dans le même genre

Des fiches proches.

toute la famille
À lire aussi

Les dernières fiches.

tout l'annuaire

Le Carnet de Geekus · chaque vendredi

Les trouvailles de la semaine, dans ta boîte mail.

Un email, cinq minutes de lecture. En français, gratuit, sans publicité.

S'inscrire au Carnet →
  1. Le spécimen de la semaine, expliqué à fond
  2. L'actu IA en bref
  3. Les autres trouvailles et le mot de la semaine