Aller au contenu
Veille IA

Lecture · veille du 7 octobre 2026

EmbeddingGemma 2: un modèle d'intégration multimodal open et léger

Google DeepMind Blog Publié le 6 octobre 2026 à 19:57 Angle technique Article en anglais pertinence 4 sur 5

Lire l'article original sur Google DeepMind Blog, dans une nouvelle fenêtre

EmbeddingGemma 2 est un modèle d'embedding multimodal léger, conçu pour organiser et rechercher des informations directement sur les appareils consommateurs.

  • EmbeddingGemma 2 a été initialement lancé avec plus de 20 millions de téléchargements et est utilisé pour des outils de recherche on-device et des pipelines RAG.
  • La version 2 du modèle prend en compte le code, les images, la vidéo et l'audio, grâce à une architecture basée sur Gemma 4.
  • Le modèle atteint des scores de référence pour sa taille dans les benchmarks MTEB Code et MAEB, surpassant souvent des modèles plus grands.
  • Il offre une efficacité de stockage grâce à la représentation MRL, permettant de réduire jusqu'à six fois l'espace de stockage nécessaire.
  • EmbeddingGemma 2 dispose d'une fenêtre contextuelle étendue de 8K tokens, facilitant le traitement de données multimodales complexes directement sur l'appareil.

EmbeddingGemma 2 représente une évolution significative du modèle initial, élargissant son champ d'application au-delà du texte pour inclure des données multimédias telles que le code, les images, la vidéo et l'audio. Cette extension est rendue possible grâce à une architecture basée sur Gemma 4, ce qui permet une intégration efficace dans des environnements de ressources limitées.

Le modèle se distingue par ses performances exceptionnelles pour sa taille, atteignant des scores compétitifs dans divers benchmarks multimodaux et offrant une efficacité de stockage améliorée via la technique MRL. Cela ouvre la voie à des applications pratiques telles que la recherche sémantique et le retrieval sur des données multimédias locales.

L'intégration d'EmbeddingGemma 2 facilite également le développement de pipelines RAG (Retrieval-Augmented Generation) on-device, combinant ses capacités avec les modèles Gemma 4 pour une compréhension approfondie des données multimodales. De plus, la disponibilité de guides et d'outils de développement encourage l'adoption et l'adaptation du modèle à divers cas d'utilisation.

Mots-clés : EmbeddingGemmaGemmamodèle multimodal

Transparence : synthèse en français produite automatiquement par un modèle de langage local (gemma3:4b (Ollama, local sur le VPS)), non révisée. Le texte intégral reste chez l'éditeur d'origine.

Retour à l'édition du 7 octobre 2026