Aller au contenu
Veille IA

Lecture · veille du 25 septembre 2026

Accélération des modèles vision-langage avec LFM2.5-VL-DSpark

Hugging Face Blog Publié le 24 septembre 2026 à 14:08 Angle technique Article en anglais pertinence 4 sur 5

Lire l'article original sur Hugging Face Blog, dans une nouvelle fenêtre

Le modèle LFM2.5-VL-DSpark accélère l'inférence des modèles vision-langage en optimisant leur exécution sur différents appareils.

  • L'inférence est accélérée jusqu'à 3,13x sur les appareils et 2,66x sur un H100, avec des gains globaux allant jusqu'à 2,62x et 2,27x.
  • Le drafter ajoute seulement 8,9% de paramètres par rapport à la cible de 3B.
  • L'intégration DSpark compatible LFM est disponible dès le lancement pour llama.cpp, MLX-VLM et SGLang.
  • Le drafter utilise une architecture similaire aux drafters textuels LFM2.5-DSpark, capturant les états cachés du modèle cible et appliquant des conditions pour générer des blocs de tokens candidats.

Le projet LFM2.5-VL-DSpark vise à améliorer la vitesse d'inférence des modèles vision-langage en introduisant un drafter optimisé, qui réduit significativement le coût mémoire tout en offrant des gains de performance notables. Ce drafter est conçu pour fonctionner avec les modèles LFM2.5 et utilise une architecture commune aux drafters textuels, permettant ainsi une transition fluide et efficace.

Les tests menés sur différents matériels, notamment Apple Silicon (M5 Max) et H100, ont révélé des accélérations impressionnantes allant jusqu'à 20,4x sur le GPU H100. L'utilisation de techniques telles que la déduction spéculative permet d'optimiser davantage les performances, bien que son efficacité soit limitée par l'effet Amdahl et la proportion de temps consacré aux phases non accélérées.

La disponibilité du drafter dès le lancement, avec un support immédiat pour llama.cpp, MLX-VLM et SGLang, ainsi que sa distribution en formats Safetensors et GGUF sur Hugging Face, facilite son adoption et son intégration dans divers projets. L'objectif est de permettre l'exécution de ces modèles sur des appareils edge, ouvrant la voie à une IA accessible partout.

Mots-clés : modèles vision-langageoptimisationperformance

Transparence : synthèse en français produite automatiquement par un modèle de langage local (gemma3:4b (Ollama, local sur le VPS)), non révisée. Le texte intégral reste chez l'éditeur d'origine.

Retour à l'édition du 25 septembre 2026