Aller au contenu
Veille IA

Lecture · veille du 19 septembre 2026

DeepSeek réduit sa taille de cache d'attention à 890 octets par jeton, le coût devient un enjeu critique pour les agents

ActuIA Publié le 18 septembre 2026 à 12:47 Angle technique Article en français pertinence 4 sur 5

Lire l'article original sur ActuIA, dans une nouvelle fenêtre

DeepSeek optimise sa compression de cache pour réduire les coûts liés à l'utilisation d'agents à long contexte.

  • Le modèle DeepSeek-V4.1-Flash réduit la taille de son cache clés-valeurs à 890 octets par jeton, soit un quart de celui de DeepSeek-V4-Flash.
  • La compression du cache est motivée par le coût élevé du préremplissage et de l'utilisation du cache en mémoire haute bande passante.
  • L'architecture utilise une structure encodeur-décodeur causal avec des paramètres distincts pour le préremplissage et le décodage, optimisant ainsi les charges agentiques.
  • Des techniques de compression comme CSA2 (attention creuse compressée) et SWA Bounded Replay réduisent l'empreinte du cache persistant.

DeepSeek a mis au point des améliorations significatives dans la gestion de son cache d'attention, un élément crucial pour le coût de fonctionnement des agents à long contexte. La nouvelle architecture, baptisée V4.1-Flash, réduit considérablement l'empreinte du cache, passant de 890 octets par jeton à environ un quart de cette valeur grâce à une combinaison de techniques de compression.

Cette optimisation est principalement axée sur la réduction des besoins en mémoire haute bande passante et en stockage rapide. L'architecture a été modifiée pour séparer les phases de préremplissage et de décodage, permettant ainsi d'allouer plus efficacement les ressources au processus le plus coûteux, qui est souvent le préremplissage.

En outre, des techniques comme la réutilisation du cache entre couches et l'utilisation de formats de données compressés (FP4) contribuent à minimiser l'espace mémoire requis. L'équipe a également optimisé le cache persistant, réduisant son empreinte pour améliorer les performances des sessions longues entre un agent et un utilisateur.

Cette avancée est d'autant plus pertinente compte tenu de la concurrence actuelle sur les modèles de langage, notamment en ce qui concerne l'architecture mémoire et les coûts associés. L'optimisation du cache permet à DeepSeek d'améliorer son efficacité tout en tenant compte des contraintes spécifiques rencontrées par les entreprises hébergeant leurs propres modèles.

Mots-clés : DeepSeekcache d'attentionFP4

Transparence : synthèse en français produite automatiquement par un modèle de langage local (gemma3:4b (Ollama, local sur le VPS)), non révisée. Le texte intégral reste chez l'éditeur d'origine.

Retour à l'édition du 19 septembre 2026