Aller au contenu
Veille IA

Lecture · veille du 2 octobre 2026

Olmo-core 3 : Infrastructure d'entraînement ouverte et évolutive pour les grands modèles de langage

Hugging Face Blog Publié le 1er octobre 2026 à 15:01 Angle technique Article en anglais pertinence 4 sur 5

Lire l'article original sur Hugging Face Blog, dans une nouvelle fenêtre

Olmo-core 3 est une nouvelle infrastructure d'entraînement pour les grands modèles experts mixtes (MoE), conçue pour permettre l'entraînement de modèles à plusieurs trillions de paramètres.

  • Olmo-core 3 permet d'entraîner des MoE à grande échelle, atteignant potentiellement un trillion de paramètres tout en maintenant une efficacité computationnelle.
  • L'architecture a été optimisée pour augmenter le pool d'experts de 8 à 128, réduisant l'impact sur la performance malgré l'augmentation de la capacité du modèle.
  • La transition vers la parallélisation des données distribuées (DDP) au lieu de la sharding FSDP réduit les coûts de communication liés au routage des experts.
  • Des techniques comme le parallélisme d'experts, le pipeline et la distribution de l'optimiseur sont combinées pour optimiser la répartition du modèle sur les GPU.

Olmo-core 3 représente une avancée significative dans l'entraînement des modèles de langage à grande échelle, en particulier ceux basés sur l'architecture Mixture-of-Experts (MoE). L'objectif principal est de surmonter les limitations liées aux coûts et à la complexité associés à l'entraînement de modèles contenant un nombre massif de paramètres, ouvrant ainsi la voie à des modèles d'une taille sans précédent.

La nouvelle infrastructure s'appuie sur une combinaison de techniques de parallélisation sophistiquées, notamment le parallélisme d'experts, le pipeline et la distribution de l'optimiseur. Ces approches permettent de répartir efficacement les calculs et les données sur plusieurs GPU, réduisant ainsi les goulots d'étranglement et améliorant la performance globale.

Des benchmarks ont démontré une augmentation significative de la vitesse d'entraînement, avec un modèle de 1,2 trillion de paramètres atteignant un débit de 858 TFLOP/s par GPU. L'utilisation de formats numériques à faible précision (MXFP8) a également contribué à améliorer l'efficacité du processus d'entraînement.

Au-delà des performances techniques, le projet met en avant une approche open source, encourageant la collaboration et l'expérimentation au sein de la communauté de recherche. Les résultats expérimentaux détaillés dans un rapport technique soulignent les défis rencontrés et les stratégies adoptées pour optimiser le système.

Mots-clés : Olmo-corelarge language modelsinfrastructure

Transparence : synthèse en français produite automatiquement par un modèle de langage local (gemma3:4b (Ollama, local sur le VPS)), non révisée. Le texte intégral reste chez l'éditeur d'origine.

Retour à l'édition du 2 octobre 2026