Lecture · veille du 24 septembre 2026
Gemini 3.8 text-to-speech dit bonjour
Google DeepMind Blog Publié le 23 septembre 2026 à 15:25 Angle commercial Article en anglais pertinence 4 sur 5
Lire l'article original sur Google DeepMind Blog, dans une nouvelle fenêtre
Google DeepMind introduit deux nouveaux modèles de synthèse vocale text-to-speech, Gemini 3.8 Flash TTS et Flash-Lite TTS, offrant un contrôle créatif et une personnalisation avancée pour diverses applications.
- Les deux modèles permettent la création de voix entièrement nouvelles à partir de descriptions textuelles, ouvrant des possibilités pour le design de personnages dans des jeux vidéo ou des podcasts.
- Gemini 3.8 Flash TTS offre un contrôle granulaire sur les performances vocales, incluant des ajustements précis du rythme, de l'accent et des intonations.
- Gemini 3.8 Flash-Lite TTS est optimisé pour le volume élevé et la production à grande échelle, idéal pour le doublage ou la création de voix d’agents conversationnels.
- Les modèles prennent en charge plus de 100 langues et dialectes, avec une fonctionnalité de replication vocale basée sur un enregistrement de référence.
- Un système de watermark SynthID est intégré pour garantir la traçabilité des contenus générés par l'IA et prévenir la désinformation.
Google DeepMind a lancé deux nouveaux modèles de synthèse vocale text-to-speech, Gemini 3.8 Flash TTS et Flash-Lite TTS, conçus pour transformer la génération audio en un outil créatif puissant. Ces modèles offrent aux créateurs, développeurs et entreprises la possibilité de produire des expériences audio plus riches et expressives, notamment dans des applications telles que Gemini Notebook et Google Vids.
Gemini 3.8 Flash TTS se distingue par sa capacité à créer des voix entièrement personnalisées à partir de zéro, en utilisant des prompts textuels pour définir le rôle, l'accent et les caractéristiques vocales d'un personnage. De plus, il permet un contrôle précis sur chaque nuance de la performance vocale, allant du rythme à l’intonation, tandis que Gemini 3.8 Flash-Lite TTS est optimisé pour des applications nécessitant une grande échelle et une efficacité de coûts.
Pour garantir la sécurité et la transparence, les modèles intègrent un système de watermark SynthID imperceptible dans l'audio généré, ainsi qu’un processus de consentement vérifié pour la replication vocale. Ces fonctionnalités, combinées à un support multilingue étendu, positionnent ces modèles comme une solution robuste et fiable pour le développement d'expériences audio personnalisées à l'échelle mondiale.
Mots-clés : Geminitext-to-speechGoogle
Transparence : synthèse en français produite automatiquement par un modèle de langage local (gemma3:4b (Ollama, local sur le VPS)), non révisée. Le texte intégral reste chez l'éditeur d'origine.