L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
Google affirme que son nouveau modèle Gemini 3.8 Flash TTS peut recréer une voix à partir d’un échantillon audio de 30 secondes, et que la réplication vocale via Google AI Studio « n’est pas disponible dans l’Illinois, le Texas, l’EEE, le Royaume-Uni, la Suisse et l’Inde ». Ce modèle et un frère moins cher, Gemini 3.8 Flash-Lite TTS, ont été mis en disponibilité générale le 22 septembre, selon les notes de version de l’API Gemini de Google.
Le clonage d’une voix nécessite que son propriétaire soit enregistré sur bande. Google indique que « les utilisateurs doivent fournir un enregistrement de consentement verbal du propriétaire de la voix qui correspond au locuteur de référence avant qu’une voix puisse être créée », que chaque clip produit par ses modèles Gemini Audio est filigrané avec SynthID et que les voix répliquées portent des informations d’identification C2PA.
L’annonce de Google s’arrête là. Il ne précise pas combien de temps un enregistrement de consentement est conservé, si un propriétaire de voix peut retirer son consentement ultérieurement, ni ce qui suit si une voix est construite à partir d’un échantillon dont quelqu’un ne possédait pas.
La bibliothèque vocale passe de 30 à plus de 2 000
Google affirme que la bibliothèque passe de 30 voix originales à « plus de 2 000 voix prêtes à être produites », avec des variétés régionales comprenant l’espagnol mexicain, le français du Québec et l’anglais écossais, ainsi qu’une conception vocale générative dans plus de 100 langues et dialectes. Les notes de version de l’API Gemini de Google sont plus modestes à propos de la même bibliothèque, la décrivant comme un moyen « d’interroger plus de 150 voix prédéfinies et personnalisées », de sorte que les deux chiffres ne s’alignent pas.
Google divise les deux modèles par emploi. Flash TTS est celui qu’il désigne pour la conception de personnages, les jeux, les livres audio et les podcasts, tandis que Flash-Lite TTS est destiné au doublage à grand volume et au type d’agent vocal en temps réel que Tencent a intégré à Gander.
Flash TTS est en tête du classement en matière de conception vocale, mais pas en termes de qualités vocales
Sur le Voice Design Benchmark de Hume AI, Google affirme que Gemini 3.8 Flash TTS est premier au classement général avec 71,4 et mène la modélisation d’accent avec 60,8. Les deux chiffres appartiennent à Flash TTS, qui est le seul modèle Gemini obtenu par Google sur cette référence.
Le propre tableau de Google place ElevenLabs Voice Design v3 à 70,8 au total et 45,4 pour les accents, et donne à ElevenLabs le meilleur score pour les qualités vocales à 76,6 contre Flash TTS à 74,6. Dans l’indice de qualité globale de Hume AI, Google affirme que Flash TTS est premier et Flash-Lite TTS deuxième, et il ne publie aucun score pour aucun des deux.
Chacun de ces chiffres provient de la propre annonce de Google, y compris celle des concurrents.
Où fonctionnent les deux modèles
Flash TTS s’adresse aux développeurs de l’API Gemini et de Google AI Studio et à tout le monde dans Gemini Notebook, indique Google, tandis que Flash-Lite TTS couvre les mêmes surfaces de développement plus Google Vids. L’accès pour les entreprises via Gemini Enterprise « arrive bientôt » sans date, tout comme le remixage de voix, qui permettrait à un utilisateur d’affiner le timbre, la hauteur, le rythme et l’accent d’une voix de bibliothèque.
Les noms d’API sont gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts, et Google affirme que le modèle Flash-Lite est conçu pour remplacer gemini-3.1-flash-tts-preview pour les travaux à haut débit. La page de tarification de Google fixe la saisie de texte payante pour les deux à 0,50 $ par million de jetons jusqu’au 31 décembre 2026 et à 1,00 $ à partir du 1er janvier 2027, avec une sortie audio à 9,00 $ par million de jetons pour Flash TTS et 6,00 $ pour Flash-Lite sur la même période. Les prix à la production doublent en janvier et les deux modèles bénéficient d’un niveau gratuit.
Les deux modèles prennent des signaux non verbaux scriptés écrits comme suit :