![]()
30 secondes d’audio, et la voix est répliquée. Google a publié le 23 septembre deux modèles de synthèse vocale pour développeurs : Gemini 3.8 Flash TTS et Flash-Lite TTS. Tous deux recréent un profil vocal à partir d’un échantillon de cette longueur, puis le dirigent réplique par réplique. Annoncé le 23 septembre 2026, le clonage de voix des modèles Gemini 3.8 est indisponible dans six zones, dont l’Espace économique européen : en France, la réplication n’est pas accessible depuis Google AI Studio.
Rires, soupirs, hoquets de surprise, interjections : l’annonce décrit des salves vocales scriptées, écrites dans le texte comme des indications de jeu. Le développeur donne ses consignes en langage courant, ligne par ligne, et la voix change de rythme ou d’émotion. Une même requête peut mettre deux locuteurs en scène, sur plusieurs tours de parole. Google revendique plus de cent langues et dialectes, et une qualité qui tient sur des heures d’audio. La bibliothèque passe de 30 voix d’origine à plus de 2 000 voix prêtes à l’emploi, variantes régionales comprises. Un remixage du timbre, de la hauteur, du débit et de l’accent doit suivre.
Ce que la fermeture européenne bloque, et ce qu’elle laisse passer
Six territoires sont nommés : l’Illinois, le Texas, l’EEE, le Royaume-Uni, la Suisse et l’Inde. La restriction porte sur la réplication de voix via Google AI Studio, et sur elle seule. Concrètement, un développeur installé à Paris garde la création de voix par simple description écrite, les 30 voix préréglées et la bibliothèque étendue. La documentation de l’API Gemini range la réplication parmi quatre façons de choisir une voix, sans mentionner de limite géographique. Google n’en donne aucune raison.
| Mode de sélection | Accessible depuis la France |
|---|---|
| Réplication d’une voix via Google AI Studio | non, depuis l’annonce du 23 septembre 2026 |
| Création d’une voix par description écrite | oui |
| 30 voix préréglées | oui |
| Bibliothèque étendue | oui |
Depuis le 2 août 2026, les règles de transparence du règlement européen sur l’IA sont applicables, et la Commission européenne en assure l’exécution avec les autorités des États membres. L’annonce de Google arrive moins de deux mois plus tard. Le lien entre les deux n’est écrit nulle part. Côté diffusion, Flash TTS entre aussi dans Gemini Notebook et Flash-Lite dans Google Vids ; l’API Gemini Enterprise est annoncée pour plus tard.
Ce que ça change quand le téléphone sonne
Trente secondes, c’est la longueur d’un message laissé sur un répondeur. Le ministère de l’Intérieur décrit le mode opératoire sur sa fiche sur les arnaques à l’IA : des cybercriminels récupèrent des enregistrements de voix sur les réseaux sociaux et d’autres plateformes, puis fabriquent des messages qui semblent venir d’un proche. Le conseil tient en deux gestes. Vérifier par un autre moyen, et rappeler la personne ou l’entreprise sur un numéro officiel. Le ministère alerte aussi sur les demandes d’argent immédiates par virement ou en cryptomonnaie.
Le clonage vocal circulait avant Gemini 3.8. Le seuil d’entrée descend à 30 secondes d’échantillon et à une vérification de consentement. Le repérage d’une voix de synthèse au téléphone a ses propres signaux acoustiques. Et le clonage travaille déjà les studios de doublage français, où la voix est le gagne-pain. La plainte en ligne pour ce type d’arnaque passe par THESEE, la plateforme du ministère.
Un consentement enregistré, un tatouage inaudible
Google encadre la réplication par deux garde-fous. Le premier est un enregistrement de consentement : l’utilisateur doit fournir une déclaration orale du propriétaire de la voix, correspondant au locuteur de référence, avant que la voix ne soit créée. L’annonce précise que l’échantillon doit être celui de sa propre voix, ou d’une voix dont on détient les droits. Le second garde-fou est le marquage. Chaque extrait audio produit par les modèles audio Gemini porte un tatouage SynthID, complété par des métadonnées C2PA.

Ce tatouage est inaudible pour l’oreille humaine et résiste, selon Google DeepMind, à l’ajout de bruit, à la compression MP3 ou à un changement de vitesse. Encore faut-il pouvoir le lire. Le portail SynthID Detector, ouvert en mai 2025, accepte une image, une piste audio, une vidéo ou un texte, et signale les portions les plus probablement marquées. Il en est toujours au stade des testeurs précoces. Journalistes, professionnels des médias et chercheurs peuvent demander un accès. Le grand public attendra un élargissement dont Google n’a pas donné la date.
Votre réaction :
Article créé en collaboration avec l’IA.
Les plus lus
- 1
Prix du roman Fnac 2026 : « C’était ça ou mourir » lauréat - 2
Résultats des évaluations nationales 2026, dès le 21 septembre - 3
Mondiaux de cyclisme : le maillot arc-en-ciel rapporte 8 000 euros, moins qu’une étape du Tour - 4
1,661 mètre à Marseille, le zéro qui fixe l’altitude de toute la France continentale - 5
Mondiaux de cyclisme à Montréal : 273,7 km et 3 803 m de dénivelé pour trier les favoris
Nos dossiers
- France395
- Science297
- Culture200
- Consommation179
- Santé publique176
- IA175
- Patrimoine168
- Sport163
Recevez notre sélection dans votre boîte mail
Le meilleur d’Actu Alt Plus : décryptages, chiffres et panoramas. Désinscription en 1 clic, zéro spam.

