Une main tient un téléphone contre une oreille dans une cuisine faiblement éclairée, le visage hors cadre.

Clonage de voix chez Google : l’Europe exclue, 30 secondes suffisent ailleurs

Les modèles Gemini 3.8 recréent une voix à partir de 30 secondes d’audio, sauf dans l’Espace économique européen. Le blocage ne vise que la copie : concevoir une voix inédite reste ouvert depuis la France.

30 secondes d’audio, et la voix est répliquée. Google a publié le 23 septembre deux modèles de synthèse vocale pour développeurs : Gemini 3.8 Flash TTS et Flash-Lite TTS. Tous deux recréent un profil vocal à partir d’un échantillon de cette longueur, puis le dirigent réplique par réplique. Annoncé le 23 septembre 2026, le clonage de voix des modèles Gemini 3.8 est indisponible dans six zones, dont l’Espace économique européen : en France, la réplication n’est pas accessible depuis Google AI Studio.

Rires, soupirs, hoquets de surprise, interjections : l’annonce décrit des salves vocales scriptées, écrites dans le texte comme des indications de jeu. Le développeur donne ses consignes en langage courant, ligne par ligne, et la voix change de rythme ou d’émotion. Une même requête peut mettre deux locuteurs en scène, sur plusieurs tours de parole. Google revendique plus de cent langues et dialectes, et une qualité qui tient sur des heures d’audio. La bibliothèque passe de 30 voix d’origine à plus de 2 000 voix prêtes à l’emploi, variantes régionales comprises. Un remixage du timbre, de la hauteur, du débit et de l’accent doit suivre.

Ce que la fermeture européenne bloque, et ce qu’elle laisse passer

Six territoires sont nommés : l’Illinois, le Texas, l’EEE, le Royaume-Uni, la Suisse et l’Inde. La restriction porte sur la réplication de voix via Google AI Studio, et sur elle seule. Concrètement, un développeur installé à Paris garde la création de voix par simple description écrite, les 30 voix préréglées et la bibliothèque étendue. La documentation de l’API Gemini range la réplication parmi quatre façons de choisir une voix, sans mentionner de limite géographique. Google n’en donne aucune raison.

Les quatre façons de choisir une voix dans l’API Gemini, et ce qui reste accessible depuis la France.
Mode de sélectionAccessible depuis la France
Réplication d’une voix via Google AI Studionon, depuis l’annonce du 23 septembre 2026
Création d’une voix par description écriteoui
30 voix prérégléesoui
Bibliothèque étendueoui

Depuis le 2 août 2026, les règles de transparence du règlement européen sur l’IA sont applicables, et la Commission européenne en assure l’exécution avec les autorités des États membres. L’annonce de Google arrive moins de deux mois plus tard. Le lien entre les deux n’est écrit nulle part. Côté diffusion, Flash TTS entre aussi dans Gemini Notebook et Flash-Lite dans Google Vids ; l’API Gemini Enterprise est annoncée pour plus tard.

Ce que ça change quand le téléphone sonne

Trente secondes, c’est la longueur d’un message laissé sur un répondeur. Le ministère de l’Intérieur décrit le mode opératoire sur sa fiche sur les arnaques à l’IA : des cybercriminels récupèrent des enregistrements de voix sur les réseaux sociaux et d’autres plateformes, puis fabriquent des messages qui semblent venir d’un proche. Le conseil tient en deux gestes. Vérifier par un autre moyen, et rappeler la personne ou l’entreprise sur un numéro officiel. Le ministère alerte aussi sur les demandes d’argent immédiates par virement ou en cryptomonnaie.

Le clonage vocal circulait avant Gemini 3.8. Le seuil d’entrée descend à 30 secondes d’échantillon et à une vérification de consentement. Le repérage d’une voix de synthèse au téléphone a ses propres signaux acoustiques. Et le clonage travaille déjà les studios de doublage français, où la voix est le gagne-pain. La plainte en ligne pour ce type d’arnaque passe par THESEE, la plateforme du ministère.

Un consentement enregistré, un tatouage inaudible

Google encadre la réplication par deux garde-fous. Le premier est un enregistrement de consentement : l’utilisateur doit fournir une déclaration orale du propriétaire de la voix, correspondant au locuteur de référence, avant que la voix ne soit créée. L’annonce précise que l’échantillon doit être celui de sa propre voix, ou d’une voix dont on détient les droits. Le second garde-fou est le marquage. Chaque extrait audio produit par les modèles audio Gemini porte un tatouage SynthID, complété par des métadonnées C2PA.

Un micro de studio sur bras articulé devant un ordinateur portable affichant une forme d’onde audio.
Google dit apposer un tatouage SynthID sur chaque extrait produit par ses modèles audio, et y joindre des métadonnées C2PA.

Ce tatouage est inaudible pour l’oreille humaine et résiste, selon Google DeepMind, à l’ajout de bruit, à la compression MP3 ou à un changement de vitesse. Encore faut-il pouvoir le lire. Le portail SynthID Detector, ouvert en mai 2025, accepte une image, une piste audio, une vidéo ou un texte, et signale les portions les plus probablement marquées. Il en est toujours au stade des testeurs précoces. Journalistes, professionnels des médias et chercheurs peuvent demander un accès. Le grand public attendra un élargissement dont Google n’a pas donné la date.

Votre réaction :

Article créé en collaboration avec l’IA.

Les plus lus

  1. 1Prix du roman Fnac 2026 : « C’était ça ou mourir » lauréatPrix du roman Fnac 2026 : « C’était ça ou mourir » lauréat
  2. 2Résultats des évaluations nationales 2026, dès le 21 septembreRésultats des évaluations nationales 2026, dès le 21 septembre
  3. 3Mondiaux de cyclisme : le maillot arc-en-ciel rapporte 8 000 euros, moins qu’une étape du TourMondiaux de cyclisme : le maillot arc-en-ciel rapporte 8 000 euros, moins qu’une étape du Tour
  4. 41,661 mètre à Marseille, le zéro qui fixe l’altitude de toute la France continentale1,661 mètre à Marseille, le zéro qui fixe l’altitude de toute la France continentale
  5. 5Mondiaux de cyclisme à Montréal : 273,7 km et 3 803 m de dénivelé pour trier les favorisMondiaux de cyclisme à Montréal : 273,7 km et 3 803 m de dénivelé pour trier les favoris

Nos dossiers

Recevez notre sélection dans votre boîte mail

Le meilleur d’Actu Alt Plus : décryptages, chiffres et panoramas. Désinscription en 1 clic, zéro spam.

Avatar illustré de Hugo, voix éditoriale d'Actu Alt Plus
Hugo

« Hugo » est la voix éditoriale d’Actu Alt Plus pour Tech, IA & Futur : ce que la technologie et l’IA changent concrètement, à hauteur d’usage plutôt que de promesse.

Articles: 332