IA

ElevenLabs v4 clone votre voix avec 10 secondes d’audio et la fait parler 90 langues

Susan Hill
Ajoutez-nous sur Google

ElevenLabs a lancé Eleven v4, un modèle de synthèse vocale qui lit à voix haute un texte en y ajoutant un rire, un soupir ou une réplique prononcée avec colère et un accent français, selon les indications de l’auteur. Son clonage vocal instantané nécessite un enregistrement plus court qu’un message sur une boîte vocale. La voix clonée peut ensuite parler des dizaines de langues tout en conservant son timbre propre. Toute personne disposant d’un compte gratuit ElevenLabs peut l’utiliser.

Pour celles et ceux qui créent avec le son, cet outil peut faire gagner des journées entières de travail. Un podcasteur peut doubler un épisode en japonais avec sa propre voix, un développeur de jeu indépendant peut donner une interprétation distincte à chaque personnage secondaire sans réserver de studio, et un narrateur de livre audio peut inscrire directement dans le script une pause ou un petit rire. Le revers est tout aussi concret : un message vocal, un extrait d’appel vidéo ou quelques secondes d’une publication publique suffisent désormais à produire une copie convaincante de la voix de quelqu’un.

La principale nouveauté, c’est le contrôle, et il suffit de 10 secondes d’audio pour créer le clone lui-même. Les modèles ElevenLabs précédents lisaient les textes avec fluidité, mais devaient deviner l’émotion à transmettre. La version 4 prend en compte les indications de jeu insérées entre crochets dans le texte, comme [rit] ou [dit avec colère, avec un accent français], ainsi que des sons d’ambiance tels que [pluie légère] ou [téléphone qui vibre]. L’entreprise affirme que le modèle déduit aussi le ton et le rythme du contexte, de sorte qu’une réplique dans une scène tendue sonne effectivement tendue, même sans indication. Dans les scènes avec plusieurs personnages, chaque voix reste cohérente au fil de longs passages. C’était l’un des points faibles de la narration synthétique, où les voix avaient tendance à changer au cours d’un chapitre.

Le nombre de langues prises en charge passe de 70 dans la version précédente à plus de 90. Selon TechCrunch, ElevenLabs met notamment en avant les progrès les plus marqués en japonais, en portugais brésilien, en mandarin et en cantonais. Une voix clonée conserve son identité lorsqu’elle change de langue : le clone d’un hispanophone qui lit un texte en allemand ressemble toujours à cette personne, tout en ayant un accent allemand de locuteur natif. Un deuxième modèle, v4 Turbo, est conçu pour les assistants vocaux et les agents de centre d’appels. Il commence à parler en environ 150 millisecondes, soit à peu près le temps d’une pause entre deux interlocuteurs dans une conversation, et peut prendre la parole avant même que le chatbot qui le pilote ait fini de rédiger sa réponse.

ElevenLabs n’est pas seul sur ce marché. Google, OpenAI, Cartesia, Deepgram et Fish Audio vendent tous des voix synthétiques aux mêmes développeurs. Quelques heures après le lancement, le cabinet indépendant Artificial Analysis a placé v4 en tête de son classement des voix, établi à partir d’échantillons anonymes que les auditeurs évaluent en les comparant côte à côte. ElevenLabs affirme également qu’environ trois auditeurs sur quatre ont préféré v4 aux produits concurrents lors de comparaisons à l’aveugle, un chiffre issu de ses propres tests.

Les réserves commencent avec ce fameux délai de 10 secondes. ElevenLabs indique que la création d’un clone nécessite le consentement de la personne dont la voix est importée. L’entreprise exploite aussi un classificateur public capable de repérer les fichiers audio créés avec ses outils et bloque d’office le clonage de certaines personnalités politiques. Ces mesures freinent les abus les plus faciles, mais elles reposent sur la véracité des déclarations de la personne qui importe l’enregistrement. Pour monter un faux appel d’urgence, un escroc n’a besoin que de quelques secondes de la voix d’un proche. L’offre gratuite est également limitée : environ 10 minutes d’audio généré par mois, selon le récapitulatif des formules publié par Unite.AI, tandis que les abonnements payants commencent à 6 dollars par mois.

Eleven v4 et v4 Turbo sont disponibles depuis le 28 septembre dans l’application de création d’ElevenLabs, sur sa plateforme d’agents et via son API destinée aux développeurs. Basée à Londres, l’entreprise a levé 500 millions de dollars auprès de Sequoia en février, pour une valorisation de 11 milliards de dollars. TechCrunch rapporte que son chiffre d’affaires annualisé a dépassé les 600 millions de dollars. Son directeur général, Mati Staniszewski, a confié à TechCrunch que l’entreprise envisageait une introduction en Bourse dans les prochaines années, sans avancer de date.

Pour les créateurs, une voix capable de rire sur commande dans 90 langues, c’est un studio d’enregistrement dans un onglet de navigateur. Pour tous les autres, c’est une raison de plus de raccrocher et de rappeler lorsqu’une voix familière au téléphone demande de l’argent.

Étiquettes: , , , , ,

Ajoutez-nous sur Google

Discussion

Il y a 0 commentaire.