IA

Gemini 3.8 Live dote l’IA d’un visage synchronisé en 97 langues

Adrian Kessler
Ajoutez-nous sur Google

Le système s’appelle Gemini 3.8 Live avec Live Avatar. Il associe le modèle vocal de Google, qui traite la parole de bout en bout, à une couche vidéo en temps réel générant mouvements des lèvres et expressions faciales, tout en gérant des appels d’outils en arrière-plan sans interrompre la conversation. La détection de la langue est automatique : l’avatar passe d’une langue parlée à une autre en cours d’appel, sans transfert, rechargement du système ni pause perceptible.

Ce qui distingue cette technologie des procédés consistant à superposer une vidéo, c’est que la génération audio et vidéo s’effectue dans le même chemin d’inférence en temps réel, plutôt qu’en plusieurs étapes successives. Cette intégration réduit suffisamment la latence pour préserver le rythme naturel d’une conversation. Google intègre de manière imperceptible le filigrane SynthID aux sorties audio et vidéo : chaque seconde comporte une marque lisible par une machine, qui signale que le contenu a été généré par l’IA, même si le flux est enregistré puis lu ultérieurement. Le filigrane résiste au réencodage, ce qui permet toujours de vérifier la provenance des extraits exportés.

Equal AI, qui gère des déploiements en entreprise dans toute l’Inde, donne l’indication la plus claire de ce que la technologie permet à grande échelle sur le plan opérationnel : neuf langues indiennes utilisées simultanément, plus d’un million d’appels en direct par jour, sur un total de 97 langues prises en charge. Un tel volume serait économiquement difficilement viable avec des agents humains offrant une disponibilité et une couverture des horaires équivalentes. Le déploiement repose non pas sur une hypothèse de preuve de concept, mais sur une exigence de débit.

Le lancement ne précise pas le prix. Google n’a pas publié ses tarifs et renvoie les demandes à son équipe commerciale dédiée aux entreprises. La création d’avatars personnalisés — les organisations peuvent façonner un visage à partir de leurs propres images de référence — nécessite une inscription sur liste d’autorisation réservée aux entreprises, après une procédure de vérification distincte ; elle n’est pas accessible en libre-service. Les capacités Extended Thinking du modèle Live sont toujours en aperçu privé, ce qui limite la profondeur de raisonnement par rapport aux autres offres Gemini de Google. Les limites du nombre de sessions simultanées n’ont pas été communiquées. Ce lancement à accès restreint correspond à la pratique de Google pour ses déploiements progressifs en entreprise, dont les tarifs et les capacités font l’objet de négociations plutôt que d’une publication.

Gemini 3.8 Live avec Live Avatar est disponible dès maintenant dans la console Gemini Enterprise et via l’API Live, avec des points de terminaison aux États-Unis et dans l’Union européenne. Google n’a annoncé aucun calendrier d’élargissement de l’accès à Extended Thinking pour le modèle Live au-delà du groupe actuellement admis à l’aperçu privé.

Les entreprises qui le déploient répondront à une question à laquelle la technologie, elle, ne répond pas : supprimer le signal visuel qui indique qu’une interaction est automatisée améliore-t-il l’expérience des utilisateurs, ou efface-t-il le dernier indice honnête qu’ils en ont ?

Étiquettes: , , , , ,

Ajoutez-nous sur Google

Discussion

Il y a 0 commentaire.