IA

L’IA vocale d’OpenAI n’attend plus votre tour — à $0,05 la minute

Susan Hill

Tous les agents vocaux du marché vous demandent d’attendre avant de parler. Pas le GPT-Live-1 d’OpenAI. Ce modèle, accessible via l’API d’OpenAI, écoute et parle simultanément — il gère les interruptions, les silences et les chevauchements de parole comme le ferait un humain au téléphone.

Le tarif est de 0,05 $ par minute pour la couche vocale — soit 1,50 $ pour une conversation de 30 minutes, ou 50 $ pour 1 000 minutes de conversation. Les développeurs paient séparément un moteur de raisonnement : le propre GPT-6 Astra d’OpenAI ou tout autre modèle compatible gérant les appels d’outils et la logique métier. La couche vocale gère la mécanique de la conversation ; la couche de raisonnement décide ce que l’IA dit et fait réellement.

Ce que cette séparation signifie concrètement : un chatbot de service client peut entendre « attendez, en fait je veux l’autre option » en plein milieu d’une phrase et y répondre, plutôt que de dérouler une réponse préparée. Un tuteur en langues peut repérer un élève qui bute sur un mot sans attendre qu’il finisse. Un système de réservation peut gérer ce genre d’appel réel où les gens se répètent, changent d’avis et parlent en même temps.

Sur le Full Duplex Bench — l’évaluation conçue spécifiquement pour tester la gestion vocale bidirectionnelle simultanée — GPT-Live-1 obtient 30 points de pourcentage de plus que son prédécesseur, GPT-Realtime-2.1. Associé à GPT-6 Astra comme moteur de raisonnement, il dépasse Tau3, le benchmark du service client qui teste des requêtes complexes et multi-étapes sans interruption de conversation.

L’architecture à deux couches reflète un choix de conception délibéré. La synchronisation de la parole et le raisonnement sont facturés séparément parce qu’ils évoluent différemment : une startup qui construit une application légère de tutorat paie moins sur les deux couches qu’une entreprise gérant des milliers d’appels de service client simultanés sur GPT-6 Astra. Le plancher est de 0,05 $ la minute pour la voix, quel que soit le modèle qui tourne derrière.

Ce que GPT-Live-1 ne change pas, c’est la qualité des réponses. La couche vocale gère quand et comment l’IA parle — pas ce qu’elle sait. Une mauvaise réponse bien chronométrée reste une mauvaise réponse. Les développeurs qui construisent des applications de service client devront évaluer les deux couches séparément, et le moteur de raisonnement pourrait ajouter plus à la facture que la couche vocale elle-même. OpenAI n’a pas non plus publié de données sur les performances de l’architecture full-duplex dans des environnements à faible bande passante ou sur des lignes téléphoniques bruyantes, où l’entrée audio continue est plus difficile à maintenir.

GPT-Live-1 est désormais disponible dans l’API d’OpenAI. L’entreprise n’a pas annoncé de produit destiné au grand public construit sur ce modèle, bien qu’elle ait indiqué que les futures versions du mode vocal de ChatGPT pourraient s’appuyer sur la même architecture sous-jacente. Le tarif de 0,05 $ la minute s’applique au lancement ; OpenAI n’a pas publié de calendrier pour d’éventuels changements de prix ni de liste des modèles de raisonnement tiers approuvés pour une utilisation avec la couche vocale.

Étiquettes: , , , , ,

Discussion

Il y a 0 commentaire.