IA

Une équipe de 10 personnes chez Microsoft a construit un modèle vocal moins cher et plus rapide qu’OpenAI et Google

Adrian Kessler

Le modèle s’appelle MAI-Transcribe-2. Microsoft AI, la division dirigée par Mustafa Suleyman, l’a mis en ligne le 3 septembre au tarif de 0,10 $ par heure audio — un prix limité jusqu’à la fin de l’année 2026. La version précédente, MAI-Transcribe-1.5, coûtait 0,36 $ de l’heure. Cette réduction de 72 % n’est pas un artifice marketing. Un centre de contact traitant 100 000 heures d’audio par an payait 36 000 $ pour l’ancien modèle ; la même charge de travail coûte désormais 10 000 $.

Ce qui rend ce prix inhabituel, ce sont les performances sur les benchmarks. Sur l’évaluation multilingue FLEURS, MAI-Transcribe-2 se classe premier parmi 60 langues avec un taux d’erreur moyen de 5,2 % — meilleur que GPT-Transcribe d’OpenAI, Gemini 3.5 Transcribe de Google, ElevenLabs Scribe v2 et Whisper V3-Large de Meta. Sur le classement Artificial Analysis, qui suit à la fois la précision et la latence, il se situe au deuxième rang global et définit ce que les chercheurs appellent la frontière de Pareto — la limite au-delà de laquelle on ne peut améliorer un indicateur sans dégrader l’autre. Le modèle a été entraîné pour se placer sur le bord efficient de cette frontière, et non pour viser le sommet d’un tableau à indicateur unique.

La vitesse est le deuxième argument qui mérite d’être examiné. Microsoft affirme que MAI-Transcribe-2 traite l’audio 10 fois plus vite que GPT-Transcribe, 7 fois plus vite qu’ElevenLabs Scribe v2 et 5 fois plus vite que Gemini 3.5 Transcribe. Pour l’audio long — transcription de podcasts, dépositions judiciaires, notes cliniques — cette différence détermine si un flux de travail s’exécute en secondes ou en minutes. Le modèle assure également la diarisation des locuteurs (identifier qui parle quand), les horodatages au niveau du mot, le biais par mots-clés pour la terminologie de domaine, et la prise en charge de l’alternance codique pour les langues qui se mélangent en milieu de phrase, citant spécifiquement le hinglish et le spanglish comme exemples testés.

L’équipe qui l’a construit est remarquable par sa taille par rapport à ce qu’elle a réalisé. Microsoft décrit le groupe central comme composé de 10 personnes, fonctionnant avec un minimum de bureaucratie interne et soutenu par des équipes plus larges chargées de l’acquisition de données et de la gestion des fournisseurs. L’affirmation sur l’efficacité GPU qui en résulte est précise : MAI-Transcribe-2 fonctionne pour moitié du coût GPU des modèles concurrents de pointe. Que cela tienne sous une charge d’entreprise à grande échelle n’est pas vérifiable à partir de l’annonce, mais l’affirmation sur l’architecture est suffisamment précise pour être testée.

Le modèle est disponible dès maintenant sur Microsoft Foundry, le MAI Playground et Open Router — ce qui signifie que l’accès ne nécessite ni contrat Azure ni relation d’entreprise avec Microsoft. Cette largeur de distribution est délibérée. La poussée de Microsoft AI vers des API directes aux développeurs s’inscrit dans un repositionnement plus large suite à la restructuration du partenariat avec OpenAI. Les avenants d’octobre 2025 et d’avril 2026 ont supprimé les clauses d’exclusivité et de partage des revenus qui définissaient la relation depuis 2019. Microsoft a désormais un intérêt direct à concurrencer au niveau du modèle plutôt qu’à distribuer uniquement les résultats d’OpenAI.

Le prix de 0,10 $ est indiqué comme limité jusqu’à fin 2026. La tarification standard après cette date n’a pas été divulguée. Les acheteurs qui évaluent MAI-Transcribe-2 pour des charges de travail en production évaluent un produit dont ils ne connaissent pas le coût pour l’année civile 2027. C’est un risque qu’il convient de nommer clairement, même si le tarif actuel rend le modèle attractif face à toutes les alternatives visibles.

Étiquettes: , , , , ,

Discussion

Il y a 0 commentaire.