Microsoft AI casse les prix de la transcription vocale avec MAI-Transcribe-2
Il y a des annonces produit qu’on lit avec un sourcil levé, et celle-ci en fait partie. Au début du mois, Microsoft AI a mis en ligne MAI-Transcribe-2, son troisième modèle de reconnaissance vocale en cinq mois, et l’a facturé 10 centimes de dollar par heure d’audio traité. Cinq mois plus tôt, la version initiale de la gamme coûtait 0,36 dollar l’heure. La baisse est donc de 72 %, et elle s’accompagne, non pas d’une réduction, mais d’un enrichissement des fonctionnalités disponibles en standard. Pour une DSI qui traite un volume annuel de 100 000 heures d’audio (un centre d’appels de taille moyenne, par exemple), la facture passe théoriquement de 36 000 à 10 000 dollars. De quoi faire sortir la transcription vocale de la case « ligne budgétaire à justifier » 🙂
Le sujet mérite qu’on s’y attarde, non pas tant pour le tarif lui-même que pour ce qu’il révèle de la stratégie de Microsoft en matière d’IA, et pour les questions très concrètes qu’il pose aux organisations qui envisagent de basculer leurs flux audio vers ce nouveau modèle.
Ce que couvre réellement le modèle
MAI-Transcribe-2 transcrit désormais 60 langues, contre 43 pour MAI-Transcribe-1.5 sorti en juin et 25 pour la version d’avril. Il est accessible via Microsoft Foundry, la place de marché de modèles d’Azure, ainsi que via MAI Playground et OpenRouter. Microsoft insiste sur le fait que le modèle a été entraîné pour l’audio « réel » (bruit ambiant, enregistrements de qualité moyenne, voix qui se chevauchent) plutôt que pour les conditions de studio qui servent souvent de vitrine aux benchmarks.
Le plus intéressant se trouve dans les fonctionnalités incluses par défaut, celles que les éditeurs spécialisés facturent habituellement en option. La diarisation identifie qui parle à quel moment dans un enregistrement à plusieurs voix, ce qui fait toute la différence entre un mur de texte et un compte-rendu de réunion exploitable. L’horodatage au mot près facilite la recherche, le montage et la synchronisation avec la vidéo. Le biaisage par mots-clés permet d’indiquer au modèle une liste de termes métier (noms de produits, de médicaments, de collaborateurs) pour limiter les erreurs sur le vocabulaire spécialisé. La détection automatique de la langue dispense de la déclarer au préalable.
Deux fonctions se démarquent par leur finesse. Un mode de sortie configurable propose un rendu « verbatim », qui conserve les hésitations et les faux départs pour les usages de conformité ou juridiques, et un rendu « clean », qui les supprime pour produire des sous-titres ou des comptes-rendus directement lisibles. Le changement de langue en cours de phrase (le « code switching ») est également géré, avec une mention explicite pour le hindi-anglais et l’espagnol-anglais, des mélanges fréquents dans les centres de contact indiens et hispaniques des États-Unis. Autant de capacités que les acteurs spécialisés du secteur vendaient jusqu’ici séparément, et que Microsoft inclut désormais dans un tarif de base particulièrement agressif.
Des scores à lire avec un minimum de recul
Microsoft avance trois arguments de performance, chacun reposant sur une méthodologie différente, et il convient de les distinguer avant de les prendre pour argent comptant.
Le premier concerne FLEURS, un benchmark multilingue publié par Google en 2022 à partir de lecteurs natifs enregistrés dans une centaine de langues. MAI-Transcribe-2 s’y classe premier sur ses 60 langues, avec un taux d’erreur moyen de 5,2 %. Ce chiffre a toutefois augmenté par rapport aux 3,7 % annoncés pour MAI-Transcribe-1.5 en juin, ce qui s’explique vraisemblablement par l’élargissement de la couverture linguistique plutôt que par une régression du modèle : moyenner sur 60 langues plutôt que 43 revient à intégrer des langues à faibles ressources, sur lesquelles tous les modèles peinent davantage. Une DSI qui envisage un déploiement multilingue aura donc intérêt à demander le détail par langue plutôt que de se fier à la moyenne globale.
Le deuxième argument s’appuie sur Artificial Analysis, un cabinet d’évaluation indépendant qui teste les modèles via leurs API publiques dans des scénarios proches de l’usage réel (conversations d’agents, discours parlementaires, comptes-rendus financiers, avec une forte pondération vers l’anglais d’entreprise). MAI-Transcribe-2 y grimpe à la deuxième place du classement sur le taux d’erreur, contre une troisième place en juin pour la version précédente, derrière le modèle Fun-Realtime-ASR-preview d’Alibaba et Scribe v2 d’ElevenLabs. Microsoft revendique par ailleurs définir la « frontière de Pareto » du couple précision-latence, c’est-à-dire qu’aucun concurrent ne fait mieux en précision sans être plus lent, et aucun ne fait mieux en vitesse sans être moins précis.
Le troisième argument, la vitesse pure, est le plus spectaculaire : dix fois plus rapide que GPT-Transcribe d’OpenAI, sept fois plus que Scribe v2 d’ElevenLabs, cinq fois plus que Gemini 3.5 Transcribe de Google, selon les mesures d’Artificial Analysis. En transcription par lots, la vitesse ne se traduit pas par du confort d’attente mais par du débit, donc par du coût de calcul : un modèle qui tourne 300 fois plus vite que le temps réel consomme une fraction des heures de GPU d’un modèle qui tourne 30 fois plus vite. C’est cette efficacité qui permet à Microsoft de facturer 10 centimes tout en restant, selon toute vraisemblance, rentable sur l’infrastructure.
La vraie histoire : Microsoft prend ses distances avec OpenAI
Le rythme de sortie est en soi révélateur. Le 2 avril, MAI-Transcribe-1 est lancé avec 25 langues à 0,36 dollar l’heure. Le 2 juin, MAI-Transcribe-1.5 arrive avec 43 langues et le biaisage par mots-clés. Le 3 septembre, MAI-Transcribe-2 ajoute la diarisation, l’horodatage, le changement de langue, et divise le prix par plus de trois. Trois versions en cinq mois, chacune élargissant la couverture linguistique d’environ 40 %, c’est le rythme d’une équipe qui a stabilisé son architecture et qui tourne désormais la manivelle sur les données et l’échelle, la phase où les modèles de parole progressent vite et de façon prévisible.
Mustafa Suleyman, le patron de Microsoft AI, a confié au média The Verge en avril que la première version avait été construite par une équipe resserrée d’une dizaine de personnes, « libérée de toute bureaucratie », et qu’elle tournait pour moitié moins cher en GPU que les modèles concurrents de référence. Le contexte de cette autonomie technique est connu : Microsoft a investi plus de 13 milliards de dollars dans OpenAI, mais la relation s’est distendue depuis l’arrivée de Suleyman en mars 2024 (débauché d’Inflection AI), puis la restructuration du partenariat en octobre 2025, qui a explicitement autorisé Microsoft à « poursuivre seul ou avec des tiers » ses ambitions en IA générale. En avril 2026, un nouvel avenant a mis fin à l’exclusivité de Microsoft sur les modèles d’OpenAI et supprimé le partage de revenus entre les deux sociétés. Chaque assouplissement du contrat a été suivi de nouveaux modèles MAI.
L’autre moitié de l’explication est purement budgétaire. Bloomberg a rapporté en juillet que Microsoft utilisait déjà ses modèles MAI pour traiter une partie des requêtes dans Word et Excel, des produits jusqu’alors présentés comme reposant sur OpenAI et Anthropic. La transcription est une cible naturelle pour cette substitution : le problème est borné, la métrique est objective, et Microsoft possède à la fois Teams (générateur massif d’audio de réunion), Nuance (dont l’activité de documentation clinique repose entièrement sur la reconnaissance vocale) et les services Azure Speech déjà utilisés par des milliers d’entreprises. Chaque heure d’audio qui bascule vers MAI-Transcribe-2 est une heure que Microsoft ne paie plus à un partenaire devenu, entre-temps, un concurrent partiel.
Ce que cela signifie pour une DSI
Sur le papier, l’offre est difficile à décliner : prix divisé par plus de trois, fonctionnalités habituellement payantes incluses, couverture linguistique élargie. Dans la pratique, l’annonce laisse plusieurs questions ouvertes que toute équipe technique devrait poser avant de migrer des flux de production.
La première porte sur la durée de l’offre. Le tarif de 0,10 dollar est explicitement qualifié d’offre de lancement « valable jusqu’à la fin de l’année ». Autrement dit, le tarif normal, celui qui s’appliquera à partir de 2027, reste inconnu, et c’est ce chiffre-là qu’il faut obtenir par écrit avant de bâtir un modèle de coût pluriannuel.
La deuxième concerne le streaming. L’annonce met en avant le débit en traitement par lots et l’audio long format, mais reste silencieuse sur la transcription en temps réel, pourtant indispensable pour les agents vocaux et le sous-titrage en direct. Artificial Analysis maintient un classement séparé pour le streaming, et l’absence de Microsoft sur ce terrain n’est probablement pas un hasard de communication.
La troisième touche à la précision par langue : un taux d’erreur moyen de 5,2 % sur 60 langues peut aussi bien recouvrir 3 % sur les langues majeures que 12 % sur les langues à faibles ressources. Toute organisation ayant des besoins spécifiques (portugais du Brésil, arabe dialectal, langues régionales) devrait tester directement sur son propre corpus plutôt que de se fier à la moyenne globale.
La quatrième porte sur la qualité de la diarisation elle-même : le taux d’erreur de mots ne mesure pas l’attribution des locuteurs, et un transcript peut afficher un score quasi parfait tout en attribuant une phrase sur deux à la mauvaise personne. Microsoft ne publie aucune métrique d’erreur de diarisation, ce qui devrait inciter à un test terrain avant tout déploiement sur des cas d’usage sensibles (comptes-rendus de comité, entretiens RH).
La cinquième, sans doute la plus importante pour un lecteur européen, concerne le traitement des données. La transcription d’entreprise touche potentiellement des dossiers médicaux, des échanges couverts par le secret professionnel ou des informations financières sensibles. L’annonce ne dit rien sur la résidence des données, leur durée de conservation, ni sur une éventuelle réutilisation de l’audio soumis à Foundry pour entraîner de futurs modèles. Les communications d’avril de Microsoft décrivaient les données d’entraînement comme un mélange d’enregistrements curés, d’audio bruité enregistré par des prestataires, et de « vastes quantités de données issues du web ouvert », une formulation qui mérite d’être creusée avant tout traitement de données personnelles ou soumises au RGPD. Les équipes conformité voudront des garanties écrites sur la localisation Azure EU Data Boundary et sur l’exclusion contractuelle des données clientes de tout réentraînement, garanties qui ne figurent pas dans le communiqué de lancement.
Une pièce d’un puzzle plus large
Microsoft AI publie désormais des modèles sur l’image, la voix, la transcription, le code, le raisonnement et la cybersécurité, sept nouveaux modèles MAI ont été annoncés en une seule session lors de sa conférence Build en juin. Il ne s’agit pas de battre GPT ou Gemini sur tous les terrains à la fois, mais de constituer un portefeuille de modèles spécialisés qui permette à Microsoft de couvrir l’essentiel de ses propres charges de travail sans payer un tiers, tout en vendant la capacité excédentaire à des tarifs que les spécialistes ne peuvent pas suivre. La transcription est simplement la modalité où cette mécanique arrive à maturité en premier. Le communiqué de MAI-Transcribe-2 ressemble moins à une annonce produit qu’à un gabarit que Microsoft s’apprête à décliner ailleurs.
Pour les DSI, RSSI et architectes qui suivent l’écosystème Microsoft, le signal à retenir dépasse le seul cas de la transcription : l’infrastructure IA de Microsoft 365, Teams et Azure Speech est en train de basculer, produit par produit, d’un modèle où OpenAI fournit l’intelligence vers un modèle où Microsoft la produit elle-même. Cette bascule promet des baisses de coûts. Elle mérite aussi qu’on interroge, produit par produit, les mêmes questions que celles posées plus haut : durée réelle des tarifs promotionnels, localisation et réutilisation des données, et écart entre les scores de benchmark et le comportement du modèle sur les cas d’usage propres à chaque organisation.