In questo articolo Indice dei contenuti 3 sezioni
Microsoft spinge sulla voce e porta la trascrizione in tempo reale in 60 lingue con tre nuovi modelli della famiglia MAI, pensati per far dialogare persone e assistenti digitali quasi senza pause. Il gruppo continua a sviluppare in casa soluzioni per ogni tipo di esigenza, dalle immagini al ragionamento, passando per il codice e appunto il parlato.
Il mese scorso era stata la volta di MAI Transcribe 2, che nei test interni aveva battuto i concorrenti di OpenAI e Google con un costo dichiarato di appena 0,09 euro circa all’ora. Una cifra che nel mercato dell’intelligenza artificiale ricorda più un volantino del supermercato che un listino tecnologico.
Adesso la squadra si allarga con MAI Transcribe 2 Streaming, MAI Voice 2.1 e MAI Voice 2.1 Flash. L’azienda li immagina come ingranaggi di un unico meccanismo: uno ascolta, uno dà voce alle risposte e il terzo fa la stessa cosa ma più in fretta. L’idea è costruire assistenti vocali capaci di replicare senza quei due secondi di silenzio che ogni volta fanno sospettare che la chiamata sia caduta.
La trascrizione che arriva mentre si parla
Il predecessore lavorava soltanto su audio registrato. La versione Streaming invece si mette all’opera appena il suono arriva e dopo poco più di 100 millisecondi restituisce una prima trascrizione parziale. Poi ci ripensa e la corregge man mano che il contesto diventa più chiaro, fino a mettere il timbro sul testo definitivo.
Il modello comprende 60 lingue e si accorge da solo quando chi parla cambia idioma, anche a metà conversazione. Secondo Microsoft su Artificial Analysis risulta primo per accuratezza sia nei testi parziali sia in quelli finali. Nelle prove interne dedicate a dettatura e sottotitoli le parole comparivano due volte più velocemente rispetto al rivale più vicino. Trattandosi di dati diffusi dalla stessa casa madre è meglio prenderli con un po’ di prudenza.
Sul fronte dei costi la modalità streaming richiede circa 0,46 euro per ogni ora di audio fino alla fine del 2026, oltre cinque volte il prezzo promozionale del fratello che aspetta la chiusura del discorso. La rapidità insomma si paga.
Una sola voce per tante lingue
Per quanto riguarda l’uscita audio, MAI Voice 2.1 è il nuovo modello di sintesi vocale multilingue. Parla 23 lingue declinate in 26 varianti locali e permette a una stessa voce di passare da un idioma all’altro restando riconoscibile, con l’accento nativo giusto per ciascuna lingua.
Il listino indica circa 19 euro per milione di caratteri. Il modello precedente, MAI Voice 2, insieme alla sua variante Flash lavorava già dietro le quinte di Dynamics 365 Contact Center e di Azure Voice Live. La nuova versione rifà lo stesso mestiere con qualche muscolo in più.
Flash, clonazione e disponibilità
Chi gestisce molti utenti e ha poca pazienza può puntare su MAI Voice 2.1 Flash, che genera 45 secondi di audio con circa 150 millisecondi di latenza complessiva dall’inizio alla fine. Microsoft parla di un’inferenza più veloce del 55% e di costi inferiori di circa il 60% rispetto a modelli paragonabili. Il prezzo si ferma intorno ai 13 euro per milione di caratteri.
Entrambi i modelli vocali sono in grado di eseguire la clonazione vocale partendo da pochi secondi di audio di riferimento, in tutte le lingue supportate. Una funzione che farà felici i truffatori e, con un pizzico di ottimismo in più, anche chi deve doppiare un corso di formazione aziendale.
I tre modelli sono accessibili su Microsoft Foundry, nel MAI Playground e su Vercel. Le due soluzioni dedicate alla voce si trovano anche su OpenRouter, mentre il supporto a LiveKit è annunciato come imminente. Tutti possono essere utilizzati inoltre attraverso Azure Voice Live.
Fonte: TecnoAndroid








