Vai al contenuto
Offerte

Microsoft AI lancia tre modelli vocali: c’è la trascrizione live

In questo articolo Indice dei contenuti 2 sezioni

Microsoft amplia la sua offerta nel campo dell’intelligenza artificiale vocale con tre nuovi modelli sviluppati dalla divisione Microsoft AI. Il primo si chiama MAI-Transcribe-2-Streaming ed è pensato per produrre trascrizioni in tempo reale con una latenza ridotta. Gli altri due sono modelli dedicati alla voce e portano i nomi di MAI-Voice-2.1 e MAI-Voice-2.1-Flash. Tre lanci in contemporanea che puntano tutti su un tema preciso, cioè il modo in cui le macchine ascoltano e restituiscono il parlato.

Come funziona la trascrizione in tempo reale di MAI-Transcribe-2-Streaming

Il cuore dell’annuncio è MAI-Transcribe-2-Streaming, un modello che Microsoft presenta come soluzione a bassa latenza per la conversione del parlato in testo. Già il nome dice parecchio. La parola Streaming indica che la trascrizione avviene mentre l’audio scorre, senza dover attendere la fine di una registrazione per ottenere il risultato scritto. In pratica le parole compaiono sullo schermo man mano che vengono pronunciate.

La latenza è proprio il punto su cui si gioca la partita. Con questo termine si intende il ritardo che separa il momento in cui una persona parla da quello in cui il testo diventa visibile. Più questo intervallo si accorcia e più l’esperienza appare fluida e naturale. Per chi lavora con contenuti dal vivo la differenza tra una trascrizione immediata e una che arriva con qualche secondo di ritardo non è affatto un dettaglio, perché incide direttamente sulla possibilità di seguire una conversazione mentre accade.

MAI-Voice-2.1 e MAI-Voice-2.1-Flash, le due novità per la voce

Accanto al modello di trascrizione la società di Redmond ha introdotto anche due nuovi modelli vocali. Il primo è MAI-Voice-2.1 mentre il secondo, MAI-Voice-2.1-Flash, ne rappresenta una variante distinta identificata dal suffisso Flash. Se MAI-Transcribe-2-Streaming si occupa di trasformare la voce in parole scritte, questa coppia di strumenti lavora sul versante della voce stessa.

La scelta di proporre due versioni affiancate della stessa famiglia mostra la volontà di Microsoft di offrire più alternative all’interno di un’unica linea di prodotti. Entrambi i modelli condividono infatti la stessa numerazione 2.1 e fanno parte della serie MAI-Voice, che si va così ad aggiungere al nuovo sistema di trascrizione.

Con questo pacchetto di lanci Microsoft AI mette in campo contemporaneamente un modello per le trascrizioni in tempo reale a bassa latenza e due modelli vocali, MAI-Voice-2.1 e MAI-Voice-2.1-Flash, tutti e tre presentati nello stesso annuncio.

Fonte: TecnoAndroid

Condividi:
51 Condivisioni