← Tutti gli articoli

Notizie sull’AI

Microsoft porta la trascrizione live a 60 lingue: gli agenti vocali accelerano

La nuova famiglia MAI unisce trascrizione in streaming e sintesi vocale multilingue; le prime parole arrivano presto, ma possono ancora cambiare.

Microfono montato su un supporto in uno studio di registrazione.
Microfono in studio. Immagine di contesto: la fotografia non documenta i nuovi modelli Microsoft.Foto: Shixart1985 / Wikimedia Commons, CC BY 2.0; fotografia ritagliata e composta da ANPAI.

Microsoft lancia modelli vocali con trascrizione live in 60 lingue e sintesi multilingue. Prezzi, applicazioni e limiti per chi sviluppa in Italia.

Microsoft ha lanciato tre modelli audio della famiglia MAI: una trascrizione che produce testo mentre la persona parla e due sistemi per generare voce. Il dato più concreto è il tempo della prima ipotesi, poco più di 100 millisecondi secondo l’azienda, insieme al supporto dichiarato per 60 lingue. Per chi sviluppa assistenza clienti, sottotitoli o strumenti vocali, questo riduce l’attesa prima che l’app reagisca.

La velocità ha un rovescio pratico: il testo iniziale può essere corretto quando arriva altro contesto. Un agente che avvia una procedura sulla prima bozza può interpretare male una richiesta incompleta. La trascrizione in tempo reale offre quindi un nuovo modo di interagire, ma non rende ogni parola acquisita una conferma definitiva dell’intento della persona.

Che cosa è successo

Il modello MAI-Transcribe-2-Streaming restituisce trascrizioni parziali e le aggiorna mentre la conversazione continua; Microsoft dichiara rilevamento automatico della lingua in 60 idiomi e un prezzo promozionale di 0,54 dollari per ora audio fino alla fine del 2026. L’azienda lo propone per dettatura, sottotitoli e applicazioni vocali che devono reagire prima che l’interlocutore finisca.

Gli altri due prodotti sono MAI-Voice-2.1 e la variante Flash. Microsoft afferma che la prima genera parlato in 23 lingue e 26 varianti locali mantenendo una voce coerente tra lingue; la versione Flash è presentata come più rapida e meno costosa per servizi ad alto volume. Queste descrizioni, i prezzi e i confronti di latenza sono dichiarazioni del produttore e dipendono dal servizio e dalle condizioni d’uso disponibili in Foundry.

Microsoft sostiene che il modello di trascrizione si trovi al primo posto per accuratezza in una valutazione di Artificial Analysis. PYMNTS ha confermato il lancio e ha descritto gli scenari d’uso, ma le prestazioni dichiarate dal produttore non equivalgono a una prova indipendente su ogni accento, rumore ambientale, terminologia professionale o conversazione italiana.

Il punto che rischia di passare inosservato

Il cambiamento più interessante non è soltanto la velocità del riconoscimento, ma il fatto che un software possa iniziare a ragionare o preparare una chiamata a uno strumento mentre la frase è ancora in corso. Questo può rendere più naturale una conversazione, ma sposta il rischio: una risposta o un’azione può partire da parole provvisorie prima che l’utente abbia completato la richiesta.

La generazione vocale introduce un secondo tema: continuità della voce fra lingue e, nei flussi che la prevedono, replica di una voce autorizzata. Per una banca, una scuola o un servizio di assistenza la scelta della voce va accompagnata da consenso documentato, regole d’uso e un modo evidente per riconoscere quando si parla con un agente automatico.

A 100 millisecondi arriva un’ipotesi, non una prova che l’utente abbia finito di parlare.

Che cosa cambia per imprese e professionisti

Le imprese italiane possono valutare questi modelli per sottotitoli dal vivo, trascrizione di riunioni multilingue, tutor vocali e call center. Prima di trasferire audio di clienti o dipendenti devono verificare area di disponibilità, condizioni di trattamento, conservazione, accordi contrattuali e costi dopo l’eventuale prezzo introduttivo; l’annuncio non chiarisce da solo ogni requisito per l’uso in Europa.

Nel prototipo conviene mostrare quando il testo è provvisorio, aspettare la fine del turno prima di eseguire azioni con conseguenze e consentire una correzione semplice. Per i sottotitoli, la qualità va misurata con parlanti italiani reali, dialetti, sovrapposizioni e rumori dell’ambiente, non soltanto con il benchmark scelto dal produttore.

Che cosa osservare adesso

Da osservare sono la disponibilità effettiva dei tre modelli nelle regioni europee, il costo reale sui volumi di un’azienda e la differenza tra ipotesi parziale e trascrizione finale. Serviranno prove esterne su conversazioni italiane e informazioni più complete su clonazione vocale e protezione dei dati prima di considerarli pronti per processi sensibili.

Per un confronto su un’altra novità di trascrizione, ANPAI ha raccontato come sono cambiate le registrazioni con l’aggiornamento delle trascrizioni di Grok.

Per approfondire

Per il contesto ANPAI: Grok aggiorna le trascrizioni AI

Le fonti

Microsoft AI, 1 ottobre 2026 · PYMNTS, 1 ottobre 2026 · SiliconANGLE, 1 ottobre 2026


Questa analisi della redazione ANPAI aiuta a leggere fatti e conseguenze operative. Non sostituisce una valutazione tecnica o legale riferita a un caso specifico.

Parliamone

Hai una domanda
o un progetto sull’AI?

Parla con ANPAI

Newsletter

Le notizie AI che contano, direttamente via email.

Ricevi una selezione chiara delle novità più importanti sull’intelligenza artificiale.