← Tutti gli articoli

Notizie sull’AI

Suno lancia Speech: le voci AI arrivano insieme alla musica originale

La beta pubblica crea parlato e colonna sonora nello stesso flusso, ampliando il servizio oltre la generazione di canzoni.

Un microfono da studio sospeso sopra una batteria in una sala di registrazione.
Microfono in una sala di registrazione. Immagine di contesto: la fotografia non documenta il servizio Suno Speech.Foto: Shixart1985 / Wikimedia Commons, CC BY 2.0; composizione ANPAI

Suno apre Speech in beta su web e mobile: si può scrivere un copione e generare voce con musica di sottofondo. Ecco usi, limiti e verifiche per chi crea contenuti.

Suno ha aperto Speech, una funzione beta che genera un testo parlato insieme a una base musicale originale. È disponibile sul web e nelle app mobili e porta la piattaforma, nota per creare canzoni, verso formati come brevi narrazioni, letture e messaggi vocali musicati. Per chi lavora con contenuti, il cambiamento può ridurre alcuni passaggi di produzione; non dimostra però che il risultato sia già adatto a una pubblicazione professionale senza revisione.

La società presenta Speech come un modello audio che unisce voce e musica in un’unica traccia. The Verge descrive due modalità: una guidata da un prompt e una in cui si inserisce un copione, con alcune opzioni per lo stile della voce. Suno stessa avverte che la funzione è ancora in beta e segnala problemi possibili con accenti e pause.

Che cosa è successo

Nell’annuncio del 1° ottobre, il responsabile di prodotto Jack Brody spiega che l’utente può partire da un’idea, una poesia o un testo già scritto e descrivere il tipo di voce e l’atmosfera musicale desiderati. La musica non è soltanto un accompagnamento aggiunto dopo: viene generata insieme al parlato. La funzione è stata provata per un mese con un gruppo ristretto e ora viene estesa alla comunità di Suno.

La copertura di The Verge chiarisce un dettaglio operativo: nella modalità semplice si descrive ciò che si vuole ottenere; nella modalità avanzata si può fornire un copione e regolare alcune caratteristiche della voce. La durata massima riportata è di circa otto minuti. La musica può essere disattivata per ottenere parlato senza colonna sonora, ma il prodotto è progettato per mettere in relazione i due elementi.

Questo amplia il perimetro di un servizio che finora molti utenti associavano soprattutto alla composizione musicale. Una piccola attività può provare una lettura promozionale, un’introduzione per un video o una storia audio senza montare separatamente voce e musica. È una possibilità dichiarata e accessibile in beta, non una garanzia di accessibilità, qualità vocale o compatibilità con i flussi di lavoro professionali.

Il punto che rischia di passare inosservato

La differenza rispetto a un normale sintetizzatore vocale è il legame fra contenuto e colonna sonora. Può rendere più rapido produrre una traccia completa, ma rende anche meno semplice separare ciò che viene detto dal modo in cui la musica ne orienta il tono. Per una comunicazione informativa, un accompagnamento emotivo o troppo enfatico può cambiare la percezione del messaggio anche quando le parole restano identiche.

L’annuncio non fornisce una valutazione indipendente dell’accuratezza con cui Speech riproduce un copione in italiano, né un confronto misurato con strumenti specializzati di sintesi vocale. Suno ammette che le voci possono interpretare male gli accenti e inserire pause eccessive. La beta non va quindi confusa con un sistema di doppiaggio già affidabile per campagne, audiolibri o contenuti con requisiti di pronuncia rigorosi.

Generare voce e musica insieme fa risparmiare passaggi, ma il controllo editoriale resta umano.

Che cosa cambia per imprese e professionisti

Per professionisti, creator e PMI italiane il primo uso sensato è sperimentale: produrre bozze di brevi audio, confrontare varianti di tono e verificare quanto lavoro di rifinitura rimane. Prima di impiegarlo con clienti o pubblico, occorre riascoltare ogni frase, correggere nomi e pronunce, controllare la leggibilità e valutare se la musica sostiene o distrae dal contenuto.

Un flusso più rapido non risolve le domande su diritti, consenso e trasparenza. Se si caricano testi, voci o materiali di terzi, vanno rispettate le autorizzazioni applicabili; se il risultato simula una persona reale, la comunicazione non dovrebbe indurre il pubblico a credere che abbia davvero parlato. Sono cautele editoriali e contrattuali generali, non nuove condizioni annunciate da Suno per questa beta.

Che cosa osservare adesso

Nei prossimi aggiornamenti sarà utile osservare la qualità della voce in italiano, la fedeltà ai copioni, la disponibilità per i diversi piani e le regole per l’uso commerciale dei file generati. Per ora l’azienda promette di migliorare la funzione sulla base dei commenti, ma non pubblica metriche di accuratezza o una data di uscita dalla beta.

Per chi confronta strumenti vocali, ANPAI ha già raccontato l’arrivo dei modelli Microsoft che trascrivono conversazioni in diretta e generano voci in più lingue.

Per approfondire

Per il contesto ANPAI: I modelli vocali live di Microsoft

Le fonti

Suno, 1 ottobre 2026 · The Verge, 2 ottobre 2026


Questa analisi della redazione ANPAI aiuta a leggere fatti e conseguenze operative. Non sostituisce una valutazione tecnica o legale riferita a un caso specifico.

Parliamone

Hai una domanda
o un progetto sull’AI?

Parla con ANPAI

Newsletter

Le notizie AI che contano, direttamente via email.

Ricevi una selezione chiara delle novità più importanti sull’intelligenza artificiale.