IA generativa pratica con trasformatori e modelli di diffusione
by Omar Sanseviero, Pedro Cuenca, Apolinário Passos, Jonathan Whitaker
Capitolo 9. Generare l'audio
Questo lavoro è stato tradotto utilizzando l'AI. Siamo lieti di ricevere il tuo feedback e i tuoi commenti: translation-feedback@oreilly.com
Nel Capitolo 1, abbiamo intravisto il potenziale della generazione audio con una pipeline di trasformatori basata sul modello MusicGen di Meta. Questo capitolo si addentra nell'audio generativo, utilizzando tecniche basate sulla diffusione e sui trasformatori, che introdurranno una nuova serie di sfide e applicazioni interessanti. Immagina di poter eliminare tutti i rumori di fondo in tempo reale durante una telefonata, di poter ottenere trascrizioni e riassunti di alta qualità delle conferenze o di poter rigenerare le canzoni di un cantante in altre lingue. Potresti persino generare un tema di Mozart e Billie Eilish con un tocco mariachi. Questa è la traiettoria del campo, ci aspettano tempi entusiasmanti.
Che tipo di cose possiamo fare con il ML e l'audio? I due compiti più comuni sono la trascrizione del parlato in testo (riconoscimento automatico del parlato, o ASR) e la generazione del parlato dal testo (text to speech). Nell'ASR, un modello riceve in ingresso l'audio di una persona (o di più persone) che parla e produce il testo corrispondente. Per alcuni modelli, l'output cattura informazioni aggiuntive, come la persona che sta parlando o il momento in cui qualcuno ha detto qualcosa. I sistemi ASR sono molto utilizzati, dagli assistenti vocali virtuali ai generatori di didascalie. Grazie ai numerosi modelli ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access