Skip to Content
IA generativa pratica con trasformatori e modelli di diffusione
book

IA generativa pratica con trasformatori e modelli di diffusione

by Omar Sanseviero, Pedro Cuenca, Apolinário Passos, Jonathan Whitaker
March 2025
Intermediate to advanced
418 pages
12h 2m
Italian
O'Reilly Media, Inc.
Content preview from IA generativa pratica con trasformatori e modelli di diffusione

Appendice B. Requisiti di memoria di LLM

I modelli sono disponibili in tutte le dimensioni! Llama 3.1, ad esempio, è stato rilasciato con le varianti 8B, 70B e 405B. Per caricare e utilizzare un LLM, è necessaria una quantità di memoria sufficiente per memorizzare il modello. Il numero di parametri e la loro precisione, tra gli altri fattori, influenzano i requisiti di memoria di un LLM.

Cosa puoi fare se non hai abbastanza memoria? Prova queste opzioni:

  • Riduci la precisione del modello che stai utilizzando. Invece di usare float16, puoi usare int8.

  • Usa un modello più piccolo. Esistono molti modelli piccoli di alta qualità.

  • Scaricare le parti del modello che non si utilizzano. Questo può essere fatto con CPU RAM offloading, una tecnica comune per ridurre i requisiti di memoria di un modello al costo di una minore velocità di inferenza. Cosa succede se la memoria non è sufficiente? Possiamo memorizzare le parti rimanenti del modello sul disco e caricarle quando necessario. Fortunatamente, la libreria di accelerazione si occupa di questo tramite device_map="auto", che scarica automaticamente le parti del modello quando necessario.

Requisiti di memoria per l'inferenza

puoi stimare approssimativamente i requisiti di memoria come segue:

GPU memoria necessario = Numero di parametri × Byte per parametro

I byte per parametro dipendono dalla precisione utilizzata. Senza entrare troppo nel dettaglio, la Tabella B-1 mostra la memoria necessaria per caricare i modelli ...

Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.

Read now

Unlock full access

More than 5,000 organizations count on O’Reilly

AirBnbBlueOriginElectronic ArtsHomeDepotNasdaqRakutenTata Consultancy Services

QuotationMarkO’Reilly covers everything we've got, with content to help us build a world-class technology community, upgrade the capabilities and competencies of our teams, and improve overall team performance as well as their engagement.
Julian F.
Head of Cybersecurity
QuotationMarkI wanted to learn C and C++, but it didn't click for me until I picked up an O'Reilly book. When I went on the O’Reilly platform, I was astonished to find all the books there, plus live events and sandboxes so you could play around with the technology.
Addison B.
Field Engineer
QuotationMarkI’ve been on the O’Reilly platform for more than eight years. I use a couple of learning platforms, but I'm on O'Reilly more than anybody else. When you're there, you start learning. I'm never disappointed.
Amir M.
Data Platform Tech Lead
QuotationMarkI'm always learning. So when I got on to O'Reilly, I was like a kid in a candy store. There are playlists. There are answers. There's on-demand training. It's worth its weight in gold, in terms of what it allows me to do.
Mark W.
Embedded Software Engineer

You might also like

Ingegneria dell'IA

Ingegneria dell'IA

Chip Huyen
Grandes modelos de lenguaje: una guía práctica

Grandes modelos de lenguaje: una guía práctica

Jay Alammar, Maarten Grootendorst
Native Mobile Development

Native Mobile Development

Shaun Lewis, Mike Dunn

Publisher Resources

ISBN: 9798341639348