IA generativa pratica con trasformatori e modelli di diffusione
by Omar Sanseviero, Pedro Cuenca, Apolinário Passos, Jonathan Whitaker
Appendice B. Requisiti di memoria di LLM
I modelli sono disponibili in tutte le dimensioni! Llama 3.1, ad esempio, è stato rilasciato con le varianti 8B, 70B e 405B. Per caricare e utilizzare un LLM, è necessaria una quantità di memoria sufficiente per memorizzare il modello. Il numero di parametri e la loro precisione, tra gli altri fattori, influenzano i requisiti di memoria di un LLM.
Cosa puoi fare se non hai abbastanza memoria? Prova queste opzioni:
-
Riduci la precisione del modello che stai utilizzando. Invece di usare
float16, puoi usareint8. -
Usa un modello più piccolo. Esistono molti modelli piccoli di alta qualità.
-
Scaricare le parti del modello che non si utilizzano. Questo può essere fatto con CPU RAM offloading, una tecnica comune per ridurre i requisiti di memoria di un modello al costo di una minore velocità di inferenza. Cosa succede se la memoria non è sufficiente? Possiamo memorizzare le parti rimanenti del modello sul disco e caricarle quando necessario. Fortunatamente, la libreria di accelerazione si occupa di questo tramite
device_map="auto", che scarica automaticamente le parti del modello quando necessario.
Requisiti di memoria per l'inferenza
puoi stimare approssimativamente i requisiti di memoria come segue:
I byte per parametro dipendono dalla precisione utilizzata. Senza entrare troppo nel dettaglio, la Tabella B-1 mostra la memoria necessaria per caricare i modelli ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access