September 2025
Beginner to intermediate
400 pages
6h 4m
Japanese
これまでの数章では、特定のタスクを解くためにLLMを適応・活用するさまざまな手法について学んできました。本章では、LLMを実際に活用する際に欠かせない効率的な推論(Inference)方法に焦点を当てていきます※1。LLMは非常に大規模であるため、計算量、メモリ容量、消費電力などにより、デプロイと推論処理が難しいという課題があります。これは特に、スマートフォンのようなエッジデバイス上では顕著です。
※1 訳注:「推論」とは、一般的に学習して重みが固定されたモデルを利用して出力を得るための計算処理を指します。
この章では、推論の最適化に注目し、まずLLMの推論時間に影響する要因を取り上げます。その後、キャッシュ、知識蒸留、早期終了、量子化、並列デコーディング、投機的デコーディングなど、さまざまな最適化手法について解説していきます。
LLMの推論に影響を与えるボトルネックには、どのようなものがあるでしょうか? ご存じの通り、LLMはモデルのサイズが非常に大きいため、多くの計算資源とメモリ容量を必要とします。それらに加えて、以下のような課題もあります。
Read now
Unlock full access