8章制約への対応
単にLLMを動作させるのではなく、実運用環境にデプロイするには、独特の困難が伴う。LLMは驚くべき機能を提供するが、かなりの計算資源を必要とするし、遅延も考慮しなければならない。また、規模が大きくなるとすぐにコストが問題になる。1つのクエリに対してだけ動作すればいい概念実証と、数千のユーザにサービスを提供する実運用システムとの間には大きなギャップがあるが、しばしば見落とされる。
本章では、LLMを実運用システムにデプロイする際に直面する困難に対処するパターンを紹介する。例えば、ハードウェアの制約、予算の制約、厳しい遅延要件などだ。本章で紹介するパターンは、最適なLLMデプロイを実現できる実証済みの戦略だ。
本章では、実運用環境でのさまざまな制約に対処する5つのパターンについて説明する。小規模言語モデル[パターン24]では、モデルの蒸留と量子化によって計算オーバーヘッドを削減する方法を示す。プロンプトキャッシュ[パターン25]では、冗長性を排除し、コストと遅延の両方を削減する方法を示す。推論最適化[パターン26]では、連続バッチ処理や投機的デコードなどの高度なテクニックを取り上げ、ハードウェアの利用率を最大化する。デグレデーションテスト[パターン27]では、LLMベースのアプリケーションの性能が良好であることを検証するための評価指標を示し、一部の点で性能が不足している場合に取るべき対処法について説明する。最後の長期記憶[パターン28]は、セッションにまたがってユーザの履歴を保持することで、ユーザのリクエストを記憶してパーソナライゼーションを行う方法を示す。
本章で示すパターンは全体として、資源集約的な作業であったLLMデプロイを、効率的でスケーラブルな実運用システムに変えるための、包括的なツールキットを提供する。 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access