September 2025
Beginner to intermediate
400 pages
6h 4m
Japanese
LLMの採用をためらう理由としてよく挙げられるのが、ハルシネーションの発生、論理的推論能力の限界、偏見や安全性に関する懸念です。この章では、そうした限界について説明し、それらを軽減するためのさまざまな手法を紹介します。まずは、アライメント(Alignment Training)の概念を説明し、モデルが望ましい出力を生成するように導く方法について見ていきます。
私たちは日々、言語モデルにおけるアライメントの問題について耳にしますが、実際にはどういう意味なのでしょうか。理想を言えば、私たちは言語モデルを完全に理解し、制御し、指示に追従させたいと考えています。しかし、現時点の言語モデルはその理想からはまだ遠い状態です。
そのため、アライメントの目標は、言語モデルをより制御しやすく、指示に従いやすくすることにあります。AnthropicのAskellら※1は、アライメントされたAIを「Helpful, Honest, and Harmless.(役に立ち、正直で、無害)」なAIと定義しています。彼らは、いわゆるこの「3つのH」を次のように説明しています。
役に立つ(Helpful)
ユーザーの要求が有害でない限り、AIは可能な限り効果的にその要求を満たそうとし、必要に応じてフォローアップの質問を行う。
正直である(Honest)
AIは正確な情報を提供し、適切にキャリブレーションされ、確信度の推定にも配慮された出力を行うべきである。また、自らの限界について理解していることも求められる。
無害である(Harmless) ...
Read now
Unlock full access