3.1 人間のフィードバックによる強化学習(RLHF)3.1.1 RLHFモデルを構築するプロセス3.1.2 LLMの正直さを保つには3.1.3 一部の偏った振る舞いを避けるには3.1.4 RLHFは費用対効果が非常に高い3.1.5 アラインメント税に注意3.2 インストラクトモデルからチャットモデルへ3.2.1 インストラクトモデル3.2.2 チャットモデル3.3 APIの変化3.3.1 チャット補完APIさあ、やってみよう3.3.2 チャットと補完の比較3.3.3 チャットを超えてツールへ3.4 プロンプトエンジニアリングは脚本作成さあ、やってみよう3.5 まとめ