4.1 予備知識 4.2 意味を表現する 4.3 Transformerのアーキテクチャ 4.3.1 自己注意 4.3.2 位置符号化(Positional Encoding) 4.3.3 フィードフォワード・ネットワーク 4.3.4 レイヤー正規化 4.4 損失関数(Loss Function) 4.5 内在的モデル評価 4.6 Transformerの中核となるアーキテクチャ 4.6.1 エンコーダのみのアーキテクチャ 4.6.2 エンコーダ・デコーダのアーキテクチャ 4.6.3 デコーダのみのアーキテクチャ 4.6.4 混合エキスパート(MoE)モデル 4.7 学習目的(Learning Objective) 4.7.1 完全言語モデリング 4.7.2 接頭辞言語モデリング 4.7.3 マスク言語モデリング 4.7.4 どの学習目的が優れているのか? 4.8 事前学習モデル 4.9 まとめ