9.1 Model optimization9.1.1 Model pruning9.1.2 Model distillation9.2 Sharding for memory optimization9.3 Inference optimization9.4 GPU-level optimization: Tiling, threads, and memory9.4.1 FlashAttention: Tiled attention at scale9.5 Extending long-context windows9.5.1 Rotary embeddings and refinements9.5.2 Refinements: YaRN, positional interpolation, and iRoPE