Part 1: What You Should Know About Large Language ModelsInput and Output TokensFrom Language Modeling to Powering AgentsThe TinyAgentTraining a Large Language ModelThe Transformer ArchitecturePart 2: A Deeper Dive Into Large Language ModelsHow Self-Attention WorksKV-Caching RevisitedMore Efficient Self-AttentionMixture of ExpertsSummary