01数学与学习原理FOUNDATIONS→先理解模型为何能学习01.1数学底座01.1.1线性代数↗01.1.2概率统计↗01.1.3信息论↗ 01.2学习机制01.2.1微积分与反向传播↗01.2.2优化算法↗01.2.3表示与嵌入↗
02模型核心架构ARCHITECTURE→再理解信息如何流动02.1Transformer 主干02.1.1自注意力↗02.1.2位置编码↗02.1.3Transformer↗ 02.2注意力机制变体02.2.1分组查询注意力↗02.2.2滑动窗口与稀疏注意力↗02.2.3线性注意力↗02.2.4FlashAttention↗02.2.5多头潜在注意力↗ 02.3前沿架构路线02.3.1混合专家 MoE↗02.3.2状态空间模型↗
03预训练工程PRE-TRAINING→把数据转化为基座能力03.1数据入口03.1.1数据工程↗03.1.2分词与词表↗ 03.2大规模学习03.2.1自监督预训练↗03.2.2Scaling Laws↗03.2.3分布式训练↗
04后训练与对齐POST-TRAINING→让基座模型可用、可控04.1任务适配04.1.1监督微调 SFT↗04.1.2LoRA / QLoRA↗ 04.2偏好与推理04.2.1偏好对齐↗04.2.2推理强化学习↗
05能力与应用系统CAPABILITIES把模型变成真实系统05.1前沿能力05.1.1多模态↗05.1.2推理模型↗05.1.3智能体与工具↗ 05.2生成与世界05.2.1扩散生成↗05.2.2世界模型与具身 AI↗ 05.3交付与增强05.3.1评测、安全与红队↗05.3.2推理与压缩↗05.3.3RAG 与知识系统↗