Skip to content
Gains Summary
Main Navigation 首页 / Home
C++ 编程 / C++ Programming
系统与高性能 / Systems & Performance
Web 开发 / Web Development
人工智能 / Artificial Intelligence
工业软件 / Industrial Software
其他内容 / Other Topics
C++ 编程 / C++系统与性能 / SystemsWeb 开发 / Web人工智能 / AI工业软件 / Industrial

外观

Sidebar Navigation

← 人工智能 / Artificial Intelligence

大语言模型 / Large Language Models

1. LLM 前置知识学习路线 / A Prerequisite Learning Path for Large Language Models

2. 神经网络基础 - 从零理解 AI 的"计算单元" / Neural Network Fundamentals from Artificial Neurons

3. Token 与上下文窗口 - LLM 的计费与记忆单位 / Tokens and Context Windows as the Units of LLM Cost and Memory

4. 解码策略 - 控制 LLM 输出的艺术 / Decoding Strategies for Controlling LLM Output

5. 消息角色 - 构建 Agent 对话的基础 / Message Roles as the Foundation of Agent Conversations

6. 流式输出 - 实时交互的体验优化 / Streaming Output for Responsive Interaction

7. Prompt 工程基础 - 与 LLM 高效对话的技巧 / Prompt Engineering Fundamentals for Effective LLM Interaction

8. LLM 进化史 - 从词向量到 Transformer / The Evolution of LLMs from Word Embeddings to Transformers

9. Transformer 手动计算:从 Attention 到 Encoder-Decoder 完整数据流

10. Transformer 核心原理 - 现代 LLM 的基石 / Transformer Fundamentals Behind Modern LLMs

11. Decoder-Only LLM 深度解析:为什么扔掉 Encoder,以及 KV Cache 如何工作

12. 训练 vs 推理:同一个 Transformer,两条完全不同的执行路径

13. Transformer 训练阶段计算详解 - 手算每一行矩阵 / Transformer Training Computation Matrix by Matrix

14. Transformer 推理阶段详解 — 模型如何"思考"并生成回答 / Transformer Inference and Autoregressive Generation

15. 训练基础扫盲 - 理解 Fine-tune 在做什么 / A Training Primer for Understanding Fine-Tuning

16. LLM 预训练全景:数据管道、Scaling Laws 与训练稳定性

17. 训练基础设施 - 从单卡到千卡集群 / Training Infrastructure from One GPU to Thousand-GPU Clusters

18. Post-Training Pipeline - 从 Base Model 到可用助手 / The Post-Training Pipeline from Base Model to Assistant

19. SFT 深度解析:从 Base Model 到指令跟随——后训练第一步 / SFT Deep Dive: Teaching Base Models to Follow Instructions

20. RLHF 深度解析:从 Reward Model 到 PPO 的完整对齐流程

21. DPO 与对齐方法:从 RLHF 复杂度到直接偏好优化

22. 研究视角:DL/RL 理论到 LLM 训练的完整映射

本页目录

LLM 前置知识学习路线 / A Prerequisite Learning Path for Large Language Models ​

📅 创建时间:2026-04-28 🏷️ 标签:#LLM #学习路线 #入门指南 📚 前置知识:无


📋 文档目标 ​

本文档为 Agent 工程化学习提供必需的 LLM 理论基础。通过本路线学习,你将:

  • 理解神经网络的基本工作原理
  • 掌握 LLM 的核心概念(Token、上下文、解码策略)
  • 学会编写高效的 Prompt
  • 了解 LLM 的技术演进和 Transformer 架构
  • 理解训练的基本机制(Loss、Backprop、Epoch/Batch) ← 新增
  • 掌握 Post-Training 的完整流程(SFT、RLHF、DPO) ← 新增
  • 了解分布式训练和基础设施的核心概念 ← 新增

🗺️ 学习路径总览 ​

┌─────────────────────────────────────────────────────────────────────────────┐
│                        LLM 前置知识学习路线                                    │
└─────────────────────────────────────────────────────────────────────────────┘

第1阶段:基础铺垫(第1篇)
┌───────────────────┐
│  神经网络基础      │ ← 理解 AI 的"计算单元",为 Transformer 原理做铺垫
│  neural-network   │
└─────────┬─────────┘
          ↓
第2阶段:核心概念(第2-6篇)
┌───────────────────┐    ┌───────────────────┐    ┌───────────────────┐
│  Token 与上下文    │    │   解码策略         │    │   消息角色         │
│  token-context    │ →  │  decoding-strategy│ →  │  messages-roles   │
└───────────────────┘    └───────────────────┘    └─────────┬─────────┘
                                                            │
                                                            ↓
┌───────────────────┐    ┌───────────────────┐    ┌───────────────────┐
│   Prompt 工程      │ ←  │   流式输出         │ ←  │                   │
│  prompt-eng       │ ←  │  streaming        │    │                   │
└───────────────────┘    └───────────────────┘    └───────────────────┘

第3阶段:深入原理(第7-10篇)
┌───────────────────┐    ┌───────────────────┐
│   LLM 进化史       │ →  │   Transformer 原理 │
│  llm-evolution    │    │  transformer      │
└───────────────────┘    └───────────────────┘
          ↓
┌───────────────────┐    ┌───────────────────┐
│ Transformer训练    │ →  │  Transformer推理   │
│ 计算详解          │    │  计算详解         │
└───────────────────┘    └───────────────────┘

第4阶段:训练基础(第11篇)  ← 新增
┌───────────────────┐
│  训练基础扫盲      │ ← 从 LLM 直接上手的补充知识
│  training-primer  │   为理解 Post-Training 打下基础
└─────────┬─────────┘
          ↓
第5阶段:Post-Training(第12-13篇)  ← 新增
┌───────────────────┐    ┌───────────────────┐
│ Post-Training     │ →  │ 训练基础设施       │
│ Pipeline          │    │ Training-Infra    │
│ SFT/RLHF/DPO     │    │ 分布式训练/Infra  │
└───────────────────┘    └───────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45

📚 各章节详情 ​

第1阶段:基础铺垫 ​

01 - 神经网络基础 ​

文件名:01-neural-network-basics.md

核心内容:

  • 神经元模型:输入、权重、偏置、加权求和
  • 激活函数:ReLU、Sigmoid、Tanh、GELU
  • 多层神经网络:隐藏层、全连接、MLP
  • 矩阵运算基础

为什么重要:

Transformer 的核心是 Self-Attention 机制,理解神经网络是理解它的前提。

预计学习时间:30 分钟


第2阶段:核心概念 ​

02 - Token 与上下文窗口 ​

文件名:02-token-and-context.md

核心内容:

  • 什么是 Token(词元)
  • 中英文 Token 差异(中文 1 Token ≈ 1.5-2 汉字)
  • Token 计算工具
  • 上下文窗口与模型限制
  • 记忆管理与 RAG 的必要性

为什么重要:

Token 是 LLM 计费和限速的基本单位,理解它才能做成本优化和上下文管理。

预计学习时间:25 分钟


03 - 解码策略 ​

文件名:03-decoding-strategy.md

核心内容:

  • Temperature:控制输出的随机性
  • Top_p(核采样):累积概率阈值
  • Max_tokens:生成长度限制
  • Repetition_penalty:重复惩罚

为什么重要:

不同场景需要不同的解码策略——写代码要确定、多样性任务要随机。

预计学习时间:25 分钟


04 - 消息角色 ​

文件名:04-messages-and-roles.md

核心内容:

  • System:系统指令
  • User:用户输入
  • Assistant:模型回复
  • 消息格式演变
  • 多轮对话结构

为什么重要:

正确使用消息角色是构建 Agent 的基础,决定了模型的"人设"和行为。

预计学习时间:20 分钟


05 - 流式输出 ​

文件名:05-streaming.md

核心内容:

  • Server-Sent Events (SSE) 原理
  • 流式 vs 非流式响应
  • token 增量返回
  • 前端实现流式输出

为什么重要:

用户体验的关键——看到文字"逐字出现"比等待"加载中..."好太多。

预计学习时间:20 分钟


06 - Prompt 工程基础 ​

文件名:06-prompt-engineering.md

核心内容:

  • Zero-shot:直接提问
  • Few-shot:提供示例
  • Chain-of-Thought (CoT):思维链
  • 结构化输出:XML/JSON 标签
  • 最佳实践与常见陷阱

为什么重要:

Prompt 是人类与 LLM 交互的"界面",好 Prompt = 好结果。

预计学习时间:30 分钟


第3阶段:深入原理 ​

07 - LLM 进化史 ​

文件名:07-llm-evolution.md

核心内容:

  • 词向量:Word2Vec、分布式假设
  • RNN/LSTM:序列处理与梯度消失
  • Attention 机制:2015
  • Transformer:2017 革命
  • GPT 系列演进

为什么重要:

理解"我们从哪里来",才能更好地理解"我们要去哪里"。

预计学习时间:35 分钟


08 - Transformer 核心原理 ​

文件名:08-transformer-deep-dive.md

核心内容:

  • 自注意力机制(Self-Attention):Q/K/V
  • 多头注意力(Multi-Head Attention)
  • 位置编码(Positional Encoding)
  • 前馈网络(FFN)
  • 残差连接与层归一化
  • 完整数据流

为什么重要:

Transformer 是 GPT、Claude、Gemini 等所有现代 LLM 的基石。

预计学习时间:45 分钟


第4阶段:训练基础(新增) ​

11 - 训练基础扫盲 ​

文件名:11-training-primer.md

核心内容:

  • 训练循环四步曲:Forward → Loss → Backward → Update
  • Cross-Entropy Loss 直观理解
  • 反向传播的链式法则本质
  • 优化器:Adam / AdamW / SGD 对比
  • Learning Rate Schedule:Warmup + Cosine Decay
  • Epoch / Batch / Step 的关系
  • Fine-tune vs Pretrain 的本质区别
  • PEFT 概念预告:LoRA / QLoRA

为什么重要:

如果你从 LLM 直接入手,没有系统学过传统 ML/DL,这篇是你的"训练基础补完计划"。理解训练循环是理解 SFT 和 RLHF 的前提。

预计学习时间:40 分钟


第5阶段:Post-Training(新增) ​

12 - Post-Training Pipeline ​

文件名:12-post-training-pipeline.md

核心内容:

  • Pretrained Model vs Instruct Model 的本质差异
  • SFT(监督微调):数据格式、训练方式、局限性
  • RLHF(人类反馈强化学习):三阶段流程(RM → PPO → KL)
  • DPO(直接偏好优化):RLHF 的简化替代方案
  • Alignment 家族:Constitutional AI、RLAIF 对比
  • InstructGPT 完整训练流程回顾

为什么重要:

理解 ChatGPT 为什么比 Base Model 更好用——这中间发生了什么。这是业界最核心的模型对齐技术。

预计学习时间:50 分钟


13 - 训练基础设施 ​

文件名:13-training-infrastructure.md

核心内容:

  • 为什么单卡训练不了大模型(显存/计算/通信瓶颈)
  • Data Parallelism:每卡完整模型,处理不同数据
  • Tensor Parallelism:层内横向切分
  • Pipeline Parallelism:层间切分
  • ZeRO 显存优化三阶段(ZeRO-1/2/3)
  • 常见并行组合:TP + PP + DP + ZeRO
  • GPU 集群拓扑:NVLink、NVSwitch、InfiniBand
  • 分布式训练框架:DeepSpeed、Megatron-LM、PyTorch FSDP
  • 完整 Post-Training Pipeline 资源消耗一览

为什么重要:

当别人聊"我们用 8 卡 A100 训的 70B,ZeRO-3 加 TP"时,你不再是一脸问号。理解 Infra 才能真正理解大模型训练的工程挑战。

预计学习时间:50 分钟


📊 学习统计 ​

指标数值
文档总数13 篇(原 8 篇 + 新增 5 篇)
总预计学习时间6.5 小时(原 3.5 小时)
测试题总数65 道(原 40 道)
代码示例多个数值计算示例

🎯 学习目标检验 ​

完成本路线后,你应该能够:

  • [ ] 解释神经元如何进行计算
  • [ ] 计算中英文句子的 Token 数量
  • [ ] 根据场景选择合适的 Temperature 值
  • [ ] 构建多轮对话的消息结构
  • [ ] 编写 Few-shot Prompt 提供示例
  • [ ] 解释 Self-Attention 的工作原理
  • [ ] 描述 Transformer 的整体架构
  • [ ] 描述训练循环的四个步骤(Forward → Loss → Backward → Update) ← 新增
  • [ ] 解释 Fine-tune 为什么比 Pretrain 便宜得多 ← 新增
  • [ ] 描述 SFT、RLHF、DPO 三种 Post-Training 方法的核心差异 ← 新增
  • [ ] 解释 Data Parallel、Tensor Parallel、Pipeline Parallel 的适用场景 ← 新增
  • [ ] 理解 ZeRO 的三个阶段及显存优化原理 ← 新增

🚀 下一步 ​

准备好开始了吗?按顺序学习:

第一步:阅读 01 - 神经网络基础

如果你从 LLM 直接上手,之前没有 ML/DL 基础,建议从 11 - 训练基础扫盲 开始补充。


相关笔记 ​

  • [[01 - 神经网络基础]] - AI 计算单元的入门
  • [[02 - Token 与上下文窗口]] - LLM 计费与记忆的基石
  • [[08 - Transformer 原理]] - 现代 LLM 的核心架构
  • [[11 - 训练基础扫盲]] - 训练循环与微调本质 ← 新增
  • [[12 - Post-Training Pipeline]] - SFT/RLHF/DPO 对齐流程 ← 新增
  • [[13 - 训练基础设施]] - 分布式训练与 Infra 组件 ← 新增

学习状态:🟡 开始学习

最后更新于:

Pager
上一篇← 人工智能 / Artificial Intelligence
下一篇2. 神经网络基础 - 从零理解 AI 的"计算单元" / Neural Network Fundamentals from Artificial Neurons

持续记录,持续成长

Copyright © Tidenflow