LLM 前置知识学习路线 / A Prerequisite Learning Path for Large Language Models
📅 创建时间:2026-04-28 🏷️ 标签:#LLM #学习路线 #入门指南 📚 前置知识:无
📋 文档目标
本文档为 Agent 工程化学习提供必需的 LLM 理论基础。通过本路线学习,你将:
- 理解神经网络的基本工作原理
- 掌握 LLM 的核心概念(Token、上下文、解码策略)
- 学会编写高效的 Prompt
- 了解 LLM 的技术演进和 Transformer 架构
- 理解训练的基本机制(Loss、Backprop、Epoch/Batch) ← 新增
- 掌握 Post-Training 的完整流程(SFT、RLHF、DPO) ← 新增
- 了解分布式训练和基础设施的核心概念 ← 新增
🗺️ 学习路径总览
┌─────────────────────────────────────────────────────────────────────────────┐
│ LLM 前置知识学习路线 │
└─────────────────────────────────────────────────────────────────────────────┘
第1阶段:基础铺垫(第1篇)
┌───────────────────┐
│ 神经网络基础 │ ← 理解 AI 的"计算单元",为 Transformer 原理做铺垫
│ neural-network │
└─────────┬─────────┘
↓
第2阶段:核心概念(第2-6篇)
┌───────────────────┐ ┌───────────────────┐ ┌───────────────────┐
│ Token 与上下文 │ │ 解码策略 │ │ 消息角色 │
│ token-context │ → │ decoding-strategy│ → │ messages-roles │
└───────────────────┘ └───────────────────┘ └─────────┬─────────┘
│
↓
┌───────────────────┐ ┌───────────────────┐ ┌───────────────────┐
│ Prompt 工程 │ ← │ 流式输出 │ ← │ │
│ prompt-eng │ ← │ streaming │ │ │
└───────────────────┘ └───────────────────┘ └───────────────────┘
第3阶段:深入原理(第7-10篇)
┌───────────────────┐ ┌───────────────────┐
│ LLM 进化史 │ → │ Transformer 原理 │
│ llm-evolution │ │ transformer │
└───────────────────┘ └───────────────────┘
↓
┌───────────────────┐ ┌───────────────────┐
│ Transformer训练 │ → │ Transformer推理 │
│ 计算详解 │ │ 计算详解 │
└───────────────────┘ └───────────────────┘
第4阶段:训练基础(第11篇) ← 新增
┌───────────────────┐
│ 训练基础扫盲 │ ← 从 LLM 直接上手的补充知识
│ training-primer │ 为理解 Post-Training 打下基础
└─────────┬─────────┘
↓
第5阶段:Post-Training(第12-13篇) ← 新增
┌───────────────────┐ ┌───────────────────┐
│ Post-Training │ → │ 训练基础设施 │
│ Pipeline │ │ Training-Infra │
│ SFT/RLHF/DPO │ │ 分布式训练/Infra │
└───────────────────┘ └───────────────────┘📚 各章节详情
第1阶段:基础铺垫
01 - 神经网络基础
文件名:01-neural-network-basics.md
核心内容:
- 神经元模型:输入、权重、偏置、加权求和
- 激活函数:ReLU、Sigmoid、Tanh、GELU
- 多层神经网络:隐藏层、全连接、MLP
- 矩阵运算基础
为什么重要:
Transformer 的核心是 Self-Attention 机制,理解神经网络是理解它的前提。
预计学习时间:30 分钟
第2阶段:核心概念
02 - Token 与上下文窗口
文件名:02-token-and-context.md
核心内容:
- 什么是 Token(词元)
- 中英文 Token 差异(中文 1 Token ≈ 1.5-2 汉字)
- Token 计算工具
- 上下文窗口与模型限制
- 记忆管理与 RAG 的必要性
为什么重要:
Token 是 LLM 计费和限速的基本单位,理解它才能做成本优化和上下文管理。
预计学习时间:25 分钟
03 - 解码策略
文件名:03-decoding-strategy.md
核心内容:
- Temperature:控制输出的随机性
- Top_p(核采样):累积概率阈值
- Max_tokens:生成长度限制
- Repetition_penalty:重复惩罚
为什么重要:
不同场景需要不同的解码策略——写代码要确定、多样性任务要随机。
预计学习时间:25 分钟
04 - 消息角色
文件名:04-messages-and-roles.md
核心内容:
- System:系统指令
- User:用户输入
- Assistant:模型回复
- 消息格式演变
- 多轮对话结构
为什么重要:
正确使用消息角色是构建 Agent 的基础,决定了模型的"人设"和行为。
预计学习时间:20 分钟
05 - 流式输出
文件名:05-streaming.md
核心内容:
- Server-Sent Events (SSE) 原理
- 流式 vs 非流式响应
- token 增量返回
- 前端实现流式输出
为什么重要:
用户体验的关键——看到文字"逐字出现"比等待"加载中..."好太多。
预计学习时间:20 分钟
06 - Prompt 工程基础
文件名:06-prompt-engineering.md
核心内容:
- Zero-shot:直接提问
- Few-shot:提供示例
- Chain-of-Thought (CoT):思维链
- 结构化输出:XML/JSON 标签
- 最佳实践与常见陷阱
为什么重要:
Prompt 是人类与 LLM 交互的"界面",好 Prompt = 好结果。
预计学习时间:30 分钟
第3阶段:深入原理
07 - LLM 进化史
文件名:07-llm-evolution.md
核心内容:
- 词向量:Word2Vec、分布式假设
- RNN/LSTM:序列处理与梯度消失
- Attention 机制:2015
- Transformer:2017 革命
- GPT 系列演进
为什么重要:
理解"我们从哪里来",才能更好地理解"我们要去哪里"。
预计学习时间:35 分钟
08 - Transformer 核心原理
文件名:08-transformer-deep-dive.md
核心内容:
- 自注意力机制(Self-Attention):Q/K/V
- 多头注意力(Multi-Head Attention)
- 位置编码(Positional Encoding)
- 前馈网络(FFN)
- 残差连接与层归一化
- 完整数据流
为什么重要:
Transformer 是 GPT、Claude、Gemini 等所有现代 LLM 的基石。
预计学习时间:45 分钟
第4阶段:训练基础(新增)
11 - 训练基础扫盲
文件名:11-training-primer.md
核心内容:
- 训练循环四步曲:Forward → Loss → Backward → Update
- Cross-Entropy Loss 直观理解
- 反向传播的链式法则本质
- 优化器:Adam / AdamW / SGD 对比
- Learning Rate Schedule:Warmup + Cosine Decay
- Epoch / Batch / Step 的关系
- Fine-tune vs Pretrain 的本质区别
- PEFT 概念预告:LoRA / QLoRA
为什么重要:
如果你从 LLM 直接入手,没有系统学过传统 ML/DL,这篇是你的"训练基础补完计划"。理解训练循环是理解 SFT 和 RLHF 的前提。
预计学习时间:40 分钟
第5阶段:Post-Training(新增)
12 - Post-Training Pipeline
文件名:12-post-training-pipeline.md
核心内容:
- Pretrained Model vs Instruct Model 的本质差异
- SFT(监督微调):数据格式、训练方式、局限性
- RLHF(人类反馈强化学习):三阶段流程(RM → PPO → KL)
- DPO(直接偏好优化):RLHF 的简化替代方案
- Alignment 家族:Constitutional AI、RLAIF 对比
- InstructGPT 完整训练流程回顾
为什么重要:
理解 ChatGPT 为什么比 Base Model 更好用——这中间发生了什么。这是业界最核心的模型对齐技术。
预计学习时间:50 分钟
13 - 训练基础设施
文件名:13-training-infrastructure.md
核心内容:
- 为什么单卡训练不了大模型(显存/计算/通信瓶颈)
- Data Parallelism:每卡完整模型,处理不同数据
- Tensor Parallelism:层内横向切分
- Pipeline Parallelism:层间切分
- ZeRO 显存优化三阶段(ZeRO-1/2/3)
- 常见并行组合:TP + PP + DP + ZeRO
- GPU 集群拓扑:NVLink、NVSwitch、InfiniBand
- 分布式训练框架:DeepSpeed、Megatron-LM、PyTorch FSDP
- 完整 Post-Training Pipeline 资源消耗一览
为什么重要:
当别人聊"我们用 8 卡 A100 训的 70B,ZeRO-3 加 TP"时,你不再是一脸问号。理解 Infra 才能真正理解大模型训练的工程挑战。
预计学习时间:50 分钟
📊 学习统计
| 指标 | 数值 |
|---|---|
| 文档总数 | 13 篇(原 8 篇 + 新增 5 篇) |
| 总预计学习时间 | 6.5 小时(原 3.5 小时) |
| 测试题总数 | 65 道(原 40 道) |
| 代码示例 | 多个数值计算示例 |
🎯 学习目标检验
完成本路线后,你应该能够:
- [ ] 解释神经元如何进行计算
- [ ] 计算中英文句子的 Token 数量
- [ ] 根据场景选择合适的 Temperature 值
- [ ] 构建多轮对话的消息结构
- [ ] 编写 Few-shot Prompt 提供示例
- [ ] 解释 Self-Attention 的工作原理
- [ ] 描述 Transformer 的整体架构
- [ ] 描述训练循环的四个步骤(Forward → Loss → Backward → Update) ← 新增
- [ ] 解释 Fine-tune 为什么比 Pretrain 便宜得多 ← 新增
- [ ] 描述 SFT、RLHF、DPO 三种 Post-Training 方法的核心差异 ← 新增
- [ ] 解释 Data Parallel、Tensor Parallel、Pipeline Parallel 的适用场景 ← 新增
- [ ] 理解 ZeRO 的三个阶段及显存优化原理 ← 新增
🚀 下一步
准备好开始了吗?按顺序学习:
第一步:阅读 01 - 神经网络基础
如果你从 LLM 直接上手,之前没有 ML/DL 基础,建议从 11 - 训练基础扫盲 开始补充。
相关笔记
- [[01 - 神经网络基础]] - AI 计算单元的入门
- [[02 - Token 与上下文窗口]] - LLM 计费与记忆的基石
- [[08 - Transformer 原理]] - 现代 LLM 的核心架构
- [[11 - 训练基础扫盲]] - 训练循环与微调本质 ← 新增
- [[12 - Post-Training Pipeline]] - SFT/RLHF/DPO 对齐流程 ← 新增
- [[13 - 训练基础设施]] - 分布式训练与 Infra 组件 ← 新增
学习状态:🟡 开始学习