Skip to content
Gains Summary
Main Navigation 首页 / Home
C++ 编程 / C++ Programming
系统与高性能 / Systems & Performance
Web 开发 / Web Development
人工智能 / Artificial Intelligence
工业软件 / Industrial Software
其他内容 / Other Topics
C++ 编程 / C++系统与性能 / SystemsWeb 开发 / Web人工智能 / AI工业软件 / Industrial

外观

Sidebar Navigation

← 系统与高性能 / Systems & Performance

计算系统 / Computing Systems

1. 计算系统:计算机如何执行与加速程序

2. 从 C++ 源码到 CPU 执行

3. CPU 流水线、乱序执行与分支预测

4. Cache、一致性、伪共享与 NUMA

5. GPU、SM、Warp 与显存

6. 计算执行模型:程序怎样映射到机器

7. SIMD 与编译器向量化

8. C++ 多线程与 OpenMP

9. CUDA 平台与编程模型

10. CUDA Kernel、内存与性能

11. CPU-GPU 异构流水线

12. MPI 与分布式并行

13. 并行算法模式

14. 性能模型与工具

15. 递进学习项目:从单线程到集群

历史完整正文 / Original Deep Dives

1. 历史完整正文:统一前文章逐篇保留

原体系结构与硬件 / Original Architecture

1. 硬件编程与高性能计算:一张可走通的学习地图 / A Practical Learning Map for Hardware Programming and HPC

2. 计算机体系结构:CPU、内存与 GPU / Computer Architecture: CPUs, Memory, and GPUs

3. 计算机架构基础——为什么 GPU 比 CPU 更快 / Computer Architecture Fundamentals: Why GPUs Outperform CPUs

4. 并行计算理论——30 天训练能优化到多快? / Parallel Computing Theory and the Limits of Training Acceleration

5. GPU 架构深入——上万个核心如何分工协作 / GPU Architecture and Massive Parallel Execution

6. CUDA 编程模型——把矩阵乘法映射到 GPU / The CUDA Programming Model for Mapping Matrix Multiplication to GPUs

7. CUDA 内存管理——百亿参数如何装进显存 / CUDA Memory Management for Large Models

8. CUDA 性能优化——从 30 天缩短到 10 天 / CUDA Performance Optimization

9. CPU 并行编程——OpenMP 与 SIMD 向量化 / CPU Parallel Programming with OpenMP and SIMD

10. HPC 集群与 MPI——多节点分布式训练 / HPC Clusters and MPI for Distributed Training

11. 异构计算——CPU 与 GPU 如何协同工作 / Heterogeneous Computing with CPUs and GPUs

12. 深度学习训练优化实战——从 30 天到 3 天 / Deep Learning Training Optimization from Thirty Days to Three

13. 性能分析工具——找到真正的瓶颈 / Performance Analysis Tools for Finding Real Bottlenecks

14. NPU 全景——昇腾/寒武纪/TPU/苹果生态 / The NPU Landscape: Ascend, Cambricon, TPU, and Apple

15. 未来趋势——2030 年的计算机会是什么形态 / Future Computing Trends Toward 2030

16. 硬件与高性能计算:从“程序为什么慢”开始 / Hardware and HPC Starting from Why Programs Are Slow

原并行计算 / Original Parallel Computing

1. 并行计算:从 SIMD 到 MPI / Parallel Computing from SIMD to MPI

2. 并行计算全景:从晶体管、CPU、GPU 到计算集群 / Parallel Computing from Transistors, CPUs, and GPUs to Clusters

3. 并行计算基础:任务分解、加速比与可扩展性 / Parallel Computing Fundamentals: Decomposition, Speedup, and Scalability

4. 处理器体系结构:从指令流水线到多核芯片 / Processor Architecture from Instruction Pipelines to Multicore Chips

5. CPU 并行:多线程、SIMD、Cache 一致性与 NUMA / CPU Parallelism with Threads, SIMD, Cache Coherence, and NUMA

6. 内存层次:Cache、带宽、局部性与一致性 / Memory Hierarchies, Bandwidth, Locality, and Coherence

7. GPU 体系结构:SIMT、Warp、SM 与吞吐优先设计 / GPU Architecture with SIMT, Warps, and Streaming Multiprocessors

8. CUDA 编程模型:Thread、Block、Grid 与内存协作 / CUDA Threads, Blocks, Grids, and Cooperative Memory Access

9. 并行算法模式:Map、Reduce、Scan、Stencil 与任务图 / Parallel Patterns: Map, Reduce, Scan, Stencil, and Task Graphs

10. 异构计算:CPU、GPU、NPU 如何协同工作 / Heterogeneous Computing with CPUs, GPUs, and NPUs

11. 分布式并行:MPI、集合通信、RDMA 与多机多卡 / Distributed Parallelism with MPI, Collective Communication, and RDMA

12. 性能工程:测量、Roofline、瓶颈定位与优化闭环 / Performance Engineering with Measurement, Roofline, and Bottleneck Analysis

13. 并行计算实战:AI、CAE、图像与科学计算 / Parallel Computing for AI, CAE, Imaging, and Scientific Computing

14. 并行计算实践路线:从单核优化到多机多卡 / A Parallel Computing Project Path from Single-Core to Multi-Node GPUs

本页目录

未来趋势——2030 年的计算机会是什么形态 / Future Computing Trends Toward 2030 ​

📅 创建时间:2026-06-02 🏷️ 标签:#未来趋势 #DPU #光计算 #存算一体 #量子计算 #Chiplet 📚 前置知识:[[11-performance-analysis-tools]](性能分析) [[12-npu-landscape]](NPU 全景) 📚 相关知识:[[/04-ai/01-llm-engineering/11-training-primer]](训练前沿) [[/04-ai/01-llm-engineering/13-training-infrastructure]](训练基础设施)


先抓住直觉 ​

判断新硬件,不必先相信宏大叙事。把它放回三个老问题:它减少了什么计算、缩短了哪段数据移动、降低了多少通信成本?然后再看可编程性、制造成本和软件生态。

  • 必须理解:Chiplet、存算一体、光计算分别试图缓解什么瓶颈。
  • 用到再查:厂商路线图、产品参数和时间预测。
  • 保持边界感:研究原型、可量产产品和成熟生态是三个不同阶段。

场景:2030 年的 AI 训练,你还在用 GPU 吗? ​

┌─────────────────────────────────────────────────────────────┐
│                                                             │
│  回望历史:                                               │
│                                                             │
│  2012: AlexNet 用 GTX 580(游戏显卡)训练                 │
│  2017: Transformer 用 TPU 训练                            │
│  2023: GPT-4 用 A100/H100 集群训练                        │
│  2026: DeepSeek 用 H800(出口管制版)训练                 │
│                                                             │
│  展望未来 2030:                                         │
│  - GPU 还会是主流吗?                                      │
│  - DPU、光计算、存算一体,谁会崛起?                     │
│  - 量子计算真的能加速 AI 吗?                              │
│                                                             │
│  本章不提供标准答案,而是开阔你的视野。                   │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17

第1节:DPU——数据处理单元的崛起 ​

什么是 DPU? ​

┌─────────────────────────────────────────────────────────────┐
│                    DPU 是什么?                             │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  DPU = Data Processing Unit                              │
│  第三类计算芯片(CPU + GPU + DPU)                       │
│                                                             │
│  CPU:通用计算(控制流)                                  │
│  GPU:并行计算(数据流)                                  │
│  DPU:数据处理(IO、网络、存储)                        │
│                                                             │
│  定位:卸载 CPU 的 IO 负担                                │
│  - 网络协议处理(RDMA、TCP/IP)                         │
│  - 存储虚拟化                                            │
│  - 安全加密/解密                                         │
│  - 数据压缩                                              │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18

DPU 在 AI 训练中的作用 ​

┌─────────────────────────────────────────────────────────────┐
│                    DPU + GPU 协同工作                       │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  传统架构:                                              │
│  CPU ──处理网络协议──→ GPU(等待数据)               │
│                                                             │
│  DPU 架构:                                              │
│  CPU ──控制命令──→ DPU ──预处理──→ GPU(直接算)   │
│                                                             │
│  DPU 负责:                                              │
│  - RDMA 数据直接传输给 GPU(绕过 CPU)                   │
│  - AllReduce 通信加速                                    │
│  - 计算集群的网络虚拟化                                   │
│                                                             │
│  效果:                                                   │
│  - CPU 释放出来做调度                                    │
│  - GPU 不用等待 IO,专注计算                             │
│  - 网络带宽利用率提升                                    │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21

主要 DPU 产品 ​

┌─────────────────────────────────────────────────────────────┐
│                    主要 DPU 产品                           │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  NVIDIA BlueField-3:                                    │
│  - ARM 核心 × 16                                        │
│  - 400 Gb/s 网络带宽                                     │
│  - 卸载 RDMA、加密、存储虚拟化                           │
│  - DOCA 编程框架(类 CUDA)                             │
│                                                             │
│  Intel IPU:                                             │
│  - FPGA + ARM 混合架构                                  │
│  - 用于数据中心网络卸载                                  │
│                                                             │
│  趋势:DPU 会成为数据中心的标配                          │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17

第2节:Chiplet——摩尔定律的延续 ​

为什么需要 Chiplet? ​

┌─────────────────────────────────────────────────────────────┐
│                    摩尔定律的困境                           │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  问题:                                                   │
│  - 2D 芯片面积有光刻机掩模尺寸限制(~800mm²)        │
│  - 超过这个尺寸,良率急剧下降                           │
│  - H100 用 814mm²,已经接近极限                        │
│                                                             │
│  解决:Chiplet(芯粒)                                  │
│  - 把大芯片拆成多个小芯片(chiplet)                    │
│  - 用先进封装把 chiplet 互联                            │
│  - 每个 chiplet 独立良率高,整体成本低                  │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15

Chiplet 架构示意 ​

┌─────────────────────────────────────────────────────────────┐
│                    AMD CDNA3 Chiplet 架构                   │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│          ┌───────────────────────────────────────┐         │
│          │         HBM3 显存                    │         │
│          └───────────────────────────────────────┘         │
│                                                             │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐             │
│  │ Chiplet 0│  │ Chiplet 1│  │ Chiplet 2│             │
│  │ (计算核心)│  │ (计算核心)│  │ (计算核心)│             │
│  └────┬─────┘  └────┬─────┘  └────┬─────┘             │
│       │               │               │                     │
│       └───────────────┴───────────────┘                   │
│                     │                                       │
│            ┌────────┴────────┐                           │
│            │   先进封装互联   │                           │
│            │ (EMIB / SoIC)   │                           │
│            └─────────────────┘                            │
│                     │                                       │
│              ┌────┴────┐                                 │
│              │ I/O Die │                                 │
│              │(网络/存储)│                                 │
│              └──────────┘                                 │
│                                                             │
│  优势:                                                   │
│  - 计算 chiplet 良率高,成本低                          │
│  - 可以混合不同工艺(计算用先进工艺,IO用成熟工艺)     │
│  - 可扩展:增加 chiplet 数量提升算力                    │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31

第3节:存算一体——打破内存墙 ​

内存墙问题 ​

┌─────────────────────────────────────────────────────────────┐
│                    内存墙(Memory Wall)                    │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  问题:                                                   │
│  - GPU 计算速度 >> 内存带宽                               │
│  - GPU 必须等待数据从 HBM 传输                           │
│  - 即使 HBM 2TB/s,Transformer 计算仍然受限于内存      │
│                                                             │
│  数据:                                                   │
│  一个矩阵乘法操作:                                       │
│  - 计算时间:0.01 ms                                     │
│  - 数据加载时间:0.5 ms(50 倍!)                       │
│  → GPU 90% 的时间在做内存等待!                         │
│                                                             │
│  解决方向:                                               │
│  1. 先进封装(HBM)→ 已经做了                          │
│  2. 近存计算 → 把存储和计算放近                        │
│  3. 存算一体 → 根本取消内存访问                        │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21

存算一体原理 ​

┌─────────────────────────────────────────────────────────────┐
│                    存算一体架构                            │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  传统架构:                                              │
│  ┌──────────┐    数据总线    ┌──────────┐             │
│  │   存储   │ ───────────→  │   计算   │             │
│  │  (HBM)  │   每次运算     │  (ALU)  │             │
│  └──────────┘   都要搬运     └──────────┘             │
│                                                             │
│  存算一体:                                              │
│  ┌──────────────────────────────┐                         │
│  │                              │                         │
│  │  ┌────────┐    ┌────────┐ │                         │
│  │  │  存储  │←──→│  计算  │ │ ← 在同一芯片内         │
│  │  │ (SRAM) │    │ (ALU)  │ │                         │
│  │  └────────┘    └────────┘ │                         │
│  │                              │                         │
│  └──────────────────────────────┘                         │
│       内部互联,带宽极高(TB/s 级)                       │
│                                                             │
│  效果:                                                   │
│  - 内存访问延迟降低 100 倍                                │
│  - 能耗降低 90%(无需数据搬运)                          │
│  - 但精度有限(主要适合推理)                            │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27

主要玩家 ​

┌─────────────────────────────────────────────────────────────┐
│                    存算一体主要玩家                         │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  知存科技(国内):                                       │
│  - SRAM 存算一体                                         │
│  - 主要用于语音识别、图像处理                             │
│  - 极低功耗                                              │
│                                                             │
│  Mythic:                                                │
│  - 模拟计算存算一体                                      │
│  - 用于边缘 AI 推理                                       │
│                                                             │
│  Tesla Dojo:                                            │
│  - Dojo 芯片使用近存计算                                 │
│  - 特斯拉自研,用于自动驾驶训练                           │
│                                                             │
│  预测:2030 年存算一体可能替代部分 GPU 推理工作         │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20

第4节:光计算——用光速做计算 ​

光计算原理 ​

┌─────────────────────────────────────────────────────────────┐
│                    光计算原理                               │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  核心思想:用光的物理特性做计算                          │
│                                                             │
│  矩阵-向量乘法(神经网络核心):                         │
│  y = W × x                                               │
│                                                             │
│  光计算实现:                                             │
│  - 用空间光调制器(SLM)表示矩阵 W                     │
│  - 输入向量 x 转换为光束                                 │
│  - 光通过 SLM 时被矩阵调制                               │
│  - 输出光强 = y                                          │
│                                                             │
│  优势:                                                   │
│  - 光速传播 → 计算速度极快                              │
│  - 无需访存 → 摆脱内存墙                                │
│  - 能耗极低(光子不产生热量)                           │
│                                                             │
│  劣势:                                                   │
│  - 精度有限(模拟计算)                                  │
│  - 非线性操作难以光学实现                                │
│  - 尚在研究阶段                                          │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26

光计算现状 ​

┌─────────────────────────────────────────────────────────────┐
│                    光计算主要玩家                           │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  Lightmatter:                                           │
│  - 光学矩阵乘法加速器                                    │
│  - Envise 芯片,用于数据中心推理                         │
│  - 声称比 GPU 快 100 倍,能耗低 90%                     │
│                                                             │
│  Luminous Computing:                                    │
│  - 光计算 + 数字计算混合                                │
│  - 融资金额巨大                                          │
│                                                             │
│  国内:中科院、清华大学有相关研究                         │
│                                                             │
│  成熟度:仍处于早期阶段,2030 年后可能大规模应用        │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18

第5节:量子计算——遥远但充满想象 ​

量子计算原理 ​

┌─────────────────────────────────────────────────────────────┐
│                    量子计算基础                             │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  量子比特(Qubit):                                     │
│  - 经典比特:0 或 1                                     │
│  - 量子比特:可以同时处于 0 和 1 的叠加态               │
│  - N 个量子比特 = 2^N 个状态的叠加                       │
│                                                             │
│  量子并行:                                               │
│  - 经典计算机:N 次运算得到 N 个结果                     │
│  - 量子计算机:1 次运算得到 2^N 个结果的叠加            │
│  - 但测量时会"坍缩",只能得到一个结果                   │
│                                                             │
│  量子加速的条件:                                        │
│  - 算法能利用量子叠加和纠缠                              │
│  - 需要设计巧妙的量子算法                                │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19

量子计算在 AI 中的可能应用 ​

┌─────────────────────────────────────────────────────────────┐
│                    量子 + AI 的可能场景                       │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  量子机器学习(已验证):                                 │
│  - 量子版 PCA(主成分分析)                             │
│  - 量子版 SVM                                            │
│  - 加速效果不显著,IBM/NISQ 设备噪声太大              │
│                                                             │
│  量子神经网络(研究阶段):                               │
│  - 量子态编码 → 量子演化 → 测量输出                     │
│  - VQC(Variational Quantum Circuit)                    │
│  - 目前只能处理小规模问题                                │
│                                                             │
│  量子模拟(最有前景):                                   │
│  - 量子系统用量子计算模拟(天然匹配)                    │
│  - 药物分子模拟、材料科学                                │
│  - 非量子系统反而没有优势                                │
│                                                             │
│  现实判断:                                               │
│  量子计算距离实用化还有 10-20 年                        │
│  不要期待用它加速当前的深度学习训练                      │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24

第6节:2030 年展望 ​

┌─────────────────────────────────────────────────────────────┐
│                    2030 年计算平台展望                        │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  训练侧:                                                 │
│  ┌─────────────────────────────────────────────────────┐ │
│  │  GPU (H200/B100) + DPU + 光互联                  │ │
│  │  存算一体做 memory footer,HBM 继续演进           │ │
│  │  Chiplet 架构成为主流                              │ │
│  │  → 训练速度比 2026 年快 10 倍                    │ │
│  └─────────────────────────────────────────────────────┘ │
│                                                             │
│  推理侧:                                                 │
│  ┌─────────────────────────────────────────────────────┐ │
│  │  云端:TPU/光计算 ASIC                            │ │
│  │  边缘:存算一体 + NPU                             │ │
│  │  移动:苹果 ANE / 高通 Hexagon                   │ │
│  │  → 推理成本比 2026 年低 100 倍                  │ │
│  └─────────────────────────────────────────────────────┘ │
│                                                             │
│  但 CUDA 生态不会消失:                                   │
│  - 大量存量代码                                          │
│  - 开发者生态                                            │
│  - 新架构往往提供 CUDA 兼容层                            │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26

升华:理解趋势,把握不变 ​

┌─────────────────────────────────────────────────────────────┐
│                    什么会变,什么不变?                      │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  会变:                                                   │
│  🔄 芯片形态:从 GPU 到 DPU、光计算、存算一体          │
│  🔄 互联方式:从铜线到光纤                               │
│  🔄 编程接口:从 CUDA 到各种类 CUDA                     │
│                                                             │
│  不会变:                                                 │
│  🔒 矩阵乘法是 AI 计算的核心                             │
│  🔒 并行计算的基本原理(SIMD/MIMD)                     │
│  🔒 带宽 vs 算力的 trade-off                           │
│  🔒 阿姆达尔定律                                        │
│                                                             │
│  建议:                                                   │
│  学好 CUDA 和并行计算原理                                │
│  换平台只是 API 不同,核心思想不变                      │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20

"AI 可查 vs 必须理解"清单 ​

AI 可查:
✅ DPU、光计算、存算一体的具体产品参数
✅ Chiplet 封装的具体技术(EMIB/SoIC)
✅ 量子计算的具体量子算法(Shor/Grover)

必须理解:
🔴 DPU = 卸载 CPU 的 IO 负担,CPU + GPU + DPU 三足鼎立
🔴 Chiplet = 解决摩尔定律瓶颈,用先进封装互联多个小芯片
🔴 存算一体 = 解决内存墙,在存储单元内做计算,功耗降低 90%
🔴 光计算 = 用光速计算,矩阵乘法极快,但精度有限
🔴 量子计算 = 距离实用化还有 10-20 年,不要期待它加速当前深度学习
🔴 矩阵乘法永远是核心,换的是硬件实现方式
1
2
3
4
5
6
7
8
9
10
11
12

学习状态:🟡 开始学习

最后更新于:

Pager
上一篇14. NPU 全景——昇腾/寒武纪/TPU/苹果生态 / The NPU Landscape: Ascend, Cambricon, TPU, and Apple
下一篇16. 硬件与高性能计算:从“程序为什么慢”开始 / Hardware and HPC Starting from Why Programs Are Slow

持续记录,持续成长

Copyright © Tidenflow