Skip to content
Gains Summary
Main Navigation 首页 / Home
C++ 编程 / C++ Programming
系统与高性能 / Systems & Performance
Web 开发 / Web Development
人工智能 / Artificial Intelligence
工业软件 / Industrial Software
其他内容 / Other Topics
C++ 编程 / C++系统与性能 / SystemsWeb 开发 / Web人工智能 / AI工业软件 / Industrial

外观

本页目录

未来趋势——2030 年的计算机会是什么形态 / Future Computing Trends Toward 2030 ​

📅 创建时间:2026-06-02 🏷️ 标签:#未来趋势 #DPU #光计算 #存算一体 #量子计算 #Chiplet 📚 前置知识:[[11-performance-analysis-tools]](性能分析) [[12-npu-landscape]](NPU 全景) 📚 相关知识:[[/04-ai/01-llm-engineering/11-training-primer]](训练前沿) [[/04-ai/01-llm-engineering/13-training-infrastructure]](训练基础设施)


先抓住直觉 ​

判断新硬件,不必先相信宏大叙事。把它放回三个老问题:它减少了什么计算、缩短了哪段数据移动、降低了多少通信成本?然后再看可编程性、制造成本和软件生态。

  • 必须理解:Chiplet、存算一体、光计算分别试图缓解什么瓶颈。
  • 用到再查:厂商路线图、产品参数和时间预测。
  • 保持边界感:研究原型、可量产产品和成熟生态是三个不同阶段。

场景:2030 年的 AI 训练,你还在用 GPU 吗? ​

┌─────────────────────────────────────────────────────────────┐
│                                                             │
│  回望历史:                                               │
│                                                             │
│  2012: AlexNet 用 GTX 580(游戏显卡)训练                 │
│  2017: Transformer 用 TPU 训练                            │
│  2023: GPT-4 用 A100/H100 集群训练                        │
│  2026: DeepSeek 用 H800(出口管制版)训练                 │
│                                                             │
│  展望未来 2030:                                         │
│  - GPU 还会是主流吗?                                      │
│  - DPU、光计算、存算一体,谁会崛起?                     │
│  - 量子计算真的能加速 AI 吗?                              │
│                                                             │
│  本章不提供标准答案,而是开阔你的视野。                   │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17

第1节:DPU——数据处理单元的崛起 ​

什么是 DPU? ​

┌─────────────────────────────────────────────────────────────┐
│                    DPU 是什么?                             │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  DPU = Data Processing Unit                              │
│  第三类计算芯片(CPU + GPU + DPU)                       │
│                                                             │
│  CPU:通用计算(控制流)                                  │
│  GPU:并行计算(数据流)                                  │
│  DPU:数据处理(IO、网络、存储)                        │
│                                                             │
│  定位:卸载 CPU 的 IO 负担                                │
│  - 网络协议处理(RDMA、TCP/IP)                         │
│  - 存储虚拟化                                            │
│  - 安全加密/解密                                         │
│  - 数据压缩                                              │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18

DPU 在 AI 训练中的作用 ​

┌─────────────────────────────────────────────────────────────┐
│                    DPU + GPU 协同工作                       │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  传统架构:                                              │
│  CPU ──处理网络协议──→ GPU(等待数据)               │
│                                                             │
│  DPU 架构:                                              │
│  CPU ──控制命令──→ DPU ──预处理──→ GPU(直接算)   │
│                                                             │
│  DPU 负责:                                              │
│  - RDMA 数据直接传输给 GPU(绕过 CPU)                   │
│  - AllReduce 通信加速                                    │
│  - 计算集群的网络虚拟化                                   │
│                                                             │
│  效果:                                                   │
│  - CPU 释放出来做调度                                    │
│  - GPU 不用等待 IO,专注计算                             │
│  - 网络带宽利用率提升                                    │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21

主要 DPU 产品 ​

┌─────────────────────────────────────────────────────────────┐
│                    主要 DPU 产品                           │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  NVIDIA BlueField-3:                                    │
│  - ARM 核心 × 16                                        │
│  - 400 Gb/s 网络带宽                                     │
│  - 卸载 RDMA、加密、存储虚拟化                           │
│  - DOCA 编程框架(类 CUDA)                             │
│                                                             │
│  Intel IPU:                                             │
│  - FPGA + ARM 混合架构                                  │
│  - 用于数据中心网络卸载                                  │
│                                                             │
│  趋势:DPU 会成为数据中心的标配                          │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17

第2节:Chiplet——摩尔定律的延续 ​

为什么需要 Chiplet? ​

┌─────────────────────────────────────────────────────────────┐
│                    摩尔定律的困境                           │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  问题:                                                   │
│  - 2D 芯片面积有光刻机掩模尺寸限制(~800mm²)        │
│  - 超过这个尺寸,良率急剧下降                           │
│  - H100 用 814mm²,已经接近极限                        │
│                                                             │
│  解决:Chiplet(芯粒)                                  │
│  - 把大芯片拆成多个小芯片(chiplet)                    │
│  - 用先进封装把 chiplet 互联                            │
│  - 每个 chiplet 独立良率高,整体成本低                  │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15

Chiplet 架构示意 ​

┌─────────────────────────────────────────────────────────────┐
│                    AMD CDNA3 Chiplet 架构                   │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│          ┌───────────────────────────────────────┐         │
│          │         HBM3 显存                    │         │
│          └───────────────────────────────────────┘         │
│                                                             │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐             │
│  │ Chiplet 0│  │ Chiplet 1│  │ Chiplet 2│             │
│  │ (计算核心)│  │ (计算核心)│  │ (计算核心)│             │
│  └────┬─────┘  └────┬─────┘  └────┬─────┘             │
│       │               │               │                     │
│       └───────────────┴───────────────┘                   │
│                     │                                       │
│            ┌────────┴────────┐                           │
│            │   先进封装互联   │                           │
│            │ (EMIB / SoIC)   │                           │
│            └─────────────────┘                            │
│                     │                                       │
│              ┌────┴────┐                                 │
│              │ I/O Die │                                 │
│              │(网络/存储)│                                 │
│              └──────────┘                                 │
│                                                             │
│  优势:                                                   │
│  - 计算 chiplet 良率高,成本低                          │
│  - 可以混合不同工艺(计算用先进工艺,IO用成熟工艺)     │
│  - 可扩展:增加 chiplet 数量提升算力                    │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31

第3节:存算一体——打破内存墙 ​

内存墙问题 ​

┌─────────────────────────────────────────────────────────────┐
│                    内存墙(Memory Wall)                    │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  问题:                                                   │
│  - GPU 计算速度 >> 内存带宽                               │
│  - GPU 必须等待数据从 HBM 传输                           │
│  - 即使 HBM 2TB/s,Transformer 计算仍然受限于内存      │
│                                                             │
│  数据:                                                   │
│  一个矩阵乘法操作:                                       │
│  - 计算时间:0.01 ms                                     │
│  - 数据加载时间:0.5 ms(50 倍!)                       │
│  → GPU 90% 的时间在做内存等待!                         │
│                                                             │
│  解决方向:                                               │
│  1. 先进封装(HBM)→ 已经做了                          │
│  2. 近存计算 → 把存储和计算放近                        │
│  3. 存算一体 → 根本取消内存访问                        │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21

存算一体原理 ​

┌─────────────────────────────────────────────────────────────┐
│                    存算一体架构                            │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  传统架构:                                              │
│  ┌──────────┐    数据总线    ┌──────────┐             │
│  │   存储   │ ───────────→  │   计算   │             │
│  │  (HBM)  │   每次运算     │  (ALU)  │             │
│  └──────────┘   都要搬运     └──────────┘             │
│                                                             │
│  存算一体:                                              │
│  ┌──────────────────────────────┐                         │
│  │                              │                         │
│  │  ┌────────┐    ┌────────┐ │                         │
│  │  │  存储  │←──→│  计算  │ │ ← 在同一芯片内         │
│  │  │ (SRAM) │    │ (ALU)  │ │                         │
│  │  └────────┘    └────────┘ │                         │
│  │                              │                         │
│  └──────────────────────────────┘                         │
│       内部互联,带宽极高(TB/s 级)                       │
│                                                             │
│  效果:                                                   │
│  - 内存访问延迟降低 100 倍                                │
│  - 能耗降低 90%(无需数据搬运)                          │
│  - 但精度有限(主要适合推理)                            │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27

主要玩家 ​

┌─────────────────────────────────────────────────────────────┐
│                    存算一体主要玩家                         │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  知存科技(国内):                                       │
│  - SRAM 存算一体                                         │
│  - 主要用于语音识别、图像处理                             │
│  - 极低功耗                                              │
│                                                             │
│  Mythic:                                                │
│  - 模拟计算存算一体                                      │
│  - 用于边缘 AI 推理                                       │
│                                                             │
│  Tesla Dojo:                                            │
│  - Dojo 芯片使用近存计算                                 │
│  - 特斯拉自研,用于自动驾驶训练                           │
│                                                             │
│  预测:2030 年存算一体可能替代部分 GPU 推理工作         │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20

第4节:光计算——用光速做计算 ​

光计算原理 ​

┌─────────────────────────────────────────────────────────────┐
│                    光计算原理                               │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  核心思想:用光的物理特性做计算                          │
│                                                             │
│  矩阵-向量乘法(神经网络核心):                         │
│  y = W × x                                               │
│                                                             │
│  光计算实现:                                             │
│  - 用空间光调制器(SLM)表示矩阵 W                     │
│  - 输入向量 x 转换为光束                                 │
│  - 光通过 SLM 时被矩阵调制                               │
│  - 输出光强 = y                                          │
│                                                             │
│  优势:                                                   │
│  - 光速传播 → 计算速度极快                              │
│  - 无需访存 → 摆脱内存墙                                │
│  - 能耗极低(光子不产生热量)                           │
│                                                             │
│  劣势:                                                   │
│  - 精度有限(模拟计算)                                  │
│  - 非线性操作难以光学实现                                │
│  - 尚在研究阶段                                          │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26

光计算现状 ​

┌─────────────────────────────────────────────────────────────┐
│                    光计算主要玩家                           │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  Lightmatter:                                           │
│  - 光学矩阵乘法加速器                                    │
│  - Envise 芯片,用于数据中心推理                         │
│  - 声称比 GPU 快 100 倍,能耗低 90%                     │
│                                                             │
│  Luminous Computing:                                    │
│  - 光计算 + 数字计算混合                                │
│  - 融资金额巨大                                          │
│                                                             │
│  国内:中科院、清华大学有相关研究                         │
│                                                             │
│  成熟度:仍处于早期阶段,2030 年后可能大规模应用        │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18

第5节:量子计算——遥远但充满想象 ​

量子计算原理 ​

┌─────────────────────────────────────────────────────────────┐
│                    量子计算基础                             │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  量子比特(Qubit):                                     │
│  - 经典比特:0 或 1                                     │
│  - 量子比特:可以同时处于 0 和 1 的叠加态               │
│  - N 个量子比特 = 2^N 个状态的叠加                       │
│                                                             │
│  量子并行:                                               │
│  - 经典计算机:N 次运算得到 N 个结果                     │
│  - 量子计算机:1 次运算得到 2^N 个结果的叠加            │
│  - 但测量时会"坍缩",只能得到一个结果                   │
│                                                             │
│  量子加速的条件:                                        │
│  - 算法能利用量子叠加和纠缠                              │
│  - 需要设计巧妙的量子算法                                │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19

量子计算在 AI 中的可能应用 ​

┌─────────────────────────────────────────────────────────────┐
│                    量子 + AI 的可能场景                       │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  量子机器学习(已验证):                                 │
│  - 量子版 PCA(主成分分析)                             │
│  - 量子版 SVM                                            │
│  - 加速效果不显著,IBM/NISQ 设备噪声太大              │
│                                                             │
│  量子神经网络(研究阶段):                               │
│  - 量子态编码 → 量子演化 → 测量输出                     │
│  - VQC(Variational Quantum Circuit)                    │
│  - 目前只能处理小规模问题                                │
│                                                             │
│  量子模拟(最有前景):                                   │
│  - 量子系统用量子计算模拟(天然匹配)                    │
│  - 药物分子模拟、材料科学                                │
│  - 非量子系统反而没有优势                                │
│                                                             │
│  现实判断:                                               │
│  量子计算距离实用化还有 10-20 年                        │
│  不要期待用它加速当前的深度学习训练                      │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24

第6节:2030 年展望 ​

┌─────────────────────────────────────────────────────────────┐
│                    2030 年计算平台展望                        │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  训练侧:                                                 │
│  ┌─────────────────────────────────────────────────────┐ │
│  │  GPU (H200/B100) + DPU + 光互联                  │ │
│  │  存算一体做 memory footer,HBM 继续演进           │ │
│  │  Chiplet 架构成为主流                              │ │
│  │  → 训练速度比 2026 年快 10 倍                    │ │
│  └─────────────────────────────────────────────────────┘ │
│                                                             │
│  推理侧:                                                 │
│  ┌─────────────────────────────────────────────────────┐ │
│  │  云端:TPU/光计算 ASIC                            │ │
│  │  边缘:存算一体 + NPU                             │ │
│  │  移动:苹果 ANE / 高通 Hexagon                   │ │
│  │  → 推理成本比 2026 年低 100 倍                  │ │
│  └─────────────────────────────────────────────────────┘ │
│                                                             │
│  但 CUDA 生态不会消失:                                   │
│  - 大量存量代码                                          │
│  - 开发者生态                                            │
│  - 新架构往往提供 CUDA 兼容层                            │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26

升华:理解趋势,把握不变 ​

┌─────────────────────────────────────────────────────────────┐
│                    什么会变,什么不变?                      │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  会变:                                                   │
│  🔄 芯片形态:从 GPU 到 DPU、光计算、存算一体          │
│  🔄 互联方式:从铜线到光纤                               │
│  🔄 编程接口:从 CUDA 到各种类 CUDA                     │
│                                                             │
│  不会变:                                                 │
│  🔒 矩阵乘法是 AI 计算的核心                             │
│  🔒 并行计算的基本原理(SIMD/MIMD)                     │
│  🔒 带宽 vs 算力的 trade-off                           │
│  🔒 阿姆达尔定律                                        │
│                                                             │
│  建议:                                                   │
│  学好 CUDA 和并行计算原理                                │
│  换平台只是 API 不同,核心思想不变                      │
│                                                             │
└─────────────────────────────────────────────────────────────┘
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20

"AI 可查 vs 必须理解"清单 ​

AI 可查:
✅ DPU、光计算、存算一体的具体产品参数
✅ Chiplet 封装的具体技术(EMIB/SoIC)
✅ 量子计算的具体量子算法(Shor/Grover)

必须理解:
🔴 DPU = 卸载 CPU 的 IO 负担,CPU + GPU + DPU 三足鼎立
🔴 Chiplet = 解决摩尔定律瓶颈,用先进封装互联多个小芯片
🔴 存算一体 = 解决内存墙,在存储单元内做计算,功耗降低 90%
🔴 光计算 = 用光速计算,矩阵乘法极快,但精度有限
🔴 量子计算 = 距离实用化还有 10-20 年,不要期待它加速当前深度学习
🔴 矩阵乘法永远是核心,换的是硬件实现方式
1
2
3
4
5
6
7
8
9
10
11
12

学习状态:🟡 开始学习

最后更新于:

Pager
下一篇← 系统与高性能 / Systems & Performance

持续记录,持续成长

Copyright © Tidenflow