未来趋势——2030 年的计算机会是什么形态 / Future Computing Trends Toward 2030
📅 创建时间:2026-06-02 🏷️ 标签:#未来趋势 #DPU #光计算 #存算一体 #量子计算 #Chiplet 📚 前置知识:[[11-performance-analysis-tools]](性能分析) [[12-npu-landscape]](NPU 全景) 📚 相关知识:[[/04-ai/01-llm-engineering/11-training-primer]](训练前沿) [[/04-ai/01-llm-engineering/13-training-infrastructure]](训练基础设施)
先抓住直觉
判断新硬件,不必先相信宏大叙事。把它放回三个老问题:它减少了什么计算、缩短了哪段数据移动、降低了多少通信成本?然后再看可编程性、制造成本和软件生态。
- 必须理解:Chiplet、存算一体、光计算分别试图缓解什么瓶颈。
- 用到再查:厂商路线图、产品参数和时间预测。
- 保持边界感:研究原型、可量产产品和成熟生态是三个不同阶段。
场景:2030 年的 AI 训练,你还在用 GPU 吗?
┌─────────────────────────────────────────────────────────────┐
│ │
│ 回望历史: │
│ │
│ 2012: AlexNet 用 GTX 580(游戏显卡)训练 │
│ 2017: Transformer 用 TPU 训练 │
│ 2023: GPT-4 用 A100/H100 集群训练 │
│ 2026: DeepSeek 用 H800(出口管制版)训练 │
│ │
│ 展望未来 2030: │
│ - GPU 还会是主流吗? │
│ - DPU、光计算、存算一体,谁会崛起? │
│ - 量子计算真的能加速 AI 吗? │
│ │
│ 本章不提供标准答案,而是开阔你的视野。 │
│ │
└─────────────────────────────────────────────────────────────┘第1节:DPU——数据处理单元的崛起
什么是 DPU?
┌─────────────────────────────────────────────────────────────┐
│ DPU 是什么? │
├─────────────────────────────────────────────────────────────┤
│ │
│ DPU = Data Processing Unit │
│ 第三类计算芯片(CPU + GPU + DPU) │
│ │
│ CPU:通用计算(控制流) │
│ GPU:并行计算(数据流) │
│ DPU:数据处理(IO、网络、存储) │
│ │
│ 定位:卸载 CPU 的 IO 负担 │
│ - 网络协议处理(RDMA、TCP/IP) │
│ - 存储虚拟化 │
│ - 安全加密/解密 │
│ - 数据压缩 │
│ │
└─────────────────────────────────────────────────────────────┘DPU 在 AI 训练中的作用
┌─────────────────────────────────────────────────────────────┐
│ DPU + GPU 协同工作 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 传统架构: │
│ CPU ──处理网络协议──→ GPU(等待数据) │
│ │
│ DPU 架构: │
│ CPU ──控制命令──→ DPU ──预处理──→ GPU(直接算) │
│ │
│ DPU 负责: │
│ - RDMA 数据直接传输给 GPU(绕过 CPU) │
│ - AllReduce 通信加速 │
│ - 计算集群的网络虚拟化 │
│ │
│ 效果: │
│ - CPU 释放出来做调度 │
│ - GPU 不用等待 IO,专注计算 │
│ - 网络带宽利用率提升 │
│ │
└─────────────────────────────────────────────────────────────┘主要 DPU 产品
┌─────────────────────────────────────────────────────────────┐
│ 主要 DPU 产品 │
├─────────────────────────────────────────────────────────────┤
│ │
│ NVIDIA BlueField-3: │
│ - ARM 核心 × 16 │
│ - 400 Gb/s 网络带宽 │
│ - 卸载 RDMA、加密、存储虚拟化 │
│ - DOCA 编程框架(类 CUDA) │
│ │
│ Intel IPU: │
│ - FPGA + ARM 混合架构 │
│ - 用于数据中心网络卸载 │
│ │
│ 趋势:DPU 会成为数据中心的标配 │
│ │
└─────────────────────────────────────────────────────────────┘第2节:Chiplet——摩尔定律的延续
为什么需要 Chiplet?
┌─────────────────────────────────────────────────────────────┐
│ 摩尔定律的困境 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 问题: │
│ - 2D 芯片面积有光刻机掩模尺寸限制(~800mm²) │
│ - 超过这个尺寸,良率急剧下降 │
│ - H100 用 814mm²,已经接近极限 │
│ │
│ 解决:Chiplet(芯粒) │
│ - 把大芯片拆成多个小芯片(chiplet) │
│ - 用先进封装把 chiplet 互联 │
│ - 每个 chiplet 独立良率高,整体成本低 │
│ │
└─────────────────────────────────────────────────────────────┘Chiplet 架构示意
┌─────────────────────────────────────────────────────────────┐
│ AMD CDNA3 Chiplet 架构 │
├─────────────────────────────────────────────────────────────┤
│ │
│ ┌───────────────────────────────────────┐ │
│ │ HBM3 显存 │ │
│ └───────────────────────────────────────┘ │
│ │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ Chiplet 0│ │ Chiplet 1│ │ Chiplet 2│ │
│ │ (计算核心)│ │ (计算核心)│ │ (计算核心)│ │
│ └────┬─────┘ └────┬─────┘ └────┬─────┘ │
│ │ │ │ │
│ └───────────────┴───────────────┘ │
│ │ │
│ ┌────────┴────────┐ │
│ │ 先进封装互联 │ │
│ │ (EMIB / SoIC) │ │
│ └─────────────────┘ │
│ │ │
│ ┌────┴────┐ │
│ │ I/O Die │ │
│ │(网络/存储)│ │
│ └──────────┘ │
│ │
│ 优势: │
│ - 计算 chiplet 良率高,成本低 │
│ - 可以混合不同工艺(计算用先进工艺,IO用成熟工艺) │
│ - 可扩展:增加 chiplet 数量提升算力 │
│ │
└─────────────────────────────────────────────────────────────┘第3节:存算一体——打破内存墙
内存墙问题
┌─────────────────────────────────────────────────────────────┐
│ 内存墙(Memory Wall) │
├─────────────────────────────────────────────────────────────┤
│ │
│ 问题: │
│ - GPU 计算速度 >> 内存带宽 │
│ - GPU 必须等待数据从 HBM 传输 │
│ - 即使 HBM 2TB/s,Transformer 计算仍然受限于内存 │
│ │
│ 数据: │
│ 一个矩阵乘法操作: │
│ - 计算时间:0.01 ms │
│ - 数据加载时间:0.5 ms(50 倍!) │
│ → GPU 90% 的时间在做内存等待! │
│ │
│ 解决方向: │
│ 1. 先进封装(HBM)→ 已经做了 │
│ 2. 近存计算 → 把存储和计算放近 │
│ 3. 存算一体 → 根本取消内存访问 │
│ │
└─────────────────────────────────────────────────────────────┘存算一体原理
┌─────────────────────────────────────────────────────────────┐
│ 存算一体架构 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 传统架构: │
│ ┌──────────┐ 数据总线 ┌──────────┐ │
│ │ 存储 │ ───────────→ │ 计算 │ │
│ │ (HBM) │ 每次运算 │ (ALU) │ │
│ └──────────┘ 都要搬运 └──────────┘ │
│ │
│ 存算一体: │
│ ┌──────────────────────────────┐ │
│ │ │ │
│ │ ┌────────┐ ┌────────┐ │ │
│ │ │ 存储 │←──→│ 计算 │ │ ← 在同一芯片内 │
│ │ │ (SRAM) │ │ (ALU) │ │ │
│ │ └────────┘ └────────┘ │ │
│ │ │ │
│ └──────────────────────────────┘ │
│ 内部互联,带宽极高(TB/s 级) │
│ │
│ 效果: │
│ - 内存访问延迟降低 100 倍 │
│ - 能耗降低 90%(无需数据搬运) │
│ - 但精度有限(主要适合推理) │
│ │
└─────────────────────────────────────────────────────────────┘主要玩家
┌─────────────────────────────────────────────────────────────┐
│ 存算一体主要玩家 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 知存科技(国内): │
│ - SRAM 存算一体 │
│ - 主要用于语音识别、图像处理 │
│ - 极低功耗 │
│ │
│ Mythic: │
│ - 模拟计算存算一体 │
│ - 用于边缘 AI 推理 │
│ │
│ Tesla Dojo: │
│ - Dojo 芯片使用近存计算 │
│ - 特斯拉自研,用于自动驾驶训练 │
│ │
│ 预测:2030 年存算一体可能替代部分 GPU 推理工作 │
│ │
└─────────────────────────────────────────────────────────────┘第4节:光计算——用光速做计算
光计算原理
┌─────────────────────────────────────────────────────────────┐
│ 光计算原理 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 核心思想:用光的物理特性做计算 │
│ │
│ 矩阵-向量乘法(神经网络核心): │
│ y = W × x │
│ │
│ 光计算实现: │
│ - 用空间光调制器(SLM)表示矩阵 W │
│ - 输入向量 x 转换为光束 │
│ - 光通过 SLM 时被矩阵调制 │
│ - 输出光强 = y │
│ │
│ 优势: │
│ - 光速传播 → 计算速度极快 │
│ - 无需访存 → 摆脱内存墙 │
│ - 能耗极低(光子不产生热量) │
│ │
│ 劣势: │
│ - 精度有限(模拟计算) │
│ - 非线性操作难以光学实现 │
│ - 尚在研究阶段 │
│ │
└─────────────────────────────────────────────────────────────┘光计算现状
┌─────────────────────────────────────────────────────────────┐
│ 光计算主要玩家 │
├─────────────────────────────────────────────────────────────┤
│ │
│ Lightmatter: │
│ - 光学矩阵乘法加速器 │
│ - Envise 芯片,用于数据中心推理 │
│ - 声称比 GPU 快 100 倍,能耗低 90% │
│ │
│ Luminous Computing: │
│ - 光计算 + 数字计算混合 │
│ - 融资金额巨大 │
│ │
│ 国内:中科院、清华大学有相关研究 │
│ │
│ 成熟度:仍处于早期阶段,2030 年后可能大规模应用 │
│ │
└─────────────────────────────────────────────────────────────┘第5节:量子计算——遥远但充满想象
量子计算原理
┌─────────────────────────────────────────────────────────────┐
│ 量子计算基础 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 量子比特(Qubit): │
│ - 经典比特:0 或 1 │
│ - 量子比特:可以同时处于 0 和 1 的叠加态 │
│ - N 个量子比特 = 2^N 个状态的叠加 │
│ │
│ 量子并行: │
│ - 经典计算机:N 次运算得到 N 个结果 │
│ - 量子计算机:1 次运算得到 2^N 个结果的叠加 │
│ - 但测量时会"坍缩",只能得到一个结果 │
│ │
│ 量子加速的条件: │
│ - 算法能利用量子叠加和纠缠 │
│ - 需要设计巧妙的量子算法 │
│ │
└─────────────────────────────────────────────────────────────┘量子计算在 AI 中的可能应用
┌─────────────────────────────────────────────────────────────┐
│ 量子 + AI 的可能场景 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 量子机器学习(已验证): │
│ - 量子版 PCA(主成分分析) │
│ - 量子版 SVM │
│ - 加速效果不显著,IBM/NISQ 设备噪声太大 │
│ │
│ 量子神经网络(研究阶段): │
│ - 量子态编码 → 量子演化 → 测量输出 │
│ - VQC(Variational Quantum Circuit) │
│ - 目前只能处理小规模问题 │
│ │
│ 量子模拟(最有前景): │
│ - 量子系统用量子计算模拟(天然匹配) │
│ - 药物分子模拟、材料科学 │
│ - 非量子系统反而没有优势 │
│ │
│ 现实判断: │
│ 量子计算距离实用化还有 10-20 年 │
│ 不要期待用它加速当前的深度学习训练 │
│ │
└─────────────────────────────────────────────────────────────┘第6节:2030 年展望
┌─────────────────────────────────────────────────────────────┐
│ 2030 年计算平台展望 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 训练侧: │
│ ┌─────────────────────────────────────────────────────┐ │
│ │ GPU (H200/B100) + DPU + 光互联 │ │
│ │ 存算一体做 memory footer,HBM 继续演进 │ │
│ │ Chiplet 架构成为主流 │ │
│ │ → 训练速度比 2026 年快 10 倍 │ │
│ └─────────────────────────────────────────────────────┘ │
│ │
│ 推理侧: │
│ ┌─────────────────────────────────────────────────────┐ │
│ │ 云端:TPU/光计算 ASIC │ │
│ │ 边缘:存算一体 + NPU │ │
│ │ 移动:苹果 ANE / 高通 Hexagon │ │
│ │ → 推理成本比 2026 年低 100 倍 │ │
│ └─────────────────────────────────────────────────────┘ │
│ │
│ 但 CUDA 生态不会消失: │
│ - 大量存量代码 │
│ - 开发者生态 │
│ - 新架构往往提供 CUDA 兼容层 │
│ │
└─────────────────────────────────────────────────────────────┘升华:理解趋势,把握不变
┌─────────────────────────────────────────────────────────────┐
│ 什么会变,什么不变? │
├─────────────────────────────────────────────────────────────┤
│ │
│ 会变: │
│ 🔄 芯片形态:从 GPU 到 DPU、光计算、存算一体 │
│ 🔄 互联方式:从铜线到光纤 │
│ 🔄 编程接口:从 CUDA 到各种类 CUDA │
│ │
│ 不会变: │
│ 🔒 矩阵乘法是 AI 计算的核心 │
│ 🔒 并行计算的基本原理(SIMD/MIMD) │
│ 🔒 带宽 vs 算力的 trade-off │
│ 🔒 阿姆达尔定律 │
│ │
│ 建议: │
│ 学好 CUDA 和并行计算原理 │
│ 换平台只是 API 不同,核心思想不变 │
│ │
└─────────────────────────────────────────────────────────────┘"AI 可查 vs 必须理解"清单
AI 可查:
✅ DPU、光计算、存算一体的具体产品参数
✅ Chiplet 封装的具体技术(EMIB/SoIC)
✅ 量子计算的具体量子算法(Shor/Grover)
必须理解:
🔴 DPU = 卸载 CPU 的 IO 负担,CPU + GPU + DPU 三足鼎立
🔴 Chiplet = 解决摩尔定律瓶颈,用先进封装互联多个小芯片
🔴 存算一体 = 解决内存墙,在存储单元内做计算,功耗降低 90%
🔴 光计算 = 用光速计算,矩阵乘法极快,但精度有限
🔴 量子计算 = 距离实用化还有 10-20 年,不要期待它加速当前深度学习
🔴 矩阵乘法永远是核心,换的是硬件实现方式学习状态:🟡 开始学习