🏭 一句话类比
🧠
CPU
一个数学天才
1
道题/次
1 秒能做 100 道超复杂数学题
但 一次只能做 1 道
串行处理,依次来
👥
GPU
1000 个小学生
1000
道题/次
每个小学生做题不快
但 1000 个人同时做
并行处理,一次搞定
⚡ 大模型需要什么?
神经网络的计算本质是矩阵乘法——不是一道超复杂的数学题,而是几亿道超简单的加法和乘法,需要同时做。
一个 GPT-4 级别的推理 大约需要:
差距:GPU 比 CPU 快 100-1000 倍(矩阵运算场景)
🔬 核心差异
| 维度 | CPU | GPU |
|---|---|---|
| 核心数 | 4-32 个 超强核心 | 数千个 简单核心 |
| 擅长 | 复杂逻辑、分支预测、单线程 | 大规模并行计算、矩阵运算 |
| 处理模式 | 串行(Sequential) | 并行(Parallel) |
| 显存 | 共享系统内存 | 专用 VRAM(24-80GB+) |
| 典型用途 | 操作系统、浏览器、数据库 | AI 训练/推理、游戏渲染 |
📐 为什么矩阵乘法必须用 GPU?
大模型的一个前向传播(推理)步骤,本质上是:
输出 = 输入矩阵 × 权重矩阵—— 这是几万 × 几万规模的矩阵乘法。每一个元素的乘法都独立,互不依赖。
CPU 被迫一个一个元素算,天然浪费了"独立"这个特性。GPU 有几千个核心,可以同时算几千个元素。这就是为什么:
- 训练 GPT-4 级别的模型需要 上万张 GPU,训练数周
- CPU 来训练同样的模型可能需要几年到几十年
- 推理阶段,单次对话 GPU 毫秒级、CPU 秒级——用户体验天差地别
🌐 这对中国意味着什么?
这也正是前面路线图里提到的"以数学补物理、以集群补单芯"的背景:
- 高端 GPU(如 H100)受出口限制
- 中国通过算法优化(MoE 架构、量化)降低单卡算力需求
- 通过大规模集群(数千张可用 GPU 协同)弥补单卡差距
- 这是系统工程思维的胜利——不追求单点极致,追求整体最优