GPU vs CPU:为什么 GPU 是大模型的命根子

大模型的训练和推理本质上就是海量矩阵乘法——几亿个简单的乘法和加法同时做。 这不是 CPU 的赛道。

🏭 一句话类比

🧠

CPU

一个数学天才

1

道题/次

1 秒能做 100 道超复杂数学题
一次只能做 1 道
串行处理,依次来

👥

GPU

1000 个小学生

1000

道题/次

每个小学生做题不快
1000 个人同时做
并行处理,一次搞定

⚡ 大模型需要什么?

神经网络的计算本质是矩阵乘法——不是一道超复杂的数学题,而是几亿道超简单的加法和乘法,需要同时做

一个 GPT-4 级别的推理 大约需要:

CPU 耗时
数分钟
GPU 耗时
< 1 秒

差距:GPU 比 CPU 快 100-1000 倍(矩阵运算场景)

🔬 核心差异

维度 CPU GPU
核心数 4-32 个 超强核心 数千个 简单核心
擅长 复杂逻辑、分支预测、单线程 大规模并行计算、矩阵运算
处理模式 串行(Sequential) 并行(Parallel)
显存 共享系统内存 专用 VRAM(24-80GB+)
典型用途 操作系统、浏览器、数据库 AI 训练/推理、游戏渲染

📐 为什么矩阵乘法必须用 GPU?

大模型的一个前向传播(推理)步骤,本质上是:

输出 = 输入矩阵 × 权重矩阵

—— 这是几万 × 几万规模的矩阵乘法。每一个元素的乘法都独立,互不依赖。

CPU 被迫一个一个元素算,天然浪费了"独立"这个特性。GPU 有几千个核心,可以同时算几千个元素。这就是为什么:

🌐 这对中国意味着什么?

这也正是前面路线图里提到的"以数学补物理、以集群补单芯"的背景: