🎛️ 一个字:旋钮
想象一台收音机,上面有几十个旋钮——音量、频率、高低音……每个旋钮调到一个位置,收音机就有一种表现。
模型参数就是 AI 的"旋钮",只不过数量不是几十个,而是:
每个参数 = 一个可以调节的数字(浮点数)
-0.847
0.003
1.558
-0.291
0.721
...
7B 模型有约 70 亿 个这样的小数,作为文件存储约 14GB(半精度 FP16)
📊 模型参数规模一览
BERT-base
110M
1.1 亿参数
约 0.4GB
约 0.4GB
GPT-2
1.5B
15 亿参数
约 6GB
约 6GB
Llama 2-7B
7B
70 亿参数
约 14GB
约 14GB
DeepSeek-V3
671B
6710 亿参数
(MoE,激活37B)
(MoE,激活37B)
GPT-4
~1.8T
传闻 1.8 万亿
(MoE)
(MoE)
🧬 参数是怎么被训练的?
训练过程本质上是一个巨型优化问题:
训练循环(简化版)
输入数据
→
模型预测
→
与正确答案对比
→
计算损失(Loss)
→
反向传播调整参数
- 前向传播:数据流过所有参数,产生预测结果
- 计算损失:预测和正确答案差多远
- 反向传播:计算每个参数对错误的贡献
- 梯度下降:微调每个参数,让下次预测更准一点
这个循环重复 数十亿次(在数万亿 Token 的数据上),参数从随机值逐渐收敛到有意义的模式。
🤔 参数越多越好吗?
传统观点:参数越多 → 模型越聪明
现代观点:能力密度 > 参数量堆砌——让每个参数蕴含更高的智慧与效率
规模定律(Scaling Laws):在一定范围内,参数增加确实带来能力提升。但边际收益递减——从 7B 到 70B 的提升,远大于从 70B 到 700B。
MoE 架构的突破:不需要让每个参数都参与每次计算。DeepSeek-V3 有 671B 总参数,但每次推理只激活 37B——这就是"能力密度"的体现:参数多,但计算少。
💾 参数是怎么存储的?
| 精度 | 每参数大小 | 7B 模型大小 | 用途 |
|---|---|---|---|
| FP32 | 4 字节 | 28 GB | 训练 |
| FP16/BF16 | 2 字节 | 14 GB | 训练+推理 |
| INT8 | 1 字节 | 7 GB | 推理优化 |
| INT4 | 0.5 字节 | 3.5 GB | 消费级硬件运行 |
💬 一句话总结
模型参数就是 AI 大脑里的"突触权重"——一个个小数,代表了模型从海量数据中学到的知识。
7B 到 1800B 不等,越多通常越聪明,但存储和计算成本也越高。现代趋势是在不增加激活参数的前提下,提升每个参数的质量。
就像人脑有约 860 亿个神经元——参数就是 AI 的"神经元连接强度"。