模型参数:AI 大脑里的旋钮

7B 模型有 70 亿个旋钮。每一个都是一个可以调整的小数。 训练就是在调这些旋钮,让模型预测越来越准。

🎛️ 一个字:旋钮

想象一台收音机,上面有几十个旋钮——音量、频率、高低音……每个旋钮调到一个位置,收音机就有一种表现。

模型参数就是 AI 的"旋钮",只不过数量不是几十个,而是:

每个参数 = 一个可以调节的数字(浮点数)

-0.847
0.003
1.558
-0.291
0.721
...

7B 模型有约 70 亿 个这样的小数,作为文件存储约 14GB(半精度 FP16)

📊 模型参数规模一览

BERT-base
110M
1.1 亿参数
约 0.4GB
GPT-2
1.5B
15 亿参数
约 6GB
Llama 2-7B
7B
70 亿参数
约 14GB
DeepSeek-V3
671B
6710 亿参数
(MoE,激活37B)
GPT-4
~1.8T
传闻 1.8 万亿
(MoE)

🧬 参数是怎么被训练的?

训练过程本质上是一个巨型优化问题

训练循环(简化版)

输入数据 模型预测 与正确答案对比 计算损失(Loss) 反向传播调整参数

这个循环重复 数十亿次(在数万亿 Token 的数据上),参数从随机值逐渐收敛到有意义的模式。

🤔 参数越多越好吗?

传统观点:参数越多 → 模型越聪明
现代观点:能力密度 > 参数量堆砌——让每个参数蕴含更高的智慧与效率

规模定律(Scaling Laws):在一定范围内,参数增加确实带来能力提升。但边际收益递减——从 7B 到 70B 的提升,远大于从 70B 到 700B。

MoE 架构的突破:不需要让每个参数都参与每次计算。DeepSeek-V3 有 671B 总参数,但每次推理只激活 37B——这就是"能力密度"的体现:参数多,但计算少。

💾 参数是怎么存储的?

精度 每参数大小 7B 模型大小 用途
FP324 字节28 GB训练
FP16/BF162 字节14 GB训练+推理
INT81 字节7 GB推理优化
INT40.5 字节3.5 GB消费级硬件运行

💬 一句话总结

模型参数就是 AI 大脑里的"突触权重"——一个个小数,代表了模型从海量数据中学到的知识。

7B 到 1800B 不等,越多通常越聪明,但存储和计算成本也越高。现代趋势是在不增加激活参数的前提下,提升每个参数的质量。

就像人脑有约 860 亿个神经元——参数就是 AI 的"神经元连接强度"。