当 Llion Jones —— Transformer 论文的八位作者之一 —— 决定重新审视人工神经网络最基本的前提:把时间还给神经元。如果这条路走通,它将引发的不是一代芯片迭代,而是整个 AI 产业价值链的重构。本文从技术原理、算力瓶颈、参数逻辑、地缘格局四个维度,深度分析 CTM 的颠覆潜力。
| 项目 | 详情 |
|---|---|
| 论文 | Continuous Thought Machines (CTM) |
| 作者 | Luke Darlow, Ciaran Regan, Sebastian Risi, Jeffrey Seely, Llion Jones |
| 机构 | Sakana AI(东京) |
| 时间 | 2025 年 5 月(v1),10 月更新 |
| 代码 | github.com/SakanaAI/continuous-thought-machines |
| 互动报告 | pub.sakana.ai/ctm |
Llion Jones 是 2017 年 "Attention Is All You Need" 的八位共同作者之一。那篇论文开创了 Transformer 时代。八年后,他在东京创办 Sakana AI,推出了一项可能颠覆他自己参与创造的范式的技术。
CTM 的核心命题非常简单,甚至可以说朴素:
1980 年代以来,人工神经元模型几乎没变过。每个神经元只输出一个标量 —— firing rate。但在生物大脑中,神经元什么时候放电、和谁一起放电、以什么节奏放电 —— 这些时序信息是智力的核心。CTM 做的事就是:给每个神经元访问自己历史行为的权限,让它们通过 synchronization(同步化) 来协调和推理。
从 1986 年 Rumelhart 的 Backpropagation,到 2012 年 AlexNet,到 2023 年的 GPT-4——所有这一切都建立在同一个神经元模型上:
output = activation( Σ(weight_i × input_i) + bias )
这个公式里没有 时间。没有历史。没有和其他神经元的同步关系。在生物学中至关重要的 spike-timing-dependent plasticity(STDP),在人工神经网络里完全不存在。
每个神经元不仅知道自己的当前状态,还能回溯自己的历史行为序列。不是"我现在是 0.7",而是"我过去 50 个 time step 里先后经历了 0.2→0.9→0.1→0.6→..."
神经元学会如何基于自己的历史来决定下一步输出。不只是"我看到了什么",还包括"我上次是什么时候激发的、和我激发的其他神经元有什么关系"
CTM 的核心表征不是某个神经元的输出值,而是神经元之间的同步化模式——谁和谁在同一频率振荡、谁的 spike timing 和谁的 aligned、谁是"领导者"谁是"跟随者"
| 维度 | Transformer | CTM |
|---|---|---|
| 计算原语 | 密集矩阵乘法(Attention + FFN) | Neuron synchronization over time |
| 智力来源 | 参数量(更多旋钮 = 更细的模式切分) | 神经元动力学丰富度(更多时间步 = 更深的思考) |
| 时间处理 | Positional Encoding(把时序硬编码为位置向量) | 原生时序维度(时间不是附加上去的,是计算的本质) |
| 推理方式 | 一次前向 pass → 输出 | 内部连续时间步中多步推理 → 输出 |
| Neuron 模型 | 标量激活值(点神经元) | 有历史记忆的丰富动力学神经元 |
| 计算量 | 训练时巨大,推理相对固定 | 推理时取决于"想了多少步"——可伸缩 |
| 适配硬件 | GPU(天生为 GEMM 优化) | 目前没有天然适配的硬件 |
| 可解释性 | 弱(Attention map 只能看 Token 关系) | 强(可以直接可视化神经元的时序行为) |
| 生物相似度 | 极低 | 中高(但不追求精确模拟) |
CTM 论文最令人印象深刻的部分不是 benchmark 分数——是那些没有被显式训练但自发涌现的行为。这些行为暗示了更深层的智能机制。
把一张迷宫图输入 CTM。在它的内部时间维度中,可以观察到 CTM 一步一步地沿着迷宫路径"追踪"——就像一个人用眼睛在迷宫中找路。这不是设计的,不是训出来的。是架构给了神经元时间维度后自发涌现的。
给 CTM 一张照片。没有任何显式训练目标要求它这样做——但 CTM 会自己移动"目光",选择聚焦于场景中最显著的区域。这和人类的视觉注意力机制非常相似:我们不是同时看清一张图的所有像素,是眼球不断跳动、fovea 聚焦关键位置的。
Sakana AI 团队对比了 CTM 和 LSTM 的神经元动态行为:
| CTM 神经元 | 传统 LSTM 神经元 |
|---|---|
| 不同频率的振荡 | 相对单调、缺乏多样性 |
| 不同振幅的响应 | 模式单一 |
| 单个神经元内出现多种频率 | 几乎不存在 |
| 某些神经元只在"解题中"才活跃 | 持续活跃 |
| 自发同步群组形成 | 无明显同步行为 |
"It is worth stressing that all of these behaviours are completely emergent, were not designed into the model." —— Sakana AI 官方博客
这是 CTM 面临的最大现实障碍——也是它最大的地缘战略变量。
| 层级 | GPU 优化了什么 | CTM 需要什么 | 匹配度 |
|---|---|---|---|
| 计算单元 | GEMM(矩阵乘),Tensor Core 专为密集线性代数设计 | Neuron state update + pairwise synchronization | 🔴 极低 |
| 内存层次 | 可预测的数据路径,预取友好,HBM 带宽最大化 | 每个样本、每个 time step 的 neuron state 都在变,预取策略完全失效 | 🔴 极低 |
| 并行模型 | SIMD/SIMT:同一指令,不同数据,32 个 CUDA core 一起做同样的事 | 天然异构:不同神经元在不同时间步做完全不同的事 | 🔴 极低 |
| 软件栈 | PyTorch autograd → CUDA kernel,为静态计算图优化 | 动态 time loop 内的不规则梯度流 | 🟡 勉强可用 |
目前没有。但如果要设计,特征大概是:事件驱动 + 细粒度异步 + 近存计算 + 稀疏通信 + 可能数模混合。
| 芯片/路线 | 机构 | 契合点 | 当前差距 |
|---|---|---|---|
| Intel Loihi 2 | Intel | 事件驱动 + 异步 spiking + 片上学习。每个 neurocore 独立 clock | 规模小,商用生态≈零 |
| IBM TrueNorth | IBM | 百万神经元级异步脉冲网络。功耗毫瓦级 | 设计年代早,灵活性低 |
| SpiNNaker | 曼彻斯特大学 | 专门模拟生物神经元时序行为。可模拟 10 亿神经元 | 学院项目,不以训练 AI 为目标 |
| 天机芯 (Tianjic) | 清华大学 | 全球首款 ANN+SNN 异构融合芯片。Nature 2019 封面 | 生态起步阶段 |
| 天眸芯 (Tianmouc) | 清华大学 | 模拟人眼双通路。Nature 2024 封面。事件驱动视觉 | 专用视觉,非通用计算 |
| 达尔文系列 | 浙江大学 | 类脑计算芯片,已迭代多代 | SNN 路线,与 CTM 理念相近但架构不同 |
CTM 很难 scale 到 LLM 级别。从当前的迷宫/图像分类任务到 7B+ 参数模型,差约 9 个数量级。而且当前每一层 AI 软硬件都是为密集矩阵乘法优化的,换道需要的时间远超一代芯片周期。
如果神经形态硬件或事件驱动架构成熟,CTM 可能从根本上比 Transformer 更高效。理由不是工程突破,是物理:人脑 20W 跑全部认知,GPT-4 训练一次用兆瓦时。效率差距 6-8 个数量级,其中的范式差异迟早要被弥合。
Transformer 的 Scaling Laws 建立在一个事实上:更多参数 = 更多模式存储容量。每个参数都是一个可调旋钮,把输入空间切得更细。
CTM 的智力来源完全不同:
| Transformer | CTM | |
|---|---|---|
| 智力来源 | 参数量(存储容量) | 神经元动力学丰富度 + 同步化复杂度 |
| 关键资源 | 参数 × 数据 | 时间步 × 同步化模式多样性 |
| 扩展什么 | 层数、宽度 | 思维深度、动态多样性、同步拓扑 |
| 类比 | 更大的图书馆 | 更会思考的读者 |
这就导出一个激进的推论:
"参数量在 CTM 范式下的地位,大概等于'图书馆藏书量'相对于'读者的思考能力'。给你全人类最大的图书馆,一个不思考的读者什么也得不到。反过来,一个会深度思考的读者,一本好书就够了。"
CTM 如果要成功 scale,最优参数量可能远小于同等能力的 Transformer。但"卷"不会消失——只是从训练 FLOPs转向推理时的时序计算。竞争的焦点从"谁能训更大的模型"变成"谁能设计出更丰富的神经元动力学"。
CTM 可以花 5 步、50 步、500 步去想一个问题。一个 100 万参数的 CTM 想 1000 步,可能比 10 亿参数想 10 步更聪明。这个维度可以无限卷——而且和参数量几乎无关。
每个神经元的"历史记忆"有多深?能同时保持几种频率的振荡?这些决定了模型能表达多复杂的时序模式。增加这个维度不是加参数——是加每个神经元的计算复杂度。
哪些神经元和哪些同步?是全对全还是稀疏连接?拓扑结构是什么?这个维度的探索空间极大——而且目前完全是 open question。
没有中国团队发表过和 CTM 完全相同的工作。CTM 是 2025 年 5 月才出来的,时间上任何对标论文都还来不及。但中国在相关方向上有相当深厚的基础。
Nature Computational Science (2024.12):提出基于"内生复杂性(endogenous complexity)"的类脑神经元模型。核心思路和 CTM 高度吻合——不再使用简单 point neuron,而是让神经元内部拥有复杂动力学。联合清华、北大完成。
TPAMI 2025:脉冲驱动 Transformer。SNN 不可导问题的新解法。已发表 200+ 论文,引文 11000+。
Nature 2019 封面(天机芯):全球首款 ANN+SNN 异构融合芯片。
Nature 2024 封面(天眸芯):类脑互补视觉芯片。Dendristor(2024 Nature 子刊):树突网络计算架构。
德国科隆大学博士。新加坡科学院工作 17 年。2013 年回国创建清华类脑计算研究中心。
Science Advances (2025.02):基于 MOTT 忆阻器 + ECRAM 的可重构脉冲神经元。同一器件可动态模拟 LIF 神经元和振荡神经元——和 CTM 观察到的多频率涌现行为在原理上可对话。
达尔文系列芯片持续迭代中。
Science China Materials (2025):基于 ZnO 忆阻器的脉冲神经元。模拟 LIF + 振荡神经元。单脉冲能耗 1.442nJ。MNIST 准确率 89.17%。
美国押在 Transformer 上的筹码不是一个技术选择——是一整个国民经济发动机的转向:
这套体系之所以稳固,是因为它形成了一个四层正反馈循环:
整个循环有且仅有一个前提:GPU + Transformer 是最优解
如果 CTM 被证明是更优解——不需要 GPU、不需要 CUDA、不需要 3nm——整个循环就地断裂。不是"少赚点钱"。是体系级瓦解。
| 美国当前优势 | CTM 范式下的状态 |
|---|---|
| 芯片禁运(H100/B200 不卖给中国) | CTM 不需要这类芯片。神经形态芯片对制程依赖低。禁运逻辑失效 |
| CUDA 生态锁定(200 万开发者、二十年代码积累) | 神经形态芯片的编程模型和 CUDA 完全不兼容。生态积累归零。大家同一起跑线 |
| 标准主导(AI 安全评估框架、芯片出口规则) | 当前所有框架围绕"大模型参数量/训练算力"设计。CTM 用不同维度衡量能力——旧框架对不上新范式 |
如果 CTM 方向真在外部开花,美国的打压会更多样也更难防:
物理限制不认国籍。如果"基于时序同步的计算范式确实比密集矩阵乘法更高效"——这是一个物理事实,不是政策能改变的。一个世纪前,英国不可能通过政策让内燃机比蒸汽机低效。你可以延迟它、围堵它,但物理规律最终会说话。
美国的困境在于三个选项全亏:
真正改变范式的技术,往往不是被"打压"死的。是它自己——在旧范式还存在明显红利的时候——根本没人愿意转。
19 世纪末,伦敦马车产业投入巨资建设马厩、育马场、粪便清理系统。没人打压汽车。是马车产业自己选择"继续优化马的品种"。Transformer 现在的处境,就是那匹马——还在变强,还在变快。CTM,是那辆刚造出来到处抛锚的汽车。
| 国家/地区 | Transformer 时代的劣势 | CTM 时代的潜在优势 |
|---|---|---|
| 日本 | LLM 竞赛完全缺席,没有本土大模型 | Sakana AI 已经在做 CTM。没有 GPU 基建包袱,不需要"自宫" |
| 欧洲 | 除了 Mistral,基本是 AI 消费者 | 神经形态计算长期基础(ETH Zurich、Manchester SpiNNaker)。没有大厂利益绑定,学术转向快 |
| 中国 | 芯片被禁运,GPU 被阉割,生态被迫适配 | 两线作战可能:Transformer 线继续跟,类脑线另开一局。CTM 不需要被制裁的 GPU 生态。天机/天眸/李国齐等积累可立即投入 |
| 美国 | 全押 Transformer,四层正反馈锁死 | 没有 B 计划的空间。任何承认 CTM 可行性的动作都触发资产重定价 |
CTM 不是在现有赛道上优化变压器结构。是换了一个维度定义智能——从"静态模式存储"到"动态时序演化"。如果这个方向是对的,后果比任何一代芯片迭代都剧烈。
最可能的历史走向不是"美国全面封杀 CTM"那么戏剧化。更可能是静默博弈:美国顶级 AI 实验室在内部一定已经在跑相关实验,但公开发声和资源倾斜上继续全力推 Transformer Scaling。如果 CTM 某一天真展现了不可忽视的优势,美国的应对不会是"封杀"——会是"我们也一直在研究这个方向,现在我们宣布领先"。