⚡ CTM 连续思维机器:一场正在酝酿的范式颠覆

当 Llion Jones —— Transformer 论文的八位作者之一 —— 决定重新审视人工神经网络最基本的前提:把时间还给神经元。如果这条路走通,它将引发的不是一代芯片迭代,而是整个 AI 产业价值链的重构。本文从技术原理、算力瓶颈、参数逻辑、地缘格局四个维度,深度分析 CTM 的颠覆潜力。

📑 目录

  1. CTM 是什么:把时间还给神经元
  2. 核心创新:同步化作为计算原语
  3. CTM vs Transformer:三维度对比
  4. 涌现行为:迷宫追踪与自主注视
  5. 硬件困境:为什么 GPU 跑不动 CTM
  6. 参数量逻辑:从存储到思考
  7. 中国布局:类脑计算的基础积累
  8. 地缘博弈:旧赛道的引力与新赛道的窗口
  9. 沉没成本与局外人优势
  10. 诚实判断:机会、限制与时间窗口
  11. 核心资源与论文

⚡ 一、CTM 是什么:把时间还给神经元

项目详情
论文Continuous Thought Machines (CTM)
作者Luke Darlow, Ciaran Regan, Sebastian Risi, Jeffrey Seely, Llion Jones
机构Sakana AI(东京)
时间2025 年 5 月(v1),10 月更新
代码github.com/SakanaAI/continuous-thought-machines
互动报告pub.sakana.ai/ctm

Llion Jones 是 2017 年 "Attention Is All You Need" 的八位共同作者之一。那篇论文开创了 Transformer 时代。八年后,他在东京创办 Sakana AI,推出了一项可能颠覆他自己参与创造的范式的技术。

CTM 的核心命题非常简单,甚至可以说朴素:

1980 年代以来,人工神经元模型几乎没变过。每个神经元只输出一个标量 —— firing rate。但在生物大脑中,神经元什么时候放电、和谁一起放电、以什么节奏放电 —— 这些时序信息是智力的核心。CTM 做的事就是:给每个神经元访问自己历史行为的权限,让它们通过 synchronization(同步化) 来协调和推理。
💡 为什么叫 "Continuous"?因为 CTM 在一个内部的"思维维度"中持续运行,不等到外部输入才动。跟传统模型"输入 → 一次前向 → 输出"不同,CTM 可以在内部 time dimension 中多步推理。而且对静态数据(图像)和时序数据一视同仁 —— 都在连续时间上处理。

🧠 二、核心创新:Synchronization 作为计算原语

传统人工神经元的简化历史

从 1986 年 Rumelhart 的 Backpropagation,到 2012 年 AlexNet,到 2023 年的 GPT-4——所有这一切都建立在同一个神经元模型上:

output = activation( Σ(weight_i × input_i) + bias )

这个公式里没有 时间。没有历史。没有和其他神经元的同步关系。在生物学中至关重要的 spike-timing-dependent plasticity(STDP),在人工神经网络里完全不存在。

CTM 怎么改的

1

Neuron History Access

每个神经元不仅知道自己的当前状态,还能回溯自己的历史行为序列。不是"我现在是 0.7",而是"我过去 50 个 time step 里先后经历了 0.2→0.9→0.1→0.6→..."

2

Learned Temporal Behavior

神经元学会如何基于自己的历史来决定下一步输出。不只是"我看到了什么",还包括"我上次是什么时候激发的、和我激发的其他神经元有什么关系"

3

Synchronization as Representation

CTM 的核心表征不是某个神经元的输出值,而是神经元之间的同步化模式——谁和谁在同一频率振荡、谁的 spike timing 和谁的 aligned、谁是"领导者"谁是"跟随者"

🔥 关键区别:Attention 是 Token 级别的交互("这个词和那个词有什么关系")。CTM 的 Synchronization 是 Neuron 级别 的交互("这个神经元和那个神经元在时间上怎么协调")。Attention 是显式、架构级的设计。Synchronization 是涌现的、从 neuron dynamics 里自发生成的。

🔀 三、CTM vs Transformer:三维度对比

维度TransformerCTM
计算原语密集矩阵乘法(Attention + FFN)Neuron synchronization over time
智力来源参数量(更多旋钮 = 更细的模式切分)神经元动力学丰富度(更多时间步 = 更深的思考)
时间处理Positional Encoding(把时序硬编码为位置向量)原生时序维度(时间不是附加上去的,是计算的本质)
推理方式一次前向 pass → 输出内部连续时间步中多步推理 → 输出
Neuron 模型标量激活值(点神经元)有历史记忆的丰富动力学神经元
计算量训练时巨大,推理相对固定推理时取决于"想了多少步"——可伸缩
适配硬件GPU(天生为 GEMM 优化)目前没有天然适配的硬件
可解释性弱(Attention map 只能看 Token 关系)强(可以直接可视化神经元的时序行为)
生物相似度极低中高(但不追求精确模拟)

🔬 四、涌现行为:迷宫追踪与自主注视

CTM 论文最令人印象深刻的部分不是 benchmark 分数——是那些没有被显式训练但自发涌现的行为。这些行为暗示了更深层的智能机制。

迷宫求解:自己 "trace" 出路径

把一张迷宫图输入 CTM。在它的内部时间维度中,可以观察到 CTM 一步一步地沿着迷宫路径"追踪"——就像一个人用眼睛在迷宫中找路。这不是设计的,不是训出来的。是架构给了神经元时间维度后自发涌现的。

💡 这意味着什么:CTM 不是在"看一眼 → 算一下 → 输出答案"。它是在内部时间维度中模拟一个"在迷宫里走路"的过程。这比 Attention Map 那类"哪个词权重高"的可解释性深刻得多——你直接看到了模型怎么想的

图像理解:自主选择注视区域

给 CTM 一张照片。没有任何显式训练目标要求它这样做——但 CTM 会自己移动"目光",选择聚焦于场景中最显著的区域。这和人类的视觉注意力机制非常相似:我们不是同时看清一张图的所有像素,是眼球不断跳动、fovea 聚焦关键位置的。

神经元动力学的惊人丰富度

Sakana AI 团队对比了 CTM 和 LSTM 的神经元动态行为:

CTM 神经元传统 LSTM 神经元
不同频率的振荡相对单调、缺乏多样性
不同振幅的响应模式单一
单个神经元内出现多种频率几乎不存在
某些神经元只在"解题中"才活跃持续活跃
自发同步群组形成无明显同步行为
"It is worth stressing that all of these behaviours are completely emergent, were not designed into the model." —— Sakana AI 官方博客

🔧 五、硬件困境:为什么 GPU 根本跑不了 CTM

这是 CTM 面临的最大现实障碍——也是它最大的地缘战略变量。

全栈不匹配:从晶体管到 Python

层级GPU 优化了什么CTM 需要什么匹配度
计算单元GEMM(矩阵乘),Tensor Core 专为密集线性代数设计Neuron state update + pairwise synchronization🔴 极低
内存层次可预测的数据路径,预取友好,HBM 带宽最大化每个样本、每个 time step 的 neuron state 都在变,预取策略完全失效🔴 极低
并行模型SIMD/SIMT:同一指令,不同数据,32 个 CUDA core 一起做同样的事天然异构:不同神经元在不同时间步做完全不同的事🔴 极低
软件栈PyTorch autograd → CUDA kernel,为静态计算图优化动态 time loop 内的不规则梯度流🟡 勉强可用

那什么硬件天生支持 CTM?

目前没有。但如果要设计,特征大概是:事件驱动 + 细粒度异步 + 近存计算 + 稀疏通信 + 可能数模混合

三条已有的硬件路线在逼近

芯片/路线机构契合点当前差距
Intel Loihi 2Intel事件驱动 + 异步 spiking + 片上学习。每个 neurocore 独立 clock规模小,商用生态≈零
IBM TrueNorthIBM百万神经元级异步脉冲网络。功耗毫瓦级设计年代早,灵活性低
SpiNNaker曼彻斯特大学专门模拟生物神经元时序行为。可模拟 10 亿神经元学院项目,不以训练 AI 为目标
天机芯 (Tianjic)清华大学全球首款 ANN+SNN 异构融合芯片。Nature 2019 封面生态起步阶段
天眸芯 (Tianmouc)清华大学模拟人眼双通路。Nature 2024 封面。事件驱动视觉专用视觉,非通用计算
达尔文系列浙江大学类脑计算芯片,已迭代多代SNN 路线,与 CTM 理念相近但架构不同
⚠️ 核心瓶颈不是制程:神经形态芯片对尖端制程的依赖远低于 GPU。Intel Loihi 2 用的是 Intel 4(≈7nm),不需要 3nm。这意味着芯片禁运的逻辑在这个赛道上不完全成立。真正的瓶颈是架构设计和模拟电路能力——这不是光靠买最新光刻机能解决的。

短期和长期的不同答案

短期(3-5 年)

CTM 很难 scale 到 LLM 级别。从当前的迷宫/图像分类任务到 7B+ 参数模型,差约 9 个数量级。而且当前每一层 AI 软硬件都是为密集矩阵乘法优化的,换道需要的时间远超一代芯片周期。

长期(10 年+)

如果神经形态硬件或事件驱动架构成熟,CTM 可能从根本上比 Transformer 更高效。理由不是工程突破,是物理:人脑 20W 跑全部认知,GPT-4 训练一次用兆瓦时。效率差距 6-8 个数量级,其中的范式差异迟早要被弥合。

📐 六、参数量逻辑:从"存储更多模式"到"更会思考"

Transformer 的 Scaling Laws 建立在一个事实上:更多参数 = 更多模式存储容量。每个参数都是一个可调旋钮,把输入空间切得更细。

CTM 的智力来源完全不同:

TransformerCTM
智力来源参数量(存储容量)神经元动力学丰富度 + 同步化复杂度
关键资源参数 × 数据时间步 × 同步化模式多样性
扩展什么层数、宽度思维深度、动态多样性、同步拓扑
类比更大的图书馆更会思考的读者

这就导出一个激进的推论:

"参数量在 CTM 范式下的地位,大概等于'图书馆藏书量'相对于'读者的思考能力'。给你全人类最大的图书馆,一个不思考的读者什么也得不到。反过来,一个会深度思考的读者,一本好书就够了。"

CTM 如果要成功 scale,最优参数量可能远小于同等能力的 Transformer。但"卷"不会消失——只是从训练 FLOPs转向推理时的时序计算。竞争的焦点从"谁能训更大的模型"变成"谁能设计出更丰富的神经元动力学"。

三个新的"卷"维度

1

内部思维时间步(Think Depth)

CTM 可以花 5 步、50 步、500 步去想一个问题。一个 100 万参数的 CTM 想 1000 步,可能比 10 亿参数想 10 步更聪明。这个维度可以无限卷——而且和参数量几乎无关。

2

神经元动力学丰富度(Dynamic Diversity)

每个神经元的"历史记忆"有多深?能同时保持几种频率的振荡?这些决定了模型能表达多复杂的时序模式。增加这个维度不是加参数——是加每个神经元的计算复杂度。

3

同步化拓扑(Synchronization Topology)

哪些神经元和哪些同步?是全对全还是稀疏连接?拓扑结构是什么?这个维度的探索空间极大——而且目前完全是 open question。

🇨🇳 七、中国布局:类脑计算的基础积累

没有中国团队发表过和 CTM 完全相同的工作。CTM 是 2025 年 5 月才出来的,时间上任何对标论文都还来不及。但中国在相关方向上有相当深厚的基础。

关键研究者与团队

🔬 李国齐

中科院自动化所 · 脑认知与类脑智能重点实验室副主任 · 国家杰青

Nature Computational Science (2024.12):提出基于"内生复杂性(endogenous complexity)"的类脑神经元模型。核心思路和 CTM 高度吻合——不再使用简单 point neuron,而是让神经元内部拥有复杂动力学。联合清华、北大完成。

TPAMI 2025:脉冲驱动 Transformer。SNN 不可导问题的新解法。已发表 200+ 论文,引文 11000+。

🔬 施路平

清华大学 · 类脑计算研究中心主任 · SPIE Fellow

Nature 2019 封面(天机芯):全球首款 ANN+SNN 异构融合芯片。

Nature 2024 封面(天眸芯):类脑互补视觉芯片。Dendristor(2024 Nature 子刊):树突网络计算架构。

德国科隆大学博士。新加坡科学院工作 17 年。2013 年回国创建清华类脑计算研究中心。

🔬 潘纲 / 林芃

浙江大学 · 脑机智能全国重点实验室

Science Advances (2025.02):基于 MOTT 忆阻器 + ECRAM 的可重构脉冲神经元。同一器件可动态模拟 LIF 神经元和振荡神经元——和 CTM 观察到的多频率涌现行为在原理上可对话。

达尔文系列芯片持续迭代中。

🔬 傅邱云 / 郭新

华中科技大学

Science China Materials (2025):基于 ZnO 忆阻器的脉冲神经元。模拟 LIF + 振荡神经元。单脉冲能耗 1.442nJ。MNIST 准确率 89.17%。

三段尚未打通

⚠️ 结构性问题:中国在器件层(华科/浙大的忆阻器)、芯片层(清华天机/天眸)、算法层(中科院 SNN 训练方法)各有突破——但三层之间衔接不紧密。器件论文发在材料期刊,算法论文发在 AI 会议,两边并不对话。CTM 要 scale,恰恰需要这三层的紧耦合。软件生态(编译器、训练框架、调试工具)的差距尤其明显。

🌍 八、地缘博弈:旧赛道的引力与新赛道的窗口

美国的 "Transformer 陷阱"

美国押在 Transformer 上的筹码不是一个技术选择——是一整个国民经济发动机的转向:

~$4T
Nvidia 峰值市值
$800B+
微软 2025 资本开支
200 万+
CUDA 开发者
20 年
CUDA 生态积累

这套体系之所以稳固,是因为它形成了一个四层正反馈循环

Nvidia GPU 生态 云厂商营收
微软/谷歌/AWS
AI Lab 领先
OpenAI/Anthropic
美国话语权
标准·人才·芯片管制

整个循环有且仅有一个前提:GPU + Transformer 是最优解

如果 CTM 被证明是更优解——不需要 GPU、不需要 CUDA、不需要 3nm——整个循环就地断裂。不是"少赚点钱"。是体系级瓦解

CTM 系统性消解美国的三重优势

美国当前优势CTM 范式下的状态
芯片禁运(H100/B200 不卖给中国)CTM 不需要这类芯片。神经形态芯片对制程依赖低。禁运逻辑失效
CUDA 生态锁定(200 万开发者、二十年代码积累)神经形态芯片的编程模型和 CUDA 完全不兼容。生态积累归零。大家同一起跑线
标准主导(AI 安全评估框架、芯片出口规则)当前所有框架围绕"大模型参数量/训练算力"设计。CTM 用不同维度衡量能力——旧框架对不上新范式

打压手段不会只是芯片禁运

如果 CTM 方向真在外部开花,美国的打压会更多样也更难防:

但有一个变量美国控制不了

物理限制不认国籍。如果"基于时序同步的计算范式确实比密集矩阵乘法更高效"——这是一个物理事实,不是政策能改变的。一个世纪前,英国不可能通过政策让内燃机比蒸汽机低效。你可以延迟它、围堵它,但物理规律最终会说话。

美国的困境在于三个选项全亏

💰 九、沉没成本与局外人优势

一个被低估的规律

真正改变范式的技术,往往不是被"打压"死的。是它自己——在旧范式还存在明显红利的时候——根本没人愿意转。

19 世纪末,伦敦马车产业投入巨资建设马厩、育马场、粪便清理系统。没人打压汽车。是马车产业自己选择"继续优化马的品种"。Transformer 现在的处境,就是那匹马——还在变强,还在变快。CTM,是那辆刚造出来到处抛锚的汽车。

局外人优势:谁的沉默成本最轻

国家/地区Transformer 时代的劣势CTM 时代的潜在优势
日本LLM 竞赛完全缺席,没有本土大模型Sakana AI 已经在做 CTM。没有 GPU 基建包袱,不需要"自宫"
欧洲除了 Mistral,基本是 AI 消费者神经形态计算长期基础(ETH Zurich、Manchester SpiNNaker)。没有大厂利益绑定,学术转向快
中国芯片被禁运,GPU 被阉割,生态被迫适配两线作战可能:Transformer 线继续跟,类脑线另开一局。CTM 不需要被制裁的 GPU 生态。天机/天眸/李国齐等积累可立即投入
美国全押 Transformer,四层正反馈锁死没有 B 计划的空间。任何承认 CTM 可行性的动作都触发资产重定价
💡 中国处在一个独特位置:不是完全的局外人,也不是彻底的局内人。这反而是最优位置。Transformer 线继续追(DeepSeek 证明制裁下也能做世界级模型),类脑线另开一局(施路平、李国齐的工作天然不需要一堆 H100)。两条线并行,至少比"全押一边"更抗风险。而美国没有这个选项。

🧭 十、诚实判断:机会、限制与时间窗口

🎯 核心判断

CTM 不是在现有赛道上优化变压器结构。是换了一个维度定义智能——从"静态模式存储"到"动态时序演化"。如果这个方向是对的,后果比任何一代芯片迭代都剧烈。

最可能的历史走向不是"美国全面封杀 CTM"那么戏剧化。更可能是静默博弈:美国顶级 AI 实验室在内部一定已经在跑相关实验,但公开发声和资源倾斜上继续全力推 Transformer Scaling。如果 CTM 某一天真展现了不可忽视的优势,美国的应对不会是"封杀"——会是"我们也一直在研究这个方向,现在我们宣布领先"。

CTM 当前面临的三重 Gap

  1. Scale Gap:从迷宫到通用智能差了 9 个数量级。没有任何 evidence 证明 CTM 的动态能 scale。历史上太多小规模优雅、大规模崩塌的案例了
  2. Hardware Gap:全栈不匹配。CTM 的计算需求在物理上和 GPU 逆向。需要新的硬件原语,而这需要 10 年+ 的时间尺度
  3. Training Gap:CTM 目前的训练方法(如何让这些动态神经元学习复杂任务)还不成熟。Sakana AI 论文只展示了相对简单的监督学习任务

但为什么这个方向值得认真关注

📚 十一、核心资源与延伸阅读

CTM 相关

中国类脑计算相关

神经形态硬件

CTMContinuous Thought MachineLlion Jones Sakana AINeuron DynamicsSynchronization 类脑计算神经形态芯片Transformer 替代 范式转移李国齐天机芯地缘科技