AI思想图谱Research trajectories
架构与系统21 分钟
12

架构与系统 · RESEARCH TRAJECTORY

Tri Dao 与 Albert Gu:在数学结构、记忆容量和 GPU 数据流之间重写序列模型

导读

从 HiPPO、S4 与 FlashAttention,到 Mamba、状态空间对偶与 inference-first 设计。

Dao 与 Gu 不主要回答“智能是什么”,却决定许多智能理论能否以现实成本运行。Gu 从控制理论和 HiPPO 追问:有限维状态怎样压缩一条无限增长的历史;Dao 从结构矩阵与 GPU 系统追问:一个纸面上更省 FLOPs 的算法,怎样真正减少显存搬运并跑得更快。两条线在 Mamba 汇合:用输入选择性的递归状态替代部分注意力,再通过 State Space Duality 把递归、结构矩阵和 attention 放进同一框架。其最深判断不是“Mamba 会杀死 Transformer”,而是:架构、并行算法、内存层级和训练/解码场景必须一起设计。

一、先把他们的问题放在正确层级

谈 LLM 架构时,公众常把候选分成:

  • Transformer;
  • RNN;
  • state space model;
  • linear attention;
  • convolution;
  • hybrid。

Dao 与 Gu 的工作说明这些标签容易遮蔽真正结构。一个序列算子可以从至少三种视角理解:

  1. 递归视角: 当前状态怎样由旧状态和新输入更新;
  2. 矩阵视角: 整条序列输入乘以什么结构矩阵得到输出;
  3. 系统视角: 这项计算在 GPU 上怎样分块、搬运、融合和并行。

同一数学函数可能有:

  • 适合并行训练的表示;
  • 适合逐 token 解码的表示;
  • 适合某代 GPU 的 kernel;
  • 适合理论分析的矩阵分解。

因此真正问题不是“哪一阵营正确”,而是:

  • 需要保留多少历史信息;
  • 是否必须精确回看任意 token;
  • 状态大小怎样随长度增长;
  • 训练能否并行;
  • decode 每步搬多少数据;
  • 硬件能否高利用率执行;
  • 质量—延迟—内存的 Pareto 前沿在哪里。

二、Albert Gu 的起点:有限维状态怎样记住连续历史

1. 递归记忆本质上是一种压缩

考虑序列输入 u₁, u₂, …。一个 RNN 维护固定维状态 hₜ:

ht=f(ht1,ut)h_t = f(h_{t-1}, u_t)

无论历史有多长,所有过去信息都必须压进 hₜ。

这带来根本 trade-off:

  • 固定状态使解码成本不随上下文线性增长;
  • 但状态容量有限,不可能无损保存任意长序列;
  • 学习必须决定保留什么、遗忘什么;
  • 长程梯度与数值稳定困难。

Transformer attention 采用相反方案:

  • 保留每个过去 token 的 key/value;
  • 当前 query 可直接回看;
  • 精确内容寻址强;
  • KV cache 随长度增长;
  • 全序列训练 attention 成本二次。

Gu 的研究从控制理论问:能否让固定状态压缩具有更有原则的数学形式,而不是让普通 RNN 随机学一个黑箱 memory?


三、HiPPO:把“记住过去”表述为在线函数逼近

HiPPO(High-order Polynomial Projection Operators)的核心问题是:

当一个连续信号不断到来,怎样用有限个系数在线表示迄今历史,使重建误差在某个加权准则下尽可能小?

1. 不是记每个时刻,而是记一组基函数系数

假设用正交多项式基底近似过去函数:

  • 低阶系数描述平滑、全局趋势;
  • 高阶系数描述更细变化;
  • 新输入到来时,系数递归更新;
  • 固定 N 个系数给出受控的历史压缩。

这类似把一段很长声音不逐样本保存,而保存它在一组适当基函数上的投影。

2. 为什么正交投影比任意 RNN 更有原则

它提供:

  • 明确记忆目标;
  • 可分析的状态转移矩阵;
  • 不同时间尺度;
  • 连续时间形式;
  • 与控制系统和信号处理的连接。

状态不是“希望神经网络自己学会记忆”,而是先给一种数学上最优的历史摘要,再让模型学习怎样使用。

3. 它仍然是有损压缩

固定 N 维只能保留某个函数族的最佳近似。若任务需要原样记住某个很早出现的随机 token,低维投影可能丢失。

这条边界一直延伸到 Mamba:状态空间模型擅长压缩统计历史,不天然等价于 attention 的任意内容检索。


四、从连续状态空间到序列层:S4 的理论与工程突破

S4: Efficiently Modeling Long Sequences with Structured State Spaces从连续线性系统出发:

x(t)=Ax(t)+Bu(t)y(t)=Cx(t)+Du(t)\begin{aligned} x'(t) &= A x(t) + B u(t) \\ y(t) &= C x(t) + D u(t) \end{aligned}

离散化后得到:

xt=Aˉxt1+Bˉutyt=Cxt+Dut\begin{aligned} x_t &= \bar{A} x_{t-1} + \bar{B} u_t \\ y_t &= C x_t + D u_t \end{aligned}

1. 同一个线性系统有递归和卷积两种形态

递归展开可得到:

y=Kuy = K * u

其中卷积核 K 由 CĀᵏB̄ 组成。

这带来关键双形态:

  • 训练时: 整条序列可用卷积并行;
  • 推理时: 保持 state 逐步递归;
  • 参数相同: 两种算法表示同一线性系统。

传统 RNN 训练串行;普通长卷积 kernel 生成和计算又昂贵。S4 的目标是使二者都高效。

2. 为什么 A 矩阵的结构决定可计算性

一般 N×N 状态矩阵:

  • 幂次计算昂贵;
  • 数值可能不稳定;
  • 卷积核生成慢;
  • 训练难扩展。

S4 利用 HiPPO 导出的结构,并把 A 参数化为 diagonal plus low-rank(DPLR)形式。通过稳定对角化与 Cauchy kernel 技巧,能高效计算长卷积核。

这是典型的数学—系统共同设计:

  • 状态矩阵不能完全自由;
  • 选择适当结构减少复杂度;
  • 结构又保留长程记忆性质;
  • 才能在 GPU 上训练。

3. S4 的实证意义

论文在 Long Range Arena、序列 CIFAR、音频和语言等任务上显示强结果,并处理长度 10,000 以上序列。

重要意义不是某个榜单长期保持,而是重新打开一条路线:

  • 递归模型可以并行训练;
  • 控制理论状态空间可成为通用神经层;
  • 长序列不必只有二次 attention;
  • 结构化线性动力学加非线性 mixing 可以很有表达力。

4. S4 的局限

  • DPLR/Cauchy kernel 实现复杂;
  • 线性时间不自动等于 GPU 快;
  • 语言上的 content-based selection 弱;
  • 早期结果多在中小规模;
  • 不同任务需要状态大小和初始化调节;
  • 固定线性 dynamics 难根据 token 决定保留/遗忘。

最后一点直接催生 Mamba。


五、Tri Dao 的起点:FLOPs 不是 GPU 时间的充分统计量

在理论论文中,算法常按:

  • O(n²);
  • O(n log n);
  • O(n);

比较。但现代 GPU 的时间不仅由乘加数量决定,还受:

  • HBM 带宽;
  • SRAM / shared memory;
  • register;
  • kernel launch;
  • tensor core 利用率;
  • 数据布局;
  • 并行度;
  • 重计算与存储 trade-off。

1. GPU 为什么经常在“搬数据”,而不是“做计算”

高带宽显存 HBM 容量大,但离计算单元远;片上 SRAM 小得多,却快。若算法不断:

  1. 从 HBM 读矩阵;
  2. 做少量运算;
  3. 写回巨大中间结果;
  4. 下一 kernel 再读;

即使 FLOPs 不高,墙钟也可能很慢。

2. IO complexity 是真正系统成本的一部分

Dao 的核心判断是:

算法若没有说明数据在内存层级怎样移动,就没有完整说明它的效率。

这不只是 kernel 工程细节。它会反过来决定:

  • 哪些数学分解值得用;
  • 是否应重计算中间量;
  • tile 大小;
  • 精度;
  • 算子融合;
  • 架构层形状。

六、FlashAttention:不近似 attention,只改变精确计算的数据流

FlashAttention最常见误解是“把二次 attention 变成线性”或“做稀疏近似”。都不对。

它计算的仍是精确 softmax attention:

softmax(QKT)V\operatorname{softmax}(QK^{\mathsf T})V

时间复杂度仍有 n² 项。突破在于避免把完整 n×n attention matrix 写入 HBM。

1. 标准实现的 IO 问题

朴素流程会:

  1. 计算 S = QKᵀ;
  2. 把 S 写到 HBM;
  3. 读 S 做 softmax;
  4. 写概率 P;
  5. 再读 P 与 V 相乘。

序列长时,中间矩阵巨大,读写成为瓶颈。

2. Tiling:把 Q、K、V 分块搬进片上存储

FlashAttention 按块处理:

  • 一小块 Q 常驻 SRAM;
  • 依次加载 K/V 块;
  • 计算局部 scores;
  • 在线更新 softmax 统计;
  • 累积输出;
  • 不落地完整 attention matrix。

3. Online softmax 为什么关键

Softmax 需要全行最大值和归一化和。分块时一开始看不到所有 key。

算法维护:

  • 当前最大值 m;
  • 当前指数和 l;
  • 当前加权输出 o。

新块到来后,用新的最大值重新缩放旧累计量,再加入新块贡献。最终结果与完整 softmax 数值等价。

4. Backward 为什么可以“重计算而不是存储”

传统直觉是为了省算力应保存 attention probability。FlashAttention 发现:

  • HBM IO 比额外 FLOPs 更贵;
  • backward 时用保存的 softmax 统计重算局部 scores;
  • 增加计算,减少内存读写;
  • 实际反而更快且省显存。

这是一个很重要的系统原则:

最少 FLOPs 不一定最快;在现代硬件上,用便宜计算换昂贵数据移动常更优。

5. FlashAttention 的历史意义

它没有提出新注意力语义,却显著:

  • 延长可训练上下文;
  • 降低显存;
  • 提高训练/推理吞吐;
  • 成为前沿 LLM 基础 kernel;
  • 让 IO-aware 进入架构研究中心。

它说明基础研究贡献不必改变模型公式;改变公式在真实硬件上的可执行边界,同样会改变领域。


七、FlashAttention 后续:每代硬件都可能重写最佳算法

1. FlashAttention-2:提高并行和工作划分

后续版本减少非矩阵乘操作、改善 warp / thread block 划分,使 tensor core 利用更高。

2. FlashAttention-3:异步与低精度

Hopper GPU 提供异步数据移动、warp specialization 与 FP8 等能力。FlashAttention-3 通过流水化:

  • 数据搬运;
  • matrix multiply;
  • softmax;

让不同硬件单元并行工作,并处理低精度误差。

3. FlashAttention-4:非 GEMM 瓶颈重新变重要

2026 年的 FlashAttention-4针对新硬件的非对称 scaling:矩阵乘变得极快后,softmax、数据搬运和调度可能成为更大比例瓶颈。

其核心不是再说“GEMM 越快一切越快”,而是:

  • pipeline matmul 与非 matmul;
  • 利用新 memory / tensor memory;
  • 设计数据布局;
  • 避免硬件单元空转。

论文/博客报告在 B200 BF16 上达到很高利用率,并超过当时 cuDNN/Triton 对照。

4. 这说明“硬件感知”不是一次优化

一个 kernel 在 A100 最优,未必在 H100/B200 最优。架构和实现必须随:

  • 计算/带宽比;
  • cache;
  • 低精度;
  • 异步指令;
  • 网络互联;

变化而重做。

因此不能把某论文中的速度数字当作永久算法属性。


八、Mamba 之前的关键失败:线性 SSM 不知道当前 token 是否值得记

传统线性时不变 SSM 的 A、B、C 基本不依赖输入内容。它对所有位置使用相同动态。

这在连续信号上合理,但离散语言需要选择:

  • 遇到分隔符时重置某些状态;
  • 看到姓名时长期记住;
  • 跳过填充;
  • 根据当前 token 决定写入哪类记忆;
  • 在复制任务中保留指定片段。

1. Content-based reasoning 是 attention 的核心优势

Attention 的权重由当前 query 与过去 key 的内容相似决定。模型可直接找到:

  • 前文某个变量定义;
  • 同名实体;
  • 匹配括号;
  • 相关指令。

固定卷积/线性 recurrence 的 kernel 主要依赖距离,很难做同样选择。

2. Gu 与 Dao 对失败的诊断

Mamba明确指出许多 subquadratic 模型在语言上落后,是因为缺少 content-based reasoning。

解决不是加回完整 attention,而是让 SSM 参数随输入变化,使当前 token 控制:

  • 写什么;
  • 忘什么;
  • 读出什么;
  • 时间步尺度。

九、Mamba-1:选择性状态空间怎样工作

1. 输入依赖参数

Mamba 让 B、C 和离散时间步 Δ 等由当前输入产生。

直观上:

  • Δ 控制状态衰减/保持速度;
  • B 控制当前输入怎样写进状态;
  • C 控制从状态读出哪些信息。

因此同一个通道在不同 token 上可:

  • 快速遗忘;
  • 长期保留;
  • 选择性写入;
  • 选择性输出。

2. 为什么选择性破坏了原 S4 卷积捷径

若 A/B/C 固定,整个序列是 time-invariant convolution,可用 FFT/并行卷积。

参数依赖每个输入后,kernel 也随位置变化,不能预先生成一个统一卷积核。模型回到 time-varying recurrence。

3. Selective scan:让变时递归仍能并行训练

Mamba 设计硬件感知 parallel scan:

  • 利用递归更新的结合结构;
  • 分块计算;
  • kernel 融合;
  • 避免把大状态中间量写回 HBM;
  • backward 重计算部分状态。

这正是 Gu 与 Dao 两条线的交汇:

  • 数学上加入内容选择;
  • 算法上找到并行表示;
  • 系统上减少 IO;
  • 推理时仍保持固定 state。

4. Mamba block 的激进简化

原论文构造不含 attention、甚至不依赖传统独立 MLP block 的 backbone,用 selective SSM 与门控投影组成层。

报告的优势包括:

  • 序列长度近线性 scaling;
  • 自回归 decode 固定状态;
  • 语言、音频、基因组多模态;
  • 中小规模语言模型具竞争力。

5. 它为什么引发巨大关注

推理服务中的 KV cache 随:

  • batch;
  • 层数;
  • head;
  • context length;

增长,成为成本中心。Mamba 每层保持固定 state,理论上特别适合长 decode。

同时它不是退回旧 RNN,而是:

  • 可并行训练;
  • 输入选择性;
  • GPU kernel co-design;
  • 大规模语言实证。

十、Mamba-1 的边界:固定状态是一项优势,也是一项信息瓶颈

1. 精确回忆

若需要从百万 token 前原样取回一个随机字符串,attention 可保留对应 KV;固定 state 必须把它编码进有限容量,与其他信息竞争。

2. 多约束推理

长代码或证明中,模型要同时维护许多变量、定义和例外。状态压缩可能:

  • 覆盖旧信息;
  • 混淆相似实体;
  • 无法随机访问;
  • 在长 chain 中逐步漂移。

3. In-context learning

Transformer 把上下文样本直接保留,当前 token 可按内容匹配。递归模型必须把示例吸收进 state,功能上更接近 online learner。它可能更高效,也可能难保留细节。

4. 硬件效率不是自动线性

Parallel scan 有依赖和小矩阵操作,GPU 对大 GEMM 最优化。即使渐近 O(n),在中等长度和大 batch 下可能不如高度优化 attention。

这促使 Mamba-2 反向增加更多矩阵结构,以利用硬件。


十一、State Space Duality:attention 与 SSM 其实是结构矩阵的不同切面

Transformers are SSMs / Mamba-2提出 State Space Duality(SSD)。

标题容易被误读为“所有 Transformer 就是普通 SSM”。更准确是:

  • 一类选择性 SSM;
  • 一类结构化 masked attention;
  • 都对应 semiseparable matrices;
  • 在特定结构下两种公式精确等价;
  • 这种 duality 可导出新模型与算法。

1. 从矩阵视角看递归

将线性递归展开,输出 yₜ 是过去所有输入 xₛ 的加权和。整个序列可写成一个下三角矩阵 M 乘 X。

这个 M 不是任意 dense matrix;其离对角块具有低秩/semiseparable 结构,由状态转移的乘积产生。

2. 从 attention 视角看同一个矩阵

某些 linear attention / structured masked attention 也产生:

M=L(CTB)M = L \circ (C^{\mathsf T}B)

其中 L 表示因果衰减 mask,CᵀB 提供低秩内容交互。

于是:

  • 递归视角强调 state passing;
  • attention 视角强调矩阵乘;
  • 结构矩阵视角说明它们何时是同一函数。

3. 理论统一为什么有工程价值

它允许在不同阶段选算法:

  • 序列块内部用大矩阵乘;
  • 块之间传递 state;
  • 训练利用 tensor core;
  • decode 使用 recurrence;
  • 复用 Transformer 的 tensor/sequence parallelism;
  • 处理 variable length。

理论不是为统一而统一,而是解锁更合硬件的实现。


十二、Mamba-2:有时“更强的数学结构约束”反而带来更强规模性能

Mamba-1 的状态转移 A 在每通道上可为对角结构;Mamba-2/SSD 对 A 施加更强的 scalar-times-identity 结构,并引入类似 head 的较大块。

直觉上,更强约束似乎降低表达力。为什么反而更好?

1. 更规则结构可转成大 GEMM

GPU 最擅长:

  • 大、密集矩阵乘;
  • 规则内存访问;
  • 高并行。

较复杂逐通道 recurrence 可能理论表达更丰富,却产生小操作、scan 和低利用率。

SSD 把计算重排为 chunked matrix multiply + state passing,训练可 2–8 倍更快。

2. 更快训练可以换更多数据与模型

架构质量不能只看同一步数的单层表达力。若更规则模型:

  • 墙钟更快;
  • 更稳定;
  • 更容易并行;
  • 能训练更多 token;

整体性能可能更高。

这是一条重要 scaling lesson:

归纳偏置的优劣必须与硬件可扩展性共同评价。

3. Hybrid 结果比“纯 SSM 胜利”更重要

Dao 的Mamba-2 系统文章报告,在 2.7B 参数、300B token 设置中,只有少量 attention block(例如 6 attention + 58 SSD)的 hybrid 优于纯 SSD,也优于其 Transformer++ baseline。

这说明:

  • 大部分序列混合可由高效递归/SSD 完成;
  • 少量 attention 提供精确内容回看;
  • 最优解很可能是混合,而非阵营全替代。

4. State Space Duality 改变了问题提法

以后不必只问:

  • attention 还是 recurrence?

而可问:

  • 哪些结构矩阵;
  • 哪些 block placement;
  • 哪些状态维度;
  • 哪种 chunk;
  • 哪些层保留精确 KV;
  • train/prefill/decode 分别用什么算法。

十三、Mamba-3:把 inference-first 与经典控制理论重新带回设计中心

2026 年 Mamba-3 Part 1方法深挖明确说,Mamba-2 主要解决训练效率;Mamba-3 将性能—状态大小—解码延迟的 Pareto 前沿放在中心。

1. 为什么推理时代改变目标函数

预训练时代,最主要成本可能是训练吞吐。Reasoning / agent 时代,一个输入会产生:

  • 数千到数万内部 token;
  • 长工具轨迹;
  • 多候选;
  • 长时间持续上下文。

总成本越来越由 decode 决定。架构若每 token 都读取巨大 KV cache,内存带宽和容量会主导。

固定 state recurrence 因而获得新的经济价值。

2. 改进一:更正式的连续—离散 recurrence

早期 Mamba 将经典 zero-order hold 离散化中的固定变量推广成 time-varying,理论基础并不完全令人满意。

Mamba-3 从更一般的 exponential-trapezoidal discretization 推导新 recurrence,使当前与前一输入以结构化方式共同影响状态。

这不是只换公式,而是试图获得:

  • 更丰富动态;
  • 仍可并行;
  • 仍可快速 decode;
  • 更稳定的控制理论解释。

3. 改进二:complex-valued state dynamics

实值纯衰减 state 擅长低通记忆,但复杂时间模式和状态追踪可能需要振荡/旋转动态。

复数 eigenvalue 可自然表达:

  • 周期;
  • 相位;
  • 旋转;
  • 更丰富 memory trace。

Mamba-3 以避免显式复数工程负担的方式引入相关能力,提高 state tracking。

4. 改进三:MIMO 而非单输入单输出状态系统

早期 Mamba 的每个状态系统更接近 SISO。Mamba-3 引入多输入多输出(MIMO)结构:

  • 多个通道共同写入/读出;
  • 在不同比例的参数与状态成本下提高表达;
  • 让训练可稍贵,但 decode state size 不相应增长。

团队报告在约 1B 等受控规模上,MIMO 提高下游质量,且状态大小—性能 Pareto 优于 Mamba-2。

5. 为什么这是一种“经典理论回归”

许多现代 linear attention 从矩阵技巧出发;Mamba-3 的三项改进都明确受传统 state space / control literature 启发。

这说明创新不一定只来自更现代的神经模块。旧理论在新硬件、规模与目标函数下,可能获得新的工程形式。

6. 仍应保持的尺度谨慎

截至 2026 年的公开结果不能证明:

  • Mamba-3 已在最前沿万亿参数训练中替代 Transformer;
  • 固定 state 解决任意长精确 recall;
  • 所有硬件都保持同样延迟优势;
  • reasoning quality 因更便宜 decode 自动提高。

它推进了受控 Pareto 前沿,不是终局宣判。


十四、他们对“记忆”的真正判断:压缩与随机访问必须分工

1. Attention 像内容可寻址外存

  • 保存过去 token 的 key/value;
  • query 决定读哪里;
  • 容量随长度增长;
  • 精确细节保留强;
  • 成本随历史增大。

2. SSM 像固定容量工作状态

  • 每步更新;
  • 自动压缩;
  • decode 成本固定;
  • 适合流式;
  • 可能遗忘精细内容。

3. 人类认知也可能需要两者

人不会把所有感官逐帧放在工作记忆,但可借:

  • 外部笔记;
  • episodic memory;
  • 搜索;
  • 环境;

恢复细节。

未来 LLM 架构可能类似:

  • SSM / recurrence 保持连续摘要;
  • 局部 attention 处理近期;
  • 稀疏 global attention 处理关键 token;
  • retrieval 访问外部长期记忆;
  • tool state 保留精确变量。

因此最合理预测不是纯 SSM,而是 memory hierarchy。


十五、训练、prefill、decode 是三个不同系统问题

1. Training

  • 全序列已知;
  • 可并行;
  • 需要保存/重算激活;
  • backward 成本重要;
  • 大 batch;
  • 通信成为瓶颈。

2. Prefill

  • 输入 prompt 已知;
  • 可矩阵化处理;
  • 目标是快速建立 KV/state;
  • 长 prompt latency 重要。

3. Decode

  • 每次只来一个新 token;
  • batch 可能动态;
  • 权重和 cache 读取主导;
  • kernel 很小;
  • latency 与吞吐 trade-off;
  • reasoning 模型会重复数千步。

一个架构可能:

  • training 很快;
  • prefill 一般;
  • decode 极快;

或相反。

Dao/Gu 最重要的系统纪律是:不要用一个平均 tokens/s 覆盖三个阶段,也不要用理论序列复杂度代替实际服务成本。


十六、他们的世界观:模型层首先是一个结构化线性算子,再由非线性和数据选择赋予语义

1. 很多序列模型可被统一成结构矩阵

Convolution、recurrence、linear attention、masked attention 都是在序列维施加不同结构矩阵。

关键属性包括:

  • Toeplitz;
  • low-rank;
  • semiseparable;
  • diagonal plus low-rank;
  • causal mask;
  • data-dependent entries。

选择结构决定:

  • 表达;
  • 记忆;
  • 算法;
  • 硬件。

2. 结构越自由,未必越强

完全 dense attention 表达自由,但成本高;过强固定结构成本低,却可能无法内容选择。

真正设计是在:

  • 自由度;
  • 可学习性;
  • 数值稳定;
  • 并行算法;
  • kernel 利用;

之间找 Pareto。

3. 实现不是论文结尾,而是理论的一部分

FlashAttention 与 Mamba 都证明:

  • 没有 kernel,线性理论可能更慢;
  • IO 分析可推动新算法;
  • 硬件原语会塑造参数化;
  • 一个模型是否可扩展必须看端到端墙钟。

这是他们对 AI 研究文化很重要的修正。


十七、与其他路线的关系

1. 与 LeCun:不是智能理论竞争者,而是可能的底层执行层

LeCun 认为当前 LLM 的根本问题在学习目标、世界模型与规划。即使把 next-token Transformer 算快十倍,也未必得到物理理解。

Dao/Gu 解决的是:

  • 长序列状态;
  • 高效算子;
  • 固定状态解码;
  • attention kernel。

他们的技术可服务任何高层理论:

  • JEPA world model;
  • 机器人视频;
  • planning trajectory;
  • multimodal memory;
  • autoregressive LLM。

所以 Mamba 不是对 LeCun 路线的替代,而是决定其是否能在长时序上经济运行的候选骨干。

2. 与 Hinton:同样相信硬件会反过来塑造学习算法

Hinton 的 mortal computation 更激进:

  • 软件与模拟硬件不可分;
  • 每块设备自己学习。

Dao 更现实主义:

  • 接受数字 GPU;
  • 研究其 memory hierarchy、tensor core 和异步流水;
  • 在现有可复制生态中 co-design。

二者共享“算法不能脱离物质”,但时间尺度与风险完全不同。

3. 与 Karpathy:最小算法核与生产性能的两端

Karpathy 用 microgpt 说明 GPT 算法本质很短;Dao 说明从 200 行公式到前沿吞吐之间,数据流和 kernel 绝非次要。

两者合起来才完整:

  • 最小实现防止把框架复杂度当理论;
  • kernel 实现防止把纸面复杂度当真实速度。

4. 与 Sutton / world-model 路线:固定 state 是持续 agent 的自然内存候选

持续 agent 不能让上下文无限增长。SSM 提供:

  • streaming update;
  • 固定 memory;
  • 长时间运行;
  • 动态选择。

但真正 continual learning 还需:

  • 权重可塑性;
  • episodic retrieval;
  • 防遗忘;
  • 新任务迁移。

Mamba 的 hidden state 是序列上下文,不等于 Sutton 所说的终身学习记忆。


十八、判断记录:哪些已被验证,哪些仍未定

A. “IO 与内存层级和 FLOPs 同等重要”

结论:决定性命中。

FlashAttention 已成为前沿训练/推理基础设施;重计算换 IO、tiling 与 kernel fusion 是标准方法。

B. “连续状态空间模型能成为通用长序列骨干”

结论:S4/Mamba 已给强证据。

语言、音频、基因组、视觉等均有应用。是否在所有前沿任务优于 Transformer 未证明。

C. “Content selectivity 是线性 SSM 进入语言的关键”

结论:Mamba-1 强力支持。

输入依赖动态显著改善离散序列任务。选择性的精确能力与 attention 仍有差距。

D. “Attention 与 SSM 可在统一结构矩阵框架中理解”

结论:理论命中。

SSD 给出精确等价类,并导出更快算法。它不意味着任意 softmax Transformer 都被固定小 state 无损替代。

E. “纯 SSM 会取代 Transformer”

结论:公开证据反而支持 hybrid。

少量 attention + 多数 SSD 的结果很有吸引力;精确 recall 与大规模生态使 attention 仍重要。

F. “推理时计算会让固定状态架构价值上升”

结论:经济逻辑强,前沿采用仍需观察。

长 decode 和 KV cache 确实成为成本中心。模型质量、batching 与硬件支持会决定实际选择。

G. “Mamba-3 已解决 state tracking”

结论:推进但未解决。

复杂状态、MIMO 和新 discretization 改善 Pareto;任意长、精确、多约束记忆仍不可能由有限状态无损保证。


十九、他们最强的论证与最弱的外推

最强论证:算法复杂度只有在映射到内存层级和并行原语后,才成为现实可扩展性

FlashAttention 是几乎教科书级证据:

  • 同一数学结果;
  • 甚至增加部分重计算;
  • 因减少 HBM IO 而大幅更快、省内存。

这条原则适用于几乎所有 AI 架构评价。

最弱外推:固定维 recurrent state 能在不损质量的情况下承担任意超长上下文

信息论上,固定有限状态不能无损保存无限随机历史。模型只能:

  • 压缩任务相关统计;
  • 依靠 learned selective memory;
  • 将细节放到外部存储;
  • 偶尔使用 attention/retrieval。

如果 benchmark 只测困惑度或平滑长期依赖,可能掩盖精确 recall 失败。真正竞争会在 memory hierarchy,而不是口号式线性长度。


二十、看“高效架构”论文时应检查什么

1. 对比是否公平

  • 同参数量;
  • 同训练 token;
  • 同数据;
  • 同 optimizer;
  • 同调参预算;
  • 同墙钟或同 FLOPs;
  • 同 tokenizer;
  • 同下游评测。

2. 速度是什么速度

  • kernel microbenchmark;
  • 单层 forward;
  • 端到端训练;
  • prefill;
  • decode;
  • batch throughput;
  • 单请求 latency。

这些数字不可互换。

3. 硬件是什么

  • GPU 代际;
  • 精度;
  • 序列长度;
  • batch;
  • state/head dimension;
  • 编译器和 kernel 版本;
  • 是否使用厂商高度优化 baseline。

4. 长上下文质量测什么

  • perplexity;
  • needle retrieval;
  • associative recall;
  • 多变量状态追踪;
  • 原样复制;
  • 长代码约束;
  • 长 reasoning;
  • 流式传感。

不同任务对压缩记忆要求完全不同。

5. 总服务成本

  • KV/state memory;
  • 权重带宽;
  • batching;
  • cache 复用;
  • speculative decoding;
  • tool wait;
  • reasoning token 数;
  • 模型质量导致的重试。

一个每 token 更快但需要更多 token 才答对的模型,端到端可能更贵。


二十一、怎样检验 Mamba / hybrid 路线

1. 前沿规模

  • 训练参数与 token 是否接近当前 frontier;
  • scaling law 是否持续;
  • 稳定性和 loss spike;
  • tensor/sequence parallel 效率;
  • 多节点通信。

2. 精确记忆

  • 随上下文长度增长的随机 key-value recall;
  • 同名实体和变量绑定;
  • 早期约束对后期输出影响;
  • 多文档引用;
  • 可逆复制任务。

3. Reasoning decode

  • 长思维链中约束是否漂移;
  • 固定 state 是否累积误差;
  • 与 KV cache Transformer 的同质量 token 成本;
  • 增加 state size 的边际收益;
  • hybrid attention 放在哪些层最有效。

4. 墙钟与能耗

  • 训练美元/有效 token;
  • prefill latency;
  • decode latency;
  • batch 下吞吐;
  • 每正确答案能耗;
  • 不同硬件代际重测。

5. 外部采用

  • 前沿实验室是否在真实产品/训练中采用;
  • 是否公开消融;
  • compiler 和 kernel 生态;
  • 与 quantization、MoE、speculative decoding 兼容;
  • 是否只在研究模型中有利。

二十二、按思想演进阅读原始材料

第一阶段:有限状态怎样压缩历史

  1. S4: Efficiently Modeling Long Sequences with Structured State Spaces
    • 重点理解连续 SSM、递归—卷积双形态、DPLR 与长序列;
    • 不必一开始陷入 Cauchy kernel 细节。

第二阶段:真实硬件怎样改变 attention

  1. FlashAttention

    • 先读 IO complexity 和 tiling;
    • 明确它是 exact attention,不改变二次数学复杂度。
  2. Tri Dao 的主页与论文索引

    • 用来串联 FlashAttention 1–4、Monarch、Mamba 1–3;
    • 速度数字要回到具体硬件与配置。
  3. FlashAttention-4

    • 看新硬件为何让非 GEMM 与 pipeline 再次成为瓶颈。

第三阶段:选择性递归

  1. Mamba: Linear-Time Sequence Modeling with Selective State Spaces
    • 重点看 content-based selection、input-dependent parameters 与 selective scan;
    • 同时检查语言模型规模和 recall 边界。

第四阶段:统一 attention 与 SSM

  1. Transformers are SSMs / Mamba-2

    • 掌握 semiseparable matrix 与 SSD 交集;
    • 不要把标题理解成任意 Transformer 都能压进固定 state。
  2. Mamba-2 理论说明

    • 从 SSM 与 attention 两条路径推导 duality。
  3. Mamba-2 算法说明

    • 看 chunk、block decomposition 与 state passing。
  4. Mamba-2 系统与 hybrid 结果

    • 重点看少量 attention block 的作用和 2.7B/300B 受控实验。

第五阶段:inference-first recurrence

  1. Mamba-3 Part 1

    • 看新 recurrence、complex state、MIMO 和状态大小—性能 Pareto。
  2. Mamba-3 Part 2

    • 理解 exponential-trapezoidal discretization 与经典控制理论来源;
    • 同时注意当前公开规模限制。

二十三、最后的压缩:怎样长期跟踪 Dao 与 Gu

不要只问“Mamba 有没有打败 Transformer”。用下面十个问题跟踪更有价值:

  1. 新算子在训练、prefill、decode 三阶段分别快多少?
  2. 快是因为数学复杂度、IO、kernel,还是牺牲模型质量?
  3. 固定 state 在精确 recall、多变量绑定和长 reasoning 中丢什么?
  4. 增大 state 后,延迟—质量 Pareto 是否仍优于 KV cache?
  5. 少量 attention 应放在哪些层、以什么频率混合?
  6. SSD 的理论统一是否继续导出新算法,而不只解释已有模型?
  7. 新 GPU 的 memory/compute 比怎样改变最佳架构?
  8. 推理时 scaling 是否真的让 recurrent decode 成为总成本优势?
  9. 前沿规模训练与真实服务是否复现论文数字?
  10. 未来记忆是否形成“固定状态 + 局部 attention + 稀疏检索 + 外部工具”的层级系统?

Dao 与 Gu 最值得保留的判断可以压成一句:

一个序列模型不是纸上的公式,而是公式、矩阵结构、并行算法、内存流和部署阶段的共同体;真正可扩展的架构,必须同时回答它怎样记忆、怎样计算,以及数据究竟在芯片上走哪条路。

END · 12

不要问“该信谁”,要问:什么证据会迫使这条路线再次转向?

回到路线地图 →