架构与系统 · RESEARCH TRAJECTORY
Tri Dao 与 Albert Gu:在数学结构、记忆容量和 GPU 数据流之间重写序列模型
从 HiPPO、S4 与 FlashAttention,到 Mamba、状态空间对偶与 inference-first 设计。
Dao 与 Gu 不主要回答“智能是什么”,却决定许多智能理论能否以现实成本运行。Gu 从控制理论和 HiPPO 追问:有限维状态怎样压缩一条无限增长的历史;Dao 从结构矩阵与 GPU 系统追问:一个纸面上更省 FLOPs 的算法,怎样真正减少显存搬运并跑得更快。两条线在 Mamba 汇合:用输入选择性的递归状态替代部分注意力,再通过 State Space Duality 把递归、结构矩阵和 attention 放进同一框架。其最深判断不是“Mamba 会杀死 Transformer”,而是:架构、并行算法、内存层级和训练/解码场景必须一起设计。
一、先把他们的问题放在正确层级
谈 LLM 架构时,公众常把候选分成:
- Transformer;
- RNN;
- state space model;
- linear attention;
- convolution;
- hybrid。
Dao 与 Gu 的工作说明这些标签容易遮蔽真正结构。一个序列算子可以从至少三种视角理解:
- 递归视角: 当前状态怎样由旧状态和新输入更新;
- 矩阵视角: 整条序列输入乘以什么结构矩阵得到输出;
- 系统视角: 这项计算在 GPU 上怎样分块、搬运、融合和并行。
同一数学函数可能有:
- 适合并行训练的表示;
- 适合逐 token 解码的表示;
- 适合某代 GPU 的 kernel;
- 适合理论分析的矩阵分解。
因此真正问题不是“哪一阵营正确”,而是:
- 需要保留多少历史信息;
- 是否必须精确回看任意 token;
- 状态大小怎样随长度增长;
- 训练能否并行;
- decode 每步搬多少数据;
- 硬件能否高利用率执行;
- 质量—延迟—内存的 Pareto 前沿在哪里。
二、Albert Gu 的起点:有限维状态怎样记住连续历史
1. 递归记忆本质上是一种压缩
考虑序列输入 u₁, u₂, …。一个 RNN 维护固定维状态 hₜ:
无论历史有多长,所有过去信息都必须压进 hₜ。
这带来根本 trade-off:
- 固定状态使解码成本不随上下文线性增长;
- 但状态容量有限,不可能无损保存任意长序列;
- 学习必须决定保留什么、遗忘什么;
- 长程梯度与数值稳定困难。
Transformer attention 采用相反方案:
- 保留每个过去 token 的 key/value;
- 当前 query 可直接回看;
- 精确内容寻址强;
- KV cache 随长度增长;
- 全序列训练 attention 成本二次。
Gu 的研究从控制理论问:能否让固定状态压缩具有更有原则的数学形式,而不是让普通 RNN 随机学一个黑箱 memory?
三、HiPPO:把“记住过去”表述为在线函数逼近
HiPPO(High-order Polynomial Projection Operators)的核心问题是:
当一个连续信号不断到来,怎样用有限个系数在线表示迄今历史,使重建误差在某个加权准则下尽可能小?
1. 不是记每个时刻,而是记一组基函数系数
假设用正交多项式基底近似过去函数:
- 低阶系数描述平滑、全局趋势;
- 高阶系数描述更细变化;
- 新输入到来时,系数递归更新;
- 固定 N 个系数给出受控的历史压缩。
这类似把一段很长声音不逐样本保存,而保存它在一组适当基函数上的投影。
2. 为什么正交投影比任意 RNN 更有原则
它提供:
- 明确记忆目标;
- 可分析的状态转移矩阵;
- 不同时间尺度;
- 连续时间形式;
- 与控制系统和信号处理的连接。
状态不是“希望神经网络自己学会记忆”,而是先给一种数学上最优的历史摘要,再让模型学习怎样使用。
3. 它仍然是有损压缩
固定 N 维只能保留某个函数族的最佳近似。若任务需要原样记住某个很早出现的随机 token,低维投影可能丢失。
这条边界一直延伸到 Mamba:状态空间模型擅长压缩统计历史,不天然等价于 attention 的任意内容检索。
四、从连续状态空间到序列层:S4 的理论与工程突破
S4: Efficiently Modeling Long Sequences with Structured State Spaces从连续线性系统出发:
离散化后得到:
1. 同一个线性系统有递归和卷积两种形态
递归展开可得到:
其中卷积核 K 由 CĀᵏB̄ 组成。
这带来关键双形态:
- 训练时: 整条序列可用卷积并行;
- 推理时: 保持 state 逐步递归;
- 参数相同: 两种算法表示同一线性系统。
传统 RNN 训练串行;普通长卷积 kernel 生成和计算又昂贵。S4 的目标是使二者都高效。
2. 为什么 A 矩阵的结构决定可计算性
一般 N×N 状态矩阵:
- 幂次计算昂贵;
- 数值可能不稳定;
- 卷积核生成慢;
- 训练难扩展。
S4 利用 HiPPO 导出的结构,并把 A 参数化为 diagonal plus low-rank(DPLR)形式。通过稳定对角化与 Cauchy kernel 技巧,能高效计算长卷积核。
这是典型的数学—系统共同设计:
- 状态矩阵不能完全自由;
- 选择适当结构减少复杂度;
- 结构又保留长程记忆性质;
- 才能在 GPU 上训练。
3. S4 的实证意义
论文在 Long Range Arena、序列 CIFAR、音频和语言等任务上显示强结果,并处理长度 10,000 以上序列。
重要意义不是某个榜单长期保持,而是重新打开一条路线:
- 递归模型可以并行训练;
- 控制理论状态空间可成为通用神经层;
- 长序列不必只有二次 attention;
- 结构化线性动力学加非线性 mixing 可以很有表达力。
4. S4 的局限
- DPLR/Cauchy kernel 实现复杂;
- 线性时间不自动等于 GPU 快;
- 语言上的 content-based selection 弱;
- 早期结果多在中小规模;
- 不同任务需要状态大小和初始化调节;
- 固定线性 dynamics 难根据 token 决定保留/遗忘。
最后一点直接催生 Mamba。
五、Tri Dao 的起点:FLOPs 不是 GPU 时间的充分统计量
在理论论文中,算法常按:
- O(n²);
- O(n log n);
- O(n);
比较。但现代 GPU 的时间不仅由乘加数量决定,还受:
- HBM 带宽;
- SRAM / shared memory;
- register;
- kernel launch;
- tensor core 利用率;
- 数据布局;
- 并行度;
- 重计算与存储 trade-off。
1. GPU 为什么经常在“搬数据”,而不是“做计算”
高带宽显存 HBM 容量大,但离计算单元远;片上 SRAM 小得多,却快。若算法不断:
- 从 HBM 读矩阵;
- 做少量运算;
- 写回巨大中间结果;
- 下一 kernel 再读;
即使 FLOPs 不高,墙钟也可能很慢。
2. IO complexity 是真正系统成本的一部分
Dao 的核心判断是:
算法若没有说明数据在内存层级怎样移动,就没有完整说明它的效率。
这不只是 kernel 工程细节。它会反过来决定:
- 哪些数学分解值得用;
- 是否应重计算中间量;
- tile 大小;
- 精度;
- 算子融合;
- 架构层形状。
六、FlashAttention:不近似 attention,只改变精确计算的数据流
FlashAttention最常见误解是“把二次 attention 变成线性”或“做稀疏近似”。都不对。
它计算的仍是精确 softmax attention:
时间复杂度仍有 n² 项。突破在于避免把完整 n×n attention matrix 写入 HBM。
1. 标准实现的 IO 问题
朴素流程会:
- 计算 S = QKᵀ;
- 把 S 写到 HBM;
- 读 S 做 softmax;
- 写概率 P;
- 再读 P 与 V 相乘。
序列长时,中间矩阵巨大,读写成为瓶颈。
2. Tiling:把 Q、K、V 分块搬进片上存储
FlashAttention 按块处理:
- 一小块 Q 常驻 SRAM;
- 依次加载 K/V 块;
- 计算局部 scores;
- 在线更新 softmax 统计;
- 累积输出;
- 不落地完整 attention matrix。
3. Online softmax 为什么关键
Softmax 需要全行最大值和归一化和。分块时一开始看不到所有 key。
算法维护:
- 当前最大值 m;
- 当前指数和 l;
- 当前加权输出 o。
新块到来后,用新的最大值重新缩放旧累计量,再加入新块贡献。最终结果与完整 softmax 数值等价。
4. Backward 为什么可以“重计算而不是存储”
传统直觉是为了省算力应保存 attention probability。FlashAttention 发现:
- HBM IO 比额外 FLOPs 更贵;
- backward 时用保存的 softmax 统计重算局部 scores;
- 增加计算,减少内存读写;
- 实际反而更快且省显存。
这是一个很重要的系统原则:
最少 FLOPs 不一定最快;在现代硬件上,用便宜计算换昂贵数据移动常更优。
5. FlashAttention 的历史意义
它没有提出新注意力语义,却显著:
- 延长可训练上下文;
- 降低显存;
- 提高训练/推理吞吐;
- 成为前沿 LLM 基础 kernel;
- 让 IO-aware 进入架构研究中心。
它说明基础研究贡献不必改变模型公式;改变公式在真实硬件上的可执行边界,同样会改变领域。
七、FlashAttention 后续:每代硬件都可能重写最佳算法
1. FlashAttention-2:提高并行和工作划分
后续版本减少非矩阵乘操作、改善 warp / thread block 划分,使 tensor core 利用更高。
2. FlashAttention-3:异步与低精度
Hopper GPU 提供异步数据移动、warp specialization 与 FP8 等能力。FlashAttention-3 通过流水化:
- 数据搬运;
- matrix multiply;
- softmax;
让不同硬件单元并行工作,并处理低精度误差。
3. FlashAttention-4:非 GEMM 瓶颈重新变重要
2026 年的 FlashAttention-4针对新硬件的非对称 scaling:矩阵乘变得极快后,softmax、数据搬运和调度可能成为更大比例瓶颈。
其核心不是再说“GEMM 越快一切越快”,而是:
- pipeline matmul 与非 matmul;
- 利用新 memory / tensor memory;
- 设计数据布局;
- 避免硬件单元空转。
论文/博客报告在 B200 BF16 上达到很高利用率,并超过当时 cuDNN/Triton 对照。
4. 这说明“硬件感知”不是一次优化
一个 kernel 在 A100 最优,未必在 H100/B200 最优。架构和实现必须随:
- 计算/带宽比;
- cache;
- 低精度;
- 异步指令;
- 网络互联;
变化而重做。
因此不能把某论文中的速度数字当作永久算法属性。
八、Mamba 之前的关键失败:线性 SSM 不知道当前 token 是否值得记
传统线性时不变 SSM 的 A、B、C 基本不依赖输入内容。它对所有位置使用相同动态。
这在连续信号上合理,但离散语言需要选择:
- 遇到分隔符时重置某些状态;
- 看到姓名时长期记住;
- 跳过填充;
- 根据当前 token 决定写入哪类记忆;
- 在复制任务中保留指定片段。
1. Content-based reasoning 是 attention 的核心优势
Attention 的权重由当前 query 与过去 key 的内容相似决定。模型可直接找到:
- 前文某个变量定义;
- 同名实体;
- 匹配括号;
- 相关指令。
固定卷积/线性 recurrence 的 kernel 主要依赖距离,很难做同样选择。
2. Gu 与 Dao 对失败的诊断
Mamba明确指出许多 subquadratic 模型在语言上落后,是因为缺少 content-based reasoning。
解决不是加回完整 attention,而是让 SSM 参数随输入变化,使当前 token 控制:
- 写什么;
- 忘什么;
- 读出什么;
- 时间步尺度。
九、Mamba-1:选择性状态空间怎样工作
1. 输入依赖参数
Mamba 让 B、C 和离散时间步 Δ 等由当前输入产生。
直观上:
- Δ 控制状态衰减/保持速度;
- B 控制当前输入怎样写进状态;
- C 控制从状态读出哪些信息。
因此同一个通道在不同 token 上可:
- 快速遗忘;
- 长期保留;
- 选择性写入;
- 选择性输出。
2. 为什么选择性破坏了原 S4 卷积捷径
若 A/B/C 固定,整个序列是 time-invariant convolution,可用 FFT/并行卷积。
参数依赖每个输入后,kernel 也随位置变化,不能预先生成一个统一卷积核。模型回到 time-varying recurrence。
3. Selective scan:让变时递归仍能并行训练
Mamba 设计硬件感知 parallel scan:
- 利用递归更新的结合结构;
- 分块计算;
- kernel 融合;
- 避免把大状态中间量写回 HBM;
- backward 重计算部分状态。
这正是 Gu 与 Dao 两条线的交汇:
- 数学上加入内容选择;
- 算法上找到并行表示;
- 系统上减少 IO;
- 推理时仍保持固定 state。
4. Mamba block 的激进简化
原论文构造不含 attention、甚至不依赖传统独立 MLP block 的 backbone,用 selective SSM 与门控投影组成层。
报告的优势包括:
- 序列长度近线性 scaling;
- 自回归 decode 固定状态;
- 语言、音频、基因组多模态;
- 中小规模语言模型具竞争力。
5. 它为什么引发巨大关注
推理服务中的 KV cache 随:
- batch;
- 层数;
- head;
- context length;
增长,成为成本中心。Mamba 每层保持固定 state,理论上特别适合长 decode。
同时它不是退回旧 RNN,而是:
- 可并行训练;
- 输入选择性;
- GPU kernel co-design;
- 大规模语言实证。
十、Mamba-1 的边界:固定状态是一项优势,也是一项信息瓶颈
1. 精确回忆
若需要从百万 token 前原样取回一个随机字符串,attention 可保留对应 KV;固定 state 必须把它编码进有限容量,与其他信息竞争。
2. 多约束推理
长代码或证明中,模型要同时维护许多变量、定义和例外。状态压缩可能:
- 覆盖旧信息;
- 混淆相似实体;
- 无法随机访问;
- 在长 chain 中逐步漂移。
3. In-context learning
Transformer 把上下文样本直接保留,当前 token 可按内容匹配。递归模型必须把示例吸收进 state,功能上更接近 online learner。它可能更高效,也可能难保留细节。
4. 硬件效率不是自动线性
Parallel scan 有依赖和小矩阵操作,GPU 对大 GEMM 最优化。即使渐近 O(n),在中等长度和大 batch 下可能不如高度优化 attention。
这促使 Mamba-2 反向增加更多矩阵结构,以利用硬件。
十一、State Space Duality:attention 与 SSM 其实是结构矩阵的不同切面
Transformers are SSMs / Mamba-2提出 State Space Duality(SSD)。
标题容易被误读为“所有 Transformer 就是普通 SSM”。更准确是:
- 一类选择性 SSM;
- 一类结构化 masked attention;
- 都对应 semiseparable matrices;
- 在特定结构下两种公式精确等价;
- 这种 duality 可导出新模型与算法。
1. 从矩阵视角看递归
将线性递归展开,输出 yₜ 是过去所有输入 xₛ 的加权和。整个序列可写成一个下三角矩阵 M 乘 X。
这个 M 不是任意 dense matrix;其离对角块具有低秩/semiseparable 结构,由状态转移的乘积产生。
2. 从 attention 视角看同一个矩阵
某些 linear attention / structured masked attention 也产生:
其中 L 表示因果衰减 mask,CᵀB 提供低秩内容交互。
于是:
- 递归视角强调 state passing;
- attention 视角强调矩阵乘;
- 结构矩阵视角说明它们何时是同一函数。
3. 理论统一为什么有工程价值
它允许在不同阶段选算法:
- 序列块内部用大矩阵乘;
- 块之间传递 state;
- 训练利用 tensor core;
- decode 使用 recurrence;
- 复用 Transformer 的 tensor/sequence parallelism;
- 处理 variable length。
理论不是为统一而统一,而是解锁更合硬件的实现。
十二、Mamba-2:有时“更强的数学结构约束”反而带来更强规模性能
Mamba-1 的状态转移 A 在每通道上可为对角结构;Mamba-2/SSD 对 A 施加更强的 scalar-times-identity 结构,并引入类似 head 的较大块。
直觉上,更强约束似乎降低表达力。为什么反而更好?
1. 更规则结构可转成大 GEMM
GPU 最擅长:
- 大、密集矩阵乘;
- 规则内存访问;
- 高并行。
较复杂逐通道 recurrence 可能理论表达更丰富,却产生小操作、scan 和低利用率。
SSD 把计算重排为 chunked matrix multiply + state passing,训练可 2–8 倍更快。
2. 更快训练可以换更多数据与模型
架构质量不能只看同一步数的单层表达力。若更规则模型:
- 墙钟更快;
- 更稳定;
- 更容易并行;
- 能训练更多 token;
整体性能可能更高。
这是一条重要 scaling lesson:
归纳偏置的优劣必须与硬件可扩展性共同评价。
3. Hybrid 结果比“纯 SSM 胜利”更重要
Dao 的Mamba-2 系统文章报告,在 2.7B 参数、300B token 设置中,只有少量 attention block(例如 6 attention + 58 SSD)的 hybrid 优于纯 SSD,也优于其 Transformer++ baseline。
这说明:
- 大部分序列混合可由高效递归/SSD 完成;
- 少量 attention 提供精确内容回看;
- 最优解很可能是混合,而非阵营全替代。
4. State Space Duality 改变了问题提法
以后不必只问:
- attention 还是 recurrence?
而可问:
- 哪些结构矩阵;
- 哪些 block placement;
- 哪些状态维度;
- 哪种 chunk;
- 哪些层保留精确 KV;
- train/prefill/decode 分别用什么算法。
十三、Mamba-3:把 inference-first 与经典控制理论重新带回设计中心
2026 年 Mamba-3 Part 1与方法深挖明确说,Mamba-2 主要解决训练效率;Mamba-3 将性能—状态大小—解码延迟的 Pareto 前沿放在中心。
1. 为什么推理时代改变目标函数
预训练时代,最主要成本可能是训练吞吐。Reasoning / agent 时代,一个输入会产生:
- 数千到数万内部 token;
- 长工具轨迹;
- 多候选;
- 长时间持续上下文。
总成本越来越由 decode 决定。架构若每 token 都读取巨大 KV cache,内存带宽和容量会主导。
固定 state recurrence 因而获得新的经济价值。
2. 改进一:更正式的连续—离散 recurrence
早期 Mamba 将经典 zero-order hold 离散化中的固定变量推广成 time-varying,理论基础并不完全令人满意。
Mamba-3 从更一般的 exponential-trapezoidal discretization 推导新 recurrence,使当前与前一输入以结构化方式共同影响状态。
这不是只换公式,而是试图获得:
- 更丰富动态;
- 仍可并行;
- 仍可快速 decode;
- 更稳定的控制理论解释。
3. 改进二:complex-valued state dynamics
实值纯衰减 state 擅长低通记忆,但复杂时间模式和状态追踪可能需要振荡/旋转动态。
复数 eigenvalue 可自然表达:
- 周期;
- 相位;
- 旋转;
- 更丰富 memory trace。
Mamba-3 以避免显式复数工程负担的方式引入相关能力,提高 state tracking。
4. 改进三:MIMO 而非单输入单输出状态系统
早期 Mamba 的每个状态系统更接近 SISO。Mamba-3 引入多输入多输出(MIMO)结构:
- 多个通道共同写入/读出;
- 在不同比例的参数与状态成本下提高表达;
- 让训练可稍贵,但 decode state size 不相应增长。
团队报告在约 1B 等受控规模上,MIMO 提高下游质量,且状态大小—性能 Pareto 优于 Mamba-2。
5. 为什么这是一种“经典理论回归”
许多现代 linear attention 从矩阵技巧出发;Mamba-3 的三项改进都明确受传统 state space / control literature 启发。
这说明创新不一定只来自更现代的神经模块。旧理论在新硬件、规模与目标函数下,可能获得新的工程形式。
6. 仍应保持的尺度谨慎
截至 2026 年的公开结果不能证明:
- Mamba-3 已在最前沿万亿参数训练中替代 Transformer;
- 固定 state 解决任意长精确 recall;
- 所有硬件都保持同样延迟优势;
- reasoning quality 因更便宜 decode 自动提高。
它推进了受控 Pareto 前沿,不是终局宣判。
十四、他们对“记忆”的真正判断:压缩与随机访问必须分工
1. Attention 像内容可寻址外存
- 保存过去 token 的 key/value;
- query 决定读哪里;
- 容量随长度增长;
- 精确细节保留强;
- 成本随历史增大。
2. SSM 像固定容量工作状态
- 每步更新;
- 自动压缩;
- decode 成本固定;
- 适合流式;
- 可能遗忘精细内容。
3. 人类认知也可能需要两者
人不会把所有感官逐帧放在工作记忆,但可借:
- 外部笔记;
- episodic memory;
- 搜索;
- 环境;
恢复细节。
未来 LLM 架构可能类似:
- SSM / recurrence 保持连续摘要;
- 局部 attention 处理近期;
- 稀疏 global attention 处理关键 token;
- retrieval 访问外部长期记忆;
- tool state 保留精确变量。
因此最合理预测不是纯 SSM,而是 memory hierarchy。
十五、训练、prefill、decode 是三个不同系统问题
1. Training
- 全序列已知;
- 可并行;
- 需要保存/重算激活;
- backward 成本重要;
- 大 batch;
- 通信成为瓶颈。
2. Prefill
- 输入 prompt 已知;
- 可矩阵化处理;
- 目标是快速建立 KV/state;
- 长 prompt latency 重要。
3. Decode
- 每次只来一个新 token;
- batch 可能动态;
- 权重和 cache 读取主导;
- kernel 很小;
- latency 与吞吐 trade-off;
- reasoning 模型会重复数千步。
一个架构可能:
- training 很快;
- prefill 一般;
- decode 极快;
或相反。
Dao/Gu 最重要的系统纪律是:不要用一个平均 tokens/s 覆盖三个阶段,也不要用理论序列复杂度代替实际服务成本。
十六、他们的世界观:模型层首先是一个结构化线性算子,再由非线性和数据选择赋予语义
1. 很多序列模型可被统一成结构矩阵
Convolution、recurrence、linear attention、masked attention 都是在序列维施加不同结构矩阵。
关键属性包括:
- Toeplitz;
- low-rank;
- semiseparable;
- diagonal plus low-rank;
- causal mask;
- data-dependent entries。
选择结构决定:
- 表达;
- 记忆;
- 算法;
- 硬件。
2. 结构越自由,未必越强
完全 dense attention 表达自由,但成本高;过强固定结构成本低,却可能无法内容选择。
真正设计是在:
- 自由度;
- 可学习性;
- 数值稳定;
- 并行算法;
- kernel 利用;
之间找 Pareto。
3. 实现不是论文结尾,而是理论的一部分
FlashAttention 与 Mamba 都证明:
- 没有 kernel,线性理论可能更慢;
- IO 分析可推动新算法;
- 硬件原语会塑造参数化;
- 一个模型是否可扩展必须看端到端墙钟。
这是他们对 AI 研究文化很重要的修正。
十七、与其他路线的关系
1. 与 LeCun:不是智能理论竞争者,而是可能的底层执行层
LeCun 认为当前 LLM 的根本问题在学习目标、世界模型与规划。即使把 next-token Transformer 算快十倍,也未必得到物理理解。
Dao/Gu 解决的是:
- 长序列状态;
- 高效算子;
- 固定状态解码;
- attention kernel。
他们的技术可服务任何高层理论:
- JEPA world model;
- 机器人视频;
- planning trajectory;
- multimodal memory;
- autoregressive LLM。
所以 Mamba 不是对 LeCun 路线的替代,而是决定其是否能在长时序上经济运行的候选骨干。
2. 与 Hinton:同样相信硬件会反过来塑造学习算法
Hinton 的 mortal computation 更激进:
- 软件与模拟硬件不可分;
- 每块设备自己学习。
Dao 更现实主义:
- 接受数字 GPU;
- 研究其 memory hierarchy、tensor core 和异步流水;
- 在现有可复制生态中 co-design。
二者共享“算法不能脱离物质”,但时间尺度与风险完全不同。
3. 与 Karpathy:最小算法核与生产性能的两端
Karpathy 用 microgpt 说明 GPT 算法本质很短;Dao 说明从 200 行公式到前沿吞吐之间,数据流和 kernel 绝非次要。
两者合起来才完整:
- 最小实现防止把框架复杂度当理论;
- kernel 实现防止把纸面复杂度当真实速度。
4. 与 Sutton / world-model 路线:固定 state 是持续 agent 的自然内存候选
持续 agent 不能让上下文无限增长。SSM 提供:
- streaming update;
- 固定 memory;
- 长时间运行;
- 动态选择。
但真正 continual learning 还需:
- 权重可塑性;
- episodic retrieval;
- 防遗忘;
- 新任务迁移。
Mamba 的 hidden state 是序列上下文,不等于 Sutton 所说的终身学习记忆。
十八、判断记录:哪些已被验证,哪些仍未定
A. “IO 与内存层级和 FLOPs 同等重要”
结论:决定性命中。
FlashAttention 已成为前沿训练/推理基础设施;重计算换 IO、tiling 与 kernel fusion 是标准方法。
B. “连续状态空间模型能成为通用长序列骨干”
结论:S4/Mamba 已给强证据。
语言、音频、基因组、视觉等均有应用。是否在所有前沿任务优于 Transformer 未证明。
C. “Content selectivity 是线性 SSM 进入语言的关键”
结论:Mamba-1 强力支持。
输入依赖动态显著改善离散序列任务。选择性的精确能力与 attention 仍有差距。
D. “Attention 与 SSM 可在统一结构矩阵框架中理解”
结论:理论命中。
SSD 给出精确等价类,并导出更快算法。它不意味着任意 softmax Transformer 都被固定小 state 无损替代。
E. “纯 SSM 会取代 Transformer”
结论:公开证据反而支持 hybrid。
少量 attention + 多数 SSD 的结果很有吸引力;精确 recall 与大规模生态使 attention 仍重要。
F. “推理时计算会让固定状态架构价值上升”
结论:经济逻辑强,前沿采用仍需观察。
长 decode 和 KV cache 确实成为成本中心。模型质量、batching 与硬件支持会决定实际选择。
G. “Mamba-3 已解决 state tracking”
结论:推进但未解决。
复杂状态、MIMO 和新 discretization 改善 Pareto;任意长、精确、多约束记忆仍不可能由有限状态无损保证。
十九、他们最强的论证与最弱的外推
最强论证:算法复杂度只有在映射到内存层级和并行原语后,才成为现实可扩展性
FlashAttention 是几乎教科书级证据:
- 同一数学结果;
- 甚至增加部分重计算;
- 因减少 HBM IO 而大幅更快、省内存。
这条原则适用于几乎所有 AI 架构评价。
最弱外推:固定维 recurrent state 能在不损质量的情况下承担任意超长上下文
信息论上,固定有限状态不能无损保存无限随机历史。模型只能:
- 压缩任务相关统计;
- 依靠 learned selective memory;
- 将细节放到外部存储;
- 偶尔使用 attention/retrieval。
如果 benchmark 只测困惑度或平滑长期依赖,可能掩盖精确 recall 失败。真正竞争会在 memory hierarchy,而不是口号式线性长度。
二十、看“高效架构”论文时应检查什么
1. 对比是否公平
- 同参数量;
- 同训练 token;
- 同数据;
- 同 optimizer;
- 同调参预算;
- 同墙钟或同 FLOPs;
- 同 tokenizer;
- 同下游评测。
2. 速度是什么速度
- kernel microbenchmark;
- 单层 forward;
- 端到端训练;
- prefill;
- decode;
- batch throughput;
- 单请求 latency。
这些数字不可互换。
3. 硬件是什么
- GPU 代际;
- 精度;
- 序列长度;
- batch;
- state/head dimension;
- 编译器和 kernel 版本;
- 是否使用厂商高度优化 baseline。
4. 长上下文质量测什么
- perplexity;
- needle retrieval;
- associative recall;
- 多变量状态追踪;
- 原样复制;
- 长代码约束;
- 长 reasoning;
- 流式传感。
不同任务对压缩记忆要求完全不同。
5. 总服务成本
- KV/state memory;
- 权重带宽;
- batching;
- cache 复用;
- speculative decoding;
- tool wait;
- reasoning token 数;
- 模型质量导致的重试。
一个每 token 更快但需要更多 token 才答对的模型,端到端可能更贵。
二十一、怎样检验 Mamba / hybrid 路线
1. 前沿规模
- 训练参数与 token 是否接近当前 frontier;
- scaling law 是否持续;
- 稳定性和 loss spike;
- tensor/sequence parallel 效率;
- 多节点通信。
2. 精确记忆
- 随上下文长度增长的随机 key-value recall;
- 同名实体和变量绑定;
- 早期约束对后期输出影响;
- 多文档引用;
- 可逆复制任务。
3. Reasoning decode
- 长思维链中约束是否漂移;
- 固定 state 是否累积误差;
- 与 KV cache Transformer 的同质量 token 成本;
- 增加 state size 的边际收益;
- hybrid attention 放在哪些层最有效。
4. 墙钟与能耗
- 训练美元/有效 token;
- prefill latency;
- decode latency;
- batch 下吞吐;
- 每正确答案能耗;
- 不同硬件代际重测。
5. 外部采用
- 前沿实验室是否在真实产品/训练中采用;
- 是否公开消融;
- compiler 和 kernel 生态;
- 与 quantization、MoE、speculative decoding 兼容;
- 是否只在研究模型中有利。
二十二、按思想演进阅读原始材料
第一阶段:有限状态怎样压缩历史
- S4: Efficiently Modeling Long Sequences with Structured State Spaces
- 重点理解连续 SSM、递归—卷积双形态、DPLR 与长序列;
- 不必一开始陷入 Cauchy kernel 细节。
第二阶段:真实硬件怎样改变 attention
-
- 先读 IO complexity 和 tiling;
- 明确它是 exact attention,不改变二次数学复杂度。
-
- 用来串联 FlashAttention 1–4、Monarch、Mamba 1–3;
- 速度数字要回到具体硬件与配置。
-
- 看新硬件为何让非 GEMM 与 pipeline 再次成为瓶颈。
第三阶段:选择性递归
- Mamba: Linear-Time Sequence Modeling with Selective State Spaces
- 重点看 content-based selection、input-dependent parameters 与 selective scan;
- 同时检查语言模型规模和 recall 边界。
第四阶段:统一 attention 与 SSM
-
Transformers are SSMs / Mamba-2
- 掌握 semiseparable matrix 与 SSD 交集;
- 不要把标题理解成任意 Transformer 都能压进固定 state。
-
- 从 SSM 与 attention 两条路径推导 duality。
-
- 看 chunk、block decomposition 与 state passing。
-
- 重点看少量 attention block 的作用和 2.7B/300B 受控实验。
第五阶段:inference-first recurrence
-
- 看新 recurrence、complex state、MIMO 和状态大小—性能 Pareto。
-
- 理解 exponential-trapezoidal discretization 与经典控制理论来源;
- 同时注意当前公开规模限制。
二十三、最后的压缩:怎样长期跟踪 Dao 与 Gu
不要只问“Mamba 有没有打败 Transformer”。用下面十个问题跟踪更有价值:
- 新算子在训练、prefill、decode 三阶段分别快多少?
- 快是因为数学复杂度、IO、kernel,还是牺牲模型质量?
- 固定 state 在精确 recall、多变量绑定和长 reasoning 中丢什么?
- 增大 state 后,延迟—质量 Pareto 是否仍优于 KV cache?
- 少量 attention 应放在哪些层、以什么频率混合?
- SSD 的理论统一是否继续导出新算法,而不只解释已有模型?
- 新 GPU 的 memory/compute 比怎样改变最佳架构?
- 推理时 scaling 是否真的让 recurrent decode 成为总成本优势?
- 前沿规模训练与真实服务是否复现论文数字?
- 未来记忆是否形成“固定状态 + 局部 attention + 稀疏检索 + 外部工具”的层级系统?
Dao 与 Gu 最值得保留的判断可以压成一句:
一个序列模型不是纸上的公式,而是公式、矩阵结构、并行算法、内存流和部署阶段的共同体;真正可扩展的架构,必须同时回答它怎样记忆、怎样计算,以及数据究竟在芯片上走哪条路。