AI思想图谱Research trajectories
通用系统与科学20 分钟
09

通用系统与科学 · RESEARCH TRAJECTORY

Demis Hassabis:把记忆、想象、搜索、学习与工具拼成一台“发现机器”

导读

游戏、世界模型、搜索与科学工具不是几次跨界,而是一条构造可验证发现机器的连续路线。

Hassabis 最稳定的判断不是某一种网络架构,而是一种组合系统观:快速学习的模型提供直觉与世界先验,记忆保留可重组经验,搜索在当前问题上展开反事实,价值函数剪掉绝大多数分支,专门工具负责可验证计算。游戏是这套机器的试验场,AlphaFold 与数学/算法发现则是他试图证明它能从“赢”转向“发现”的第二阶段。

一、先把他的主线说准确:不是“从游戏跨界到科学”,而是持续寻找可验证的巨大搜索空间

Hassabis 的履历容易被写成传奇串联:少年棋手、游戏设计师、神经科学家、DeepMind 创始人、AlphaGo、AlphaFold、Gemini。这样写很热闹,却解释不了项目为何彼此相关。

更有解释力的主线是:

  1. 智能必须形成可复用的内部模型,而不只做刺激—反应。
  2. 记忆的用途不是存档,而是把过去元素重组为未来场景。
  3. 复杂问题需要“直觉 + 搜索”。 学习压缩空间,搜索纠正一次直觉。
  4. 世界模型不必复刻一切,只需保留当前决策所需结构。
  5. 评价清晰、组合空间巨大、能快速迭代的问题最适合推动 AI。
  6. 科学中的根节点问题一旦解决,会解锁大量下游研究。
  7. 通用模型、规划算法和专门科学工具最终应形成一个统一工作流。

这解释了为什么围棋、蛋白结构、形式数学和代码算法在他的图景中属于同一类问题:

  • 候选空间极大;
  • 人类有重要但不完整的先验;
  • 可以构造明确反馈;
  • 好的中间表示会极大压缩搜索;
  • 成功结果可以被外部验证;
  • 一项突破能产生人类没有明确写入的新结构。

二、游戏不是玩具:它是把智能拆成可测能力的实验装置

1. 为什么游戏长期吸引 Hassabis

电子游戏和棋类具有现实世界少见的实验优势:

  • 规则明确;
  • 状态或观察可记录;
  • 行动空间受限;
  • 奖励清楚;
  • 可无限模拟;
  • 难度可逐步增加;
  • 人类专家提供基线;
  • 创新策略能被对局直接检验。

游戏因此像认知科学的风洞。它不能代表完整现实,却能让研究者分别检验:

  • 感知;
  • 记忆;
  • 探索;
  • 规划;
  • 对手建模;
  • 长期 credit assignment;
  • 快速适应。

Hassabis 的项目风格从一开始就不是“找一个 benchmark 刷分”,而是选择一个表面受限、内部组合爆炸的环境,让算法系统跨过人类公认的能力边界。

2. 这也埋下一个长期风险

游戏的所有优点在现实中都可能消失:

  • 规则不完整;
  • 状态隐藏;
  • 奖励含混;
  • 环境不可重置;
  • 失败昂贵;
  • 对手和制度会改变;
  • 模拟器与现实有差距。

因此游戏是方法孵化器,不是一般智能已经解决的证据。Hassabis 后来的真正考验,是这些机制能否在科学和开放世界中保留价值。


三、2007 年海马研究:记忆、想象未来与场景构造是同一套能力的不同用法

Hassabis 在认知神经科学阶段参与的海马损伤研究发现,一些失忆患者不仅难以回忆个人过去,也难以想象新的、空间连贯的场景。

1. 研究的重要观察

患者可以说出零散对象和细节,却难把它们整合进一个统一空间:

  • 场景缺乏广阔、一致的布局;
  • 元素像孤立清单;
  • 难形成“我站在这里、那些对象以这种关系存在”的体验。

论文据此提出海马可能支持 scene construction:把对象、感觉和空间关系组合成连贯事件模型。

2. 这怎样改变对记忆的理解

记忆不是硬盘式读取。人回忆过去时也在重构:

  • 选取相关片段;
  • 把它们放回空间与因果关系;
  • 补全缺失部分;
  • 根据当前目标重组。

想象未来使用相同机制,只是把旧元素组合成从未发生的场景。因此:

记忆的智能价值,在于支持反事实和计划,而不只是保持事实。

3. 不要把神经科学论文硬说成 MuZero 的直接算法来源

海马 scene construction 与后来世界模型、rollout 的确有概念连续性,但没有证据表明 DQN、AlphaGo 或 MuZero 从这篇实验逐项推导。

更准确的关系是问题意识:

  • 内部状态必须把离散元素组织成一致场景;
  • 想象是决策前在内部试演可能未来;
  • 记忆、世界模型和规划不应被当作独立功能。

Hassabis 后来的系统不断寻找这种“可供搜索的内部场景”,但具体实现主要来自 RL、深度学习与工程,而非海马生物模型。


四、DeepMind 的早期纲领:同一个学习系统能否从像素掌握许多任务

1. DQN 之前,强化学习与视觉往往分开

经典 RL 常假设状态已是低维、结构化变量;视觉研究则主要做分类。若 agent 直接接收 Atari 像素,它必须同时解决:

  • 哪些图像结构是对象;
  • 速度和运动怎样从帧序列推断;
  • 哪些动作影响奖励;
  • 延迟奖励如何归因;
  • 不同游戏规则怎样由交互发现。

2. DQN 是几个已知部件的关键组合

Human-level control through deep reinforcement learning把卷积网络与 Q-learning 结合,并用两个稳定化机制。

Experience replay:

  • 保存过去 transition;
  • 随机抽样训练;
  • 打破连续帧强相关;
  • 提高数据复用;
  • 让训练分布更稳定。

Target network:

  • 用一个较慢更新的网络产生 bootstrap target;
  • 避免预测目标随当前参数每一步剧烈移动。

输入是像素,输出是各动作 Q 值;同一总体算法用于多种 Atari 游戏。

3. DQN 真正证明了什么

它证明:

  • 深度表征可与 trial-and-error 控制端到端结合;
  • 同一架构可跨多个视觉任务;
  • 人不必为每个游戏手写状态特征;
  • 大规模 replay 与稳定训练能让 RL 进入高维感知。

4. 它没有证明什么

  • agent 仍分别为每个游戏训练;
  • 数据效率远低于人;
  • 奖励由游戏明确提供;
  • 记忆和规划非常有限;
  • 对画面变化与新规则不稳健;
  • Atari 界面比真实世界简单得多。

DQN 的“一般性”是同一算法跨任务,不是一个 agent 在任务间持续迁移。


五、AlphaGo:学习负责直觉,搜索负责在当前局面上重新思考

围棋的状态分支巨大,传统 brute-force 搜索无法像国际象棋那样展开足够深。AlphaGo 的关键不是单独一个网络,而是把三种知识放在不同位置。

1. Supervised policy:先学人类棋感

用专家棋谱训练 policy network,预测高手在当前局面会下哪里。它把所有合法动作压缩成少数 plausible move。

这不是最终策略,却让搜索不必平均探索所有落点。

2. Reinforcement learning:超越模仿

policy 通过自我对弈继续优化胜率。人类数据提供起点,自我对弈可以发现人类分布之外的策略。

3. Value network:不用把每条分支走到终局

value network 估计当前局面最终胜率。搜索到一定深度后即可截断,用学习值替代完整 rollout。

4. Monte Carlo Tree Search:在当前局面分配计算

MCTS 在:

  • 已知高概率好棋;
  • 尚未充分探索的落点;
  • value 较高的分支;

之间动态权衡。网络决定优先想什么,搜索发现网络一次判断中的错误,搜索结果又改善行动。

5. Move 37 为什么重要,又容易被神话

对李世石第二局第 37 手之所以震撼,是它在人类专家先验中极不常见,却经后续局势证明有效。

它说明系统不是简单检索棋谱;学习 + 自我对弈 + 搜索能在规则空间中找到人类文化未充分探索的策略。

但它仍是在:

  • 固定规则;
  • 单一清晰目标;
  • 完整模拟器;
  • 海量计算;

中产生的新颖性。称它为一般创造力的完整证据会过度;称它为“有验证器的搜索可产生非模仿新知识”的证据则很强。


六、AlphaGo Zero 与 AlphaZero:系统性删除人类知识,而不是反对一切先验

AlphaGo Zero去掉人类棋谱,只保留围棋规则和自我对弈。一个网络同时输出 policy 与 value,MCTS 生成更强行动分布,训练再让网络模仿搜索结果和最终胜负。

1. 训练闭环

  1. 当前网络参与自我对弈;
  2. MCTS 在每一步改进当前 policy;
  3. 对局生成状态、搜索 policy 和胜负;
  4. 网络学习搜索后的 policy 与最终 value;
  5. 新网络再次自我对弈。

搜索像一个临时、昂贵的教师;网络把搜索成果 amortize 进快速直觉。

2. AlphaZero 的泛化

AlphaZero 把同一框架用于围棋、国际象棋和日本将棋,减少领域特定启发式。

这支持 Hassabis/Silver 的一个长期判断:

与其把人类专家策略写进系统,不如给一般学习和搜索足够算力,让知识由自我生成经验形成。

3. “从零开始”仍有重要限定

系统仍得到:

  • 完整规则;
  • 合法动作;
  • 终局胜负;
  • 可完美复制的模拟器;
  • 网络和 MCTS 架构;
  • 大量计算。

它移除的是 人类对局和棋类启发式,不是一切人类先验。把 AlphaZero 写成 tabula rasa 会遮蔽最关键的工程归纳偏置。


七、MuZero:规划模型不必生成世界,只需保留决策相关结构

MuZero进一步去掉给定状态转移规则。系统从观察和奖励中学习一个潜在动力学模型,并在其上搜索。

1. 三个学习函数

MuZero 通常可理解为:

Representation function:

  • 把历史观察编码为潜在状态。

Dynamics function:

  • 给定潜在状态和动作,预测下一潜在状态与即时 reward。

Prediction function:

  • 从潜在状态预测 policy 与 value。

MCTS 不在真实棋盘/像素模拟器中搜索,而在学习的潜空间中反复应用 dynamics。

2. 最深的技术判断:模型无需重建观察

传统 world model 容易被要求预测下一帧每个像素。MuZero 不要求潜在状态解码回完整图像,只优化:

  • reward;
  • value;
  • policy。

因此它可以忽略:

  • 与决策无关的纹理;
  • 不可预测的视觉噪声;
  • 不影响奖励的细节。

这与 LeCun 后来的 JEPA 思路有亲缘:有用世界模型应在潜空间保留可预测、与行动相关的结构,而非浪费容量生成一切感官细节。

3. 为什么 task relevance 既是优势也是风险

若当前 reward 固定,丢掉无关细节提高效率。但开放世界中任务会改变:

  • 今天无关的颜色,明天可能是安全信号;
  • 训练 reward 未惩罚的物理变量,部署时可能致命;
  • 只为当前 policy/value 学的状态可能无法支持新目标;
  • 潜空间错误难以由人检查。

MuZero 证明 task-oriented latent model 足以规划一些复杂任务,不证明它拥有可任意复用的完整世界知识。

4. 模型误差与搜索深度的矛盾

搜索越深,理论上规划越远;但 learned dynamics 每一步都有误差。若误差累积,更多搜索可能变差。

因此世界模型 + 搜索路线必须平衡:

  • 表示质量;
  • rollout horizon;
  • value bootstrap;
  • 模型不确定性;
  • 真实经验校正。

这在真实机器人和科学模拟中比棋类更尖锐。


八、从游戏到科学:连续性在“问题选择与搜索结构”,不在简单搬架构

1. 为什么科学是 Hassabis 的终极应用

科学问题常具有:

  • 巨大组合空间;
  • 稀疏但高价值发现;
  • 可积累的人类文献和数据;
  • 数学、实验或结构验证;
  • 一项根节点突破解锁许多下游。

它符合 DeepMind 在游戏中培养的能力组合:

  • 表征学习压缩状态;
  • 搜索生成候选;
  • value / confidence 排序;
  • 工具执行验证;
  • 反馈进入下一轮。

但现实科学比游戏困难,因为数据有噪声、实验昂贵,真正重要的问题甚至没有已知评价函数。

2. AlphaFold 不是 AlphaGo “换个棋盘”

AlphaFold 项目页代表 Hassabis 路线的关键转折。AlphaFold 2 用蛋白序列、multiple sequence alignment、模板、注意力和三维几何约束预测结构,并给出置信度。

它与 AlphaGo 的共同点主要是:

  • 选择一个长期公认、评价明确的 grand challenge;
  • 端到端学习替代手工管线;
  • 把领域结构嵌进模型;
  • 用统一 benchmark(CASP)检验;
  • 通过大团队系统工程跨越临界点。

算法上它并不是简单复用 MCTS 或 self-play。Evoformer、结构模块、蛋白几何和训练数据来自专门创新。

3. 为什么它是“根节点问题”的典型

蛋白三维结构影响:

  • 功能理解;
  • 疾病机制;
  • 药物靶点;
  • 酶设计;
  • 进化研究。

当结构预测大幅加速并通过数据库开放后,许多研究者可把原本昂贵的结构问题当作上游工具。

Hassabis 喜欢的科学任务不是随机找一个能刷榜的预测问题,而是寻找这种解锁下游分支的 bottleneck。

4. AlphaFold 的边界也说明“解决问题”需谨慎

高质量静态结构预测不等于解决:

  • 蛋白动态;
  • 细胞环境;
  • 配体相互作用的全部化学;
  • 实验条件;
  • 新药安全性;
  • 生物系统因果。

AlphaFold 3 扩展到复合物与分子相互作用,但预测仍服务实验,不替代全部湿实验。用“蛋白折叠已解决”描述社会影响可以理解,技术上应限定为某类结构预测取得突破。


九、从 AlphaFold 到一组“发现系统”:不同项目共享什么

DeepMind 后续科学/数学工作包括:

  • AlphaTensor 搜索矩阵乘法算法;
  • AlphaDev 在汇编级优化排序等算法;
  • GNoME 预测新材料稳定性;
  • AlphaGeometry 与 AlphaProof 处理形式数学;
  • AlphaEvolve 用 Gemini 提案代码、自动评价和演化候选;
  • AI co-scientist 让多个 agent 生成、批评和排序假说。

这些项目不能都归功于 Hassabis 个人,也不共享完全同一算法。但它们越来越形成共同工作流。

1. Foundation model 生成候选

语言/代码模型提供:

  • 人类知识先验;
  • 可读方案;
  • 跨领域概念组合;
  • 快速程序变异。

2. 搜索或 population 扩大候选空间

不把一次采样当答案,而维护:

  • 多个方案;
  • 改进分支;
  • 竞争/辩论;
  • 反例与修订;
  • 历史 archive。

3. 专门 evaluator 给出硬反馈

  • 编译器与 benchmark;
  • 形式 proof checker;
  • 结构/物理计算;
  • 实验数据;
  • 人类专家。

4. 结果再训练或指导生成器

成功候选提供新数据和偏好,使下一轮 proposal 更有效。

这正是 Hassabis 所谓学习、搜索与工具组合的现代形式。AlphaGo 中 evaluator 是胜负;科学中需要为每个领域构造不同工具和验证链。


十、形式数学:为什么它是从游戏到开放科学之间的桥

AlphaGeometry、AlphaProof 与 Gemini Deep Think 的数学工作在 Hassabis 路线中非常关键,因为形式数学同时具有:

  • 开放、创造性的中间构造;
  • 明确、机器可验证的最终正确性;
  • 巨大搜索空间;
  • 高质量人类知识;
  • 可自动生成训练题。

1. 语言模型与符号验证器的互补

语言/神经模型擅长:

  • 猜辅助构造;
  • 识别相似结构;
  • 提议证明方向;
  • 把非形式直觉翻成候选步骤。

形式系统擅长:

  • 检查每一步;
  • 拒绝语义含混;
  • 保证结论;
  • 生成可复现证据。

搜索把两者连接:生成器缩小空间,验证器提供零歧义反馈,RL 学习更好的提案策略。

2. 为什么这不能直接推广全部科学

真实科学没有完备 proof checker:

  • 实验有噪声;
  • 文献有偏差;
  • 假说重要性主观;
  • 变量不可完全控制;
  • 结果可能多年后才出现;
  • 错误模型也能拟合现有数据。

形式数学因此是高级推理的优质实验场,却仍比实验科学更接近游戏。


十一、Genie 与可交互世界:从“模型棋盘”走向“模型环境”

Genie从无动作标签的互联网视频学习可控环境,包含视频 tokenizer、自回归 dynamics 和 latent action model。用户可逐帧行动,即使训练数据未提供真实控制标签。

后续 Genie 3进一步强调实时、可导航、较长一致性的通用世界模型,并公开列出:

  • action space 仍有限;
  • 多 agent 互动困难;
  • 真实地点无法完美复现;
  • 文字生成受限;
  • 连续互动仅能维持数分钟而非数小时。

1. Genie 解决的关键瓶颈

传统 RL 需要人工建环境;现实经验又昂贵。若模型能从视频学习:

  • 隐含行动;
  • 场景转移;
  • 可交互视觉世界;

就可能自动生成大量训练环境。

这与 Clune 的环境生成、Fei-Fei 的空间智能和 Levine/Finn 的机器人世界模型相汇。

2. 交互视频不等于可靠模拟

Genie 能根据动作生成下一观察,首先证明 learned renderer / dynamics。要训练现实 agent,还需要:

  • 行动语义与真实控制对齐;
  • 隐藏状态持久;
  • 物理干预正确;
  • 稀有危险事件可模拟;
  • 长时间误差不积累;
  • sim-to-real 验证。

Hassabis 把它视为 AGI 的 stepping stone 是合理研究押注,不是已经拥有物理世界模型的证据。


十二、2026 年 AlphaGo 十周年:Hassabis 把路线正式压成三个组件

AlphaGo 十周年回顾中,Hassabis 明确提出未来关键组合:

  1. Gemini 的 world models;
  2. AlphaGo 式 search and planning;
  3. specialized AI tool use。

这比“LLM 会不会直接变 AGI”的争论更具体。

1. World model 提供跨模态状态和先验

Gemini 从一开始被设计为多模态,处理文本、图像、音频、视频和代码。其目标不是只生成语言,而是让不同观察进入共同可推理模型。

2. Search / planning 提供运行时适应

一次前向传播像直觉;复杂问题需要:

  • 提出候选;
  • 展开后果;
  • 评价;
  • 回退;
  • 重新分配计算。

这是 AlphaGo 留下的核心架构遗产。

3. Tools 提供专门能力和外部事实

通用模型不应把所有算法、数据库和科学模拟都压进权重。它可以调用:

  • AlphaFold;
  • 计算器和代码;
  • 形式验证器;
  • 搜索与数据库;
  • 实验设备;
  • 专门预测模型。

工具既扩大能力,也提供验证信号。

4. 真正创造力的标准被他主动抬高

回顾文章区分:

  • 在围棋中发现一个出人意料的好着;
  • 发明一个像围棋一样深刻、值得人长期研究的新游戏。

前者是在既定规则内搜索,后者要生成规则、价值和问题本身。这个区分与 Clune 的开放性路线接近,也承认 Move 37 不是创造力终点。


十三、Hassabis 的世界观:AGI 是系统工程,不是一个纯净算法

1. 他不太迷信单一机制

DeepMind 的代表项目通常混合:

  • 神经表征;
  • RL;
  • 搜索;
  • 记忆;
  • 符号工具;
  • 领域结构;
  • 大规模工程。

Hassabis 的判断标准更像“这些机制能否在一个系统里跨过公认难题”,而不是维护某种理论纯洁性。

2. Benchmark 选择本身是一项研究能力

好标杆应:

  • 简单定义、极难解决;
  • 有明确进步信号;
  • 不易靠表面捷径;
  • 成功会验证一般机制;
  • 对科学或社会有外溢价值。

围棋、CASP、IMO 和算法优化都是这种风格。

3. 内部模拟是记忆与行动之间的桥

从海马 scene construction 到 AlphaGo rollout、MuZero latent dynamics、Genie 交互环境,持续出现同一功能:

在真正行动前,构造若干足够一致的可能未来,并比较它们。

“想象”不要求生成给人看的漂亮画面;只需保留决策相关反事实。但面向人和机器人时,视觉、空间与物理一致性又会重新变重要。

4. 科学发现是能力与价值最可能同时提高的终点

Hassabis 不满足于聊天或自动化现有工作。他长期把 AGI 价值定位在:

  • 找到人未发现的结构;
  • 攻克根节点问题;
  • 提出新假说;
  • 加速实验循环;
  • 让通用知识与专门模型互相调用。

这是技术路线,也是研究组织战略。


十四、与其他路线的关系

1. 与 LeCun:共识很大,方法风格不同

共同点:

  • 纯文本自回归不是完整世界智能;
  • 需要 world model、memory、planning;
  • 潜在状态应支持行动;
  • 物理世界理解是关键;
  • 仅一次前向生成不足以可靠推理。

差异:

  • LeCun 更想找一套干净、分层、JEPA 式学习目标和认知架构;
  • Hassabis 更接受混合系统,只要组件经实证互补;
  • LeCun 对逐像素生成更警惕;
  • DeepMind 同时推进 Gemini/Genie 生成世界、RL search 和符号工具;
  • LeCun 强调儿童式自监督样本效率;
  • Hassabis 的成功多来自可海量模拟或严格验证的问题。

如果 LeCun 在设计认知系统的内核,Hassabis 更像在构建含模型、搜索器、工具链和科学应用的整机。

2. 与 Sutton / Silver:Silver 是算法主线,Hassabis 是组织与组合主线

Silver 直接推动 AlphaGo、AlphaZero、MuZero 的 RL/search 算法。Hassabis 的个人贡献更适合描述为:

  • 选择问题;
  • 形成跨学科研究纲领;
  • 组织大团队;
  • 把方法迁移到科学;
  • 设定 AGI 组合框架。

不应把团队每个技术细节都人格化给 CEO。

Sutton 会更强调奖励与持续经验的一般性;Hassabis 更愿意使用人类数据、领域结构和专门工具,只要它们加快解决重要问题。

3. 与 Fei-Fei Li:都押注 world model,但接口不同

Fei-Fei 路线强调:

  • 三维空间;
  • renderer / simulator / planner;
  • 可编辑、可导出的世界状态;
  • 机器人与内容工具。

Hassabis 路线强调:

  • 对 agent 有用的多模态世界先验;
  • latent rollout;
  • search;
  • 通用模型调用专门工具。

MuZero 甚至主动不重建完整观察;World Labs 则强调显式三维作为共同接口。未来系统很可能结合:任务相关潜空间负责高效计划,外显几何/模拟负责校验与交互。

4. 与 Brown:搜索哲学相近,起点不同

Brown 从隐藏信息、belief 和 exploitability 出发;DeepMind 经典路线从完美信息棋类和已知状态出发。

LLM agent 与现实科学需要两者:

  • Hassabis/Silver 式世界模型和规划;
  • Brown 式不确定信念、对手与测试时计算;
  • 工具提供硬反馈。

十五、判断记录:哪些已经命中,哪些仍是组合愿景

A. “学习 + 搜索”是复杂决策的强结构

结论:强力命中。

AlphaGo、AlphaZero、MuZero、形式数学、代码搜索和 reasoning model 都支持。纯搜索组合爆炸,纯 policy 又在罕见局面缺乏适应。

B. “人类专家数据可逐步被自我对弈替代”

结论:在完美模拟器任务中命中。

AlphaGo Zero / AlphaZero 证明可以去掉棋谱。现实任务中自我经验受模拟器、reward 和安全限制,不能简单外推。

C. “规划模型无需复刻全部世界,只需预测决策相关量”

结论:MuZero 强力支持。

这是极具影响的模型观。问题在于多任务/开放世界中什么是“相关”会变化,过度任务压缩可能损害迁移。

D. “游戏方法可以推动科学”

结论:在问题选择与搜索哲学层面部分命中。

AlphaFold、AlphaTensor、AlphaDev、AlphaGeometry/Proof、AlphaEvolve 显示 AI 可产生可验证科学/算法结果。

但没有一套 AlphaGo 算法直接通吃科学;每个领域仍需专门数据、架构和 evaluator。

E. “Gemini world model + AlphaGo planning + tools 会汇成 AGI”

结论:清晰路线图,尚未兑现。

三个部件分别有证据,统一系统仍面对:

  • 长期记忆;
  • 目标稳定;
  • 开放世界反馈;
  • 工具安全;
  • world model 误差;
  • 跨任务持续学习;
  • 计算成本。

F. “科学将成为高级 AI 的最佳价值证明”

结论:已有强早期证据,完整闭环未成。

预测结构和发现算法已成功;独立提出重要问题、设计现实实验、解释异常、迭代理论的端到端 scientist 仍远未成熟。


十六、他最强的论证与最弱的外推

最强论证:直觉、搜索和工具是互补能力,不能相互替代

  • 没有学习先验,搜索空间太大;
  • 没有搜索,模型在陌生局面只能依赖一次模式匹配;
  • 没有工具,计算和验证容易停留在语言自洽;
  • 没有反馈,搜索无法学会怎样更有效。

这套分工已跨棋类、数学、代码和蛋白结构得到多次支持。

最弱外推:把若干已成功组件连接,就会自然出现统一一般智能

系统集成的困难不是 API 对接:

  • world model 的状态未必适合 planner;
  • planner 可能利用 simulator 漏洞;
  • tool 输出会含噪声或恶意内容;
  • 长程目标无法由短程 value 稳定评价;
  • 不同领域 evaluator 不可比较;
  • 通用模型可能不知道何时不应行动;
  • 组件误差会在闭环中放大。

“组件都存在”是必要证据,不是组合后性质的证明。


十七、怎样评价这条路线

1. Search 是否真的增加了能力

  • 固定模型时,搜索深度增加是否稳定提高成功率;
  • 提升来自更多计算还是 benchmark 特定调参;
  • value 能否识别新题中的进展;
  • rollout 误差何时超过规划收益;
  • 模型是否学会自适应停止。

2. World model 是否支持反事实而非只生成画面

  • 干预一个变量后,后果是否系统改变;
  • 对象和约束是否跨长时间保持;
  • 未见动作组合能否正确预测;
  • 潜在状态能否支持新目标;
  • 不确定性是否校准。

3. Tool use 是否闭合验证

  • 工具结果能否被正确解释;
  • 模型会不会选择错误工具;
  • 多工具结果冲突时如何处理;
  • 形式验证之外的实验噪声怎样进入 belief;
  • 外部数据是否有来源和版本追踪。

4. AI for Science 是否产生真正新增知识

  • 结果是否在训练截止后出现;
  • 是否由独立实验确认;
  • AI 是否只重发现文献已有假说;
  • 发现对下游研究是否有实际解锁;
  • 人类专家投入应怎样计入;
  • 负结果和失败实验是否被利用。

十八、按思想演进阅读原始材料

第一阶段:记忆与想象

  1. Patients with hippocampal amnesia cannot imagine new experiences
    • 重点看碎片细节与空间连贯场景的差异;
    • 不要把神经科学结果直接等同算法。

第二阶段:从像素到控制

  1. Human-level control through deep reinforcement learning / DQN
    • 看 experience replay、target network 与同一算法跨游戏;
    • 同时记录每游戏单独训练和数据效率限制。

第三阶段:学习与搜索的合流

  1. AlphaGo 项目与研究

    • 理解 supervised policy、RL policy、value 与 MCTS 的分工。
  2. AlphaGo Zero: Starting from scratch

    • 看 search policy 怎样成为网络训练目标;
    • 明确“zero”移除了哪些知识、保留哪些结构。
  3. AlphaZero 与 MuZero 路线

    • 用来比较从已知规则到学习潜在 dynamics 的转折。
  4. MuZero 说明

    • 重点理解不重建观察、只预测 reward/value/policy 的含义。

第四阶段:从解决游戏到解决科学根节点

  1. AlphaFold

    • 看专门领域结构、置信度和数据库开放;
    • 不要把它误写成 AlphaGo 架构直接迁移。
  2. AlphaGo at 10

    • 这是 2026 年 Hassabis 对路线最完整的自我总结;
    • 重点看 world model、search/planning、specialized tools 三组件。

第五阶段:可交互世界与统一系统愿景

  1. Genie: Generative Interactive Environments

    • 看无动作标签视频中怎样学习 latent actions;
    • 区分可交互 renderer 与可靠物理模拟。
  2. Genie 3

    • 重点读官方列出的 action、multi-agent、真实地点和时长限制。
  3. Google DeepMind Podcast

    • 适合长期追踪各项目负责人;
    • 对 CEO 路线图仍需用论文和独立验证约束。

十九、最后的压缩:怎样长期跟踪 Hassabis

不要只跟踪“AGI 还有几年”或下一次演示。更有价值的八个问题是:

  1. 世界模型是否能在行动干预下保持因果和空间一致?
  2. 搜索深度增加时,收益是否超过模型误差积累?
  3. 通用模型能否自己选择正确专用工具并处理冲突结果?
  4. 棋类/形式数学中的 verifier 优势,怎样迁移到迟延、昂贵的实验科学?
  5. AI 是否开始提出训练资料中没有、且经现实实验确认的重要假说?
  6. 通用模型与 AlphaFold 等专门模型之间能否双向学习,而不只是单向调用?
  7. 系统能否从“规则内的新着”走向“发明值得研究的新问题和新评价标准”?
  8. 大型团队的系统成功中,哪些机制真正跨领域,哪些只是每次重新做一套领域工程?

Hassabis 最值得关注的判断可以压成一句:

高级智能不是把所有知识塞进一个模型,而是让模型知道怎样记忆世界、在内部想象不同未来、用搜索分配思考,并调用能把猜想变成证据的工具。

END · 09

不要问“该信谁”,要问:什么证据会迫使这条路线再次转向?

回到路线地图 →