通用系统与科学 · RESEARCH TRAJECTORY
Demis Hassabis:把记忆、想象、搜索、学习与工具拼成一台“发现机器”
游戏、世界模型、搜索与科学工具不是几次跨界,而是一条构造可验证发现机器的连续路线。
Hassabis 最稳定的判断不是某一种网络架构,而是一种组合系统观:快速学习的模型提供直觉与世界先验,记忆保留可重组经验,搜索在当前问题上展开反事实,价值函数剪掉绝大多数分支,专门工具负责可验证计算。游戏是这套机器的试验场,AlphaFold 与数学/算法发现则是他试图证明它能从“赢”转向“发现”的第二阶段。
一、先把他的主线说准确:不是“从游戏跨界到科学”,而是持续寻找可验证的巨大搜索空间
Hassabis 的履历容易被写成传奇串联:少年棋手、游戏设计师、神经科学家、DeepMind 创始人、AlphaGo、AlphaFold、Gemini。这样写很热闹,却解释不了项目为何彼此相关。
更有解释力的主线是:
- 智能必须形成可复用的内部模型,而不只做刺激—反应。
- 记忆的用途不是存档,而是把过去元素重组为未来场景。
- 复杂问题需要“直觉 + 搜索”。 学习压缩空间,搜索纠正一次直觉。
- 世界模型不必复刻一切,只需保留当前决策所需结构。
- 评价清晰、组合空间巨大、能快速迭代的问题最适合推动 AI。
- 科学中的根节点问题一旦解决,会解锁大量下游研究。
- 通用模型、规划算法和专门科学工具最终应形成一个统一工作流。
这解释了为什么围棋、蛋白结构、形式数学和代码算法在他的图景中属于同一类问题:
- 候选空间极大;
- 人类有重要但不完整的先验;
- 可以构造明确反馈;
- 好的中间表示会极大压缩搜索;
- 成功结果可以被外部验证;
- 一项突破能产生人类没有明确写入的新结构。
二、游戏不是玩具:它是把智能拆成可测能力的实验装置
1. 为什么游戏长期吸引 Hassabis
电子游戏和棋类具有现实世界少见的实验优势:
- 规则明确;
- 状态或观察可记录;
- 行动空间受限;
- 奖励清楚;
- 可无限模拟;
- 难度可逐步增加;
- 人类专家提供基线;
- 创新策略能被对局直接检验。
游戏因此像认知科学的风洞。它不能代表完整现实,却能让研究者分别检验:
- 感知;
- 记忆;
- 探索;
- 规划;
- 对手建模;
- 长期 credit assignment;
- 快速适应。
Hassabis 的项目风格从一开始就不是“找一个 benchmark 刷分”,而是选择一个表面受限、内部组合爆炸的环境,让算法系统跨过人类公认的能力边界。
2. 这也埋下一个长期风险
游戏的所有优点在现实中都可能消失:
- 规则不完整;
- 状态隐藏;
- 奖励含混;
- 环境不可重置;
- 失败昂贵;
- 对手和制度会改变;
- 模拟器与现实有差距。
因此游戏是方法孵化器,不是一般智能已经解决的证据。Hassabis 后来的真正考验,是这些机制能否在科学和开放世界中保留价值。
三、2007 年海马研究:记忆、想象未来与场景构造是同一套能力的不同用法
Hassabis 在认知神经科学阶段参与的海马损伤研究发现,一些失忆患者不仅难以回忆个人过去,也难以想象新的、空间连贯的场景。
1. 研究的重要观察
患者可以说出零散对象和细节,却难把它们整合进一个统一空间:
- 场景缺乏广阔、一致的布局;
- 元素像孤立清单;
- 难形成“我站在这里、那些对象以这种关系存在”的体验。
论文据此提出海马可能支持 scene construction:把对象、感觉和空间关系组合成连贯事件模型。
2. 这怎样改变对记忆的理解
记忆不是硬盘式读取。人回忆过去时也在重构:
- 选取相关片段;
- 把它们放回空间与因果关系;
- 补全缺失部分;
- 根据当前目标重组。
想象未来使用相同机制,只是把旧元素组合成从未发生的场景。因此:
记忆的智能价值,在于支持反事实和计划,而不只是保持事实。
3. 不要把神经科学论文硬说成 MuZero 的直接算法来源
海马 scene construction 与后来世界模型、rollout 的确有概念连续性,但没有证据表明 DQN、AlphaGo 或 MuZero 从这篇实验逐项推导。
更准确的关系是问题意识:
- 内部状态必须把离散元素组织成一致场景;
- 想象是决策前在内部试演可能未来;
- 记忆、世界模型和规划不应被当作独立功能。
Hassabis 后来的系统不断寻找这种“可供搜索的内部场景”,但具体实现主要来自 RL、深度学习与工程,而非海马生物模型。
四、DeepMind 的早期纲领:同一个学习系统能否从像素掌握许多任务
1. DQN 之前,强化学习与视觉往往分开
经典 RL 常假设状态已是低维、结构化变量;视觉研究则主要做分类。若 agent 直接接收 Atari 像素,它必须同时解决:
- 哪些图像结构是对象;
- 速度和运动怎样从帧序列推断;
- 哪些动作影响奖励;
- 延迟奖励如何归因;
- 不同游戏规则怎样由交互发现。
2. DQN 是几个已知部件的关键组合
Human-level control through deep reinforcement learning把卷积网络与 Q-learning 结合,并用两个稳定化机制。
Experience replay:
- 保存过去 transition;
- 随机抽样训练;
- 打破连续帧强相关;
- 提高数据复用;
- 让训练分布更稳定。
Target network:
- 用一个较慢更新的网络产生 bootstrap target;
- 避免预测目标随当前参数每一步剧烈移动。
输入是像素,输出是各动作 Q 值;同一总体算法用于多种 Atari 游戏。
3. DQN 真正证明了什么
它证明:
- 深度表征可与 trial-and-error 控制端到端结合;
- 同一架构可跨多个视觉任务;
- 人不必为每个游戏手写状态特征;
- 大规模 replay 与稳定训练能让 RL 进入高维感知。
4. 它没有证明什么
- agent 仍分别为每个游戏训练;
- 数据效率远低于人;
- 奖励由游戏明确提供;
- 记忆和规划非常有限;
- 对画面变化与新规则不稳健;
- Atari 界面比真实世界简单得多。
DQN 的“一般性”是同一算法跨任务,不是一个 agent 在任务间持续迁移。
五、AlphaGo:学习负责直觉,搜索负责在当前局面上重新思考
围棋的状态分支巨大,传统 brute-force 搜索无法像国际象棋那样展开足够深。AlphaGo 的关键不是单独一个网络,而是把三种知识放在不同位置。
1. Supervised policy:先学人类棋感
用专家棋谱训练 policy network,预测高手在当前局面会下哪里。它把所有合法动作压缩成少数 plausible move。
这不是最终策略,却让搜索不必平均探索所有落点。
2. Reinforcement learning:超越模仿
policy 通过自我对弈继续优化胜率。人类数据提供起点,自我对弈可以发现人类分布之外的策略。
3. Value network:不用把每条分支走到终局
value network 估计当前局面最终胜率。搜索到一定深度后即可截断,用学习值替代完整 rollout。
4. Monte Carlo Tree Search:在当前局面分配计算
MCTS 在:
- 已知高概率好棋;
- 尚未充分探索的落点;
- value 较高的分支;
之间动态权衡。网络决定优先想什么,搜索发现网络一次判断中的错误,搜索结果又改善行动。
5. Move 37 为什么重要,又容易被神话
对李世石第二局第 37 手之所以震撼,是它在人类专家先验中极不常见,却经后续局势证明有效。
它说明系统不是简单检索棋谱;学习 + 自我对弈 + 搜索能在规则空间中找到人类文化未充分探索的策略。
但它仍是在:
- 固定规则;
- 单一清晰目标;
- 完整模拟器;
- 海量计算;
中产生的新颖性。称它为一般创造力的完整证据会过度;称它为“有验证器的搜索可产生非模仿新知识”的证据则很强。
六、AlphaGo Zero 与 AlphaZero:系统性删除人类知识,而不是反对一切先验
AlphaGo Zero去掉人类棋谱,只保留围棋规则和自我对弈。一个网络同时输出 policy 与 value,MCTS 生成更强行动分布,训练再让网络模仿搜索结果和最终胜负。
1. 训练闭环
- 当前网络参与自我对弈;
- MCTS 在每一步改进当前 policy;
- 对局生成状态、搜索 policy 和胜负;
- 网络学习搜索后的 policy 与最终 value;
- 新网络再次自我对弈。
搜索像一个临时、昂贵的教师;网络把搜索成果 amortize 进快速直觉。
2. AlphaZero 的泛化
AlphaZero 把同一框架用于围棋、国际象棋和日本将棋,减少领域特定启发式。
这支持 Hassabis/Silver 的一个长期判断:
与其把人类专家策略写进系统,不如给一般学习和搜索足够算力,让知识由自我生成经验形成。
3. “从零开始”仍有重要限定
系统仍得到:
- 完整规则;
- 合法动作;
- 终局胜负;
- 可完美复制的模拟器;
- 网络和 MCTS 架构;
- 大量计算。
它移除的是 人类对局和棋类启发式,不是一切人类先验。把 AlphaZero 写成 tabula rasa 会遮蔽最关键的工程归纳偏置。
七、MuZero:规划模型不必生成世界,只需保留决策相关结构
MuZero进一步去掉给定状态转移规则。系统从观察和奖励中学习一个潜在动力学模型,并在其上搜索。
1. 三个学习函数
MuZero 通常可理解为:
Representation function:
- 把历史观察编码为潜在状态。
Dynamics function:
- 给定潜在状态和动作,预测下一潜在状态与即时 reward。
Prediction function:
- 从潜在状态预测 policy 与 value。
MCTS 不在真实棋盘/像素模拟器中搜索,而在学习的潜空间中反复应用 dynamics。
2. 最深的技术判断:模型无需重建观察
传统 world model 容易被要求预测下一帧每个像素。MuZero 不要求潜在状态解码回完整图像,只优化:
- reward;
- value;
- policy。
因此它可以忽略:
- 与决策无关的纹理;
- 不可预测的视觉噪声;
- 不影响奖励的细节。
这与 LeCun 后来的 JEPA 思路有亲缘:有用世界模型应在潜空间保留可预测、与行动相关的结构,而非浪费容量生成一切感官细节。
3. 为什么 task relevance 既是优势也是风险
若当前 reward 固定,丢掉无关细节提高效率。但开放世界中任务会改变:
- 今天无关的颜色,明天可能是安全信号;
- 训练 reward 未惩罚的物理变量,部署时可能致命;
- 只为当前 policy/value 学的状态可能无法支持新目标;
- 潜空间错误难以由人检查。
MuZero 证明 task-oriented latent model 足以规划一些复杂任务,不证明它拥有可任意复用的完整世界知识。
4. 模型误差与搜索深度的矛盾
搜索越深,理论上规划越远;但 learned dynamics 每一步都有误差。若误差累积,更多搜索可能变差。
因此世界模型 + 搜索路线必须平衡:
- 表示质量;
- rollout horizon;
- value bootstrap;
- 模型不确定性;
- 真实经验校正。
这在真实机器人和科学模拟中比棋类更尖锐。
八、从游戏到科学:连续性在“问题选择与搜索结构”,不在简单搬架构
1. 为什么科学是 Hassabis 的终极应用
科学问题常具有:
- 巨大组合空间;
- 稀疏但高价值发现;
- 可积累的人类文献和数据;
- 数学、实验或结构验证;
- 一项根节点突破解锁许多下游。
它符合 DeepMind 在游戏中培养的能力组合:
- 表征学习压缩状态;
- 搜索生成候选;
- value / confidence 排序;
- 工具执行验证;
- 反馈进入下一轮。
但现实科学比游戏困难,因为数据有噪声、实验昂贵,真正重要的问题甚至没有已知评价函数。
2. AlphaFold 不是 AlphaGo “换个棋盘”
AlphaFold 项目页代表 Hassabis 路线的关键转折。AlphaFold 2 用蛋白序列、multiple sequence alignment、模板、注意力和三维几何约束预测结构,并给出置信度。
它与 AlphaGo 的共同点主要是:
- 选择一个长期公认、评价明确的 grand challenge;
- 端到端学习替代手工管线;
- 把领域结构嵌进模型;
- 用统一 benchmark(CASP)检验;
- 通过大团队系统工程跨越临界点。
算法上它并不是简单复用 MCTS 或 self-play。Evoformer、结构模块、蛋白几何和训练数据来自专门创新。
3. 为什么它是“根节点问题”的典型
蛋白三维结构影响:
- 功能理解;
- 疾病机制;
- 药物靶点;
- 酶设计;
- 进化研究。
当结构预测大幅加速并通过数据库开放后,许多研究者可把原本昂贵的结构问题当作上游工具。
Hassabis 喜欢的科学任务不是随机找一个能刷榜的预测问题,而是寻找这种解锁下游分支的 bottleneck。
4. AlphaFold 的边界也说明“解决问题”需谨慎
高质量静态结构预测不等于解决:
- 蛋白动态;
- 细胞环境;
- 配体相互作用的全部化学;
- 实验条件;
- 新药安全性;
- 生物系统因果。
AlphaFold 3 扩展到复合物与分子相互作用,但预测仍服务实验,不替代全部湿实验。用“蛋白折叠已解决”描述社会影响可以理解,技术上应限定为某类结构预测取得突破。
九、从 AlphaFold 到一组“发现系统”:不同项目共享什么
DeepMind 后续科学/数学工作包括:
- AlphaTensor 搜索矩阵乘法算法;
- AlphaDev 在汇编级优化排序等算法;
- GNoME 预测新材料稳定性;
- AlphaGeometry 与 AlphaProof 处理形式数学;
- AlphaEvolve 用 Gemini 提案代码、自动评价和演化候选;
- AI co-scientist 让多个 agent 生成、批评和排序假说。
这些项目不能都归功于 Hassabis 个人,也不共享完全同一算法。但它们越来越形成共同工作流。
1. Foundation model 生成候选
语言/代码模型提供:
- 人类知识先验;
- 可读方案;
- 跨领域概念组合;
- 快速程序变异。
2. 搜索或 population 扩大候选空间
不把一次采样当答案,而维护:
- 多个方案;
- 改进分支;
- 竞争/辩论;
- 反例与修订;
- 历史 archive。
3. 专门 evaluator 给出硬反馈
- 编译器与 benchmark;
- 形式 proof checker;
- 结构/物理计算;
- 实验数据;
- 人类专家。
4. 结果再训练或指导生成器
成功候选提供新数据和偏好,使下一轮 proposal 更有效。
这正是 Hassabis 所谓学习、搜索与工具组合的现代形式。AlphaGo 中 evaluator 是胜负;科学中需要为每个领域构造不同工具和验证链。
十、形式数学:为什么它是从游戏到开放科学之间的桥
AlphaGeometry、AlphaProof 与 Gemini Deep Think 的数学工作在 Hassabis 路线中非常关键,因为形式数学同时具有:
- 开放、创造性的中间构造;
- 明确、机器可验证的最终正确性;
- 巨大搜索空间;
- 高质量人类知识;
- 可自动生成训练题。
1. 语言模型与符号验证器的互补
语言/神经模型擅长:
- 猜辅助构造;
- 识别相似结构;
- 提议证明方向;
- 把非形式直觉翻成候选步骤。
形式系统擅长:
- 检查每一步;
- 拒绝语义含混;
- 保证结论;
- 生成可复现证据。
搜索把两者连接:生成器缩小空间,验证器提供零歧义反馈,RL 学习更好的提案策略。
2. 为什么这不能直接推广全部科学
真实科学没有完备 proof checker:
- 实验有噪声;
- 文献有偏差;
- 假说重要性主观;
- 变量不可完全控制;
- 结果可能多年后才出现;
- 错误模型也能拟合现有数据。
形式数学因此是高级推理的优质实验场,却仍比实验科学更接近游戏。
十一、Genie 与可交互世界:从“模型棋盘”走向“模型环境”
Genie从无动作标签的互联网视频学习可控环境,包含视频 tokenizer、自回归 dynamics 和 latent action model。用户可逐帧行动,即使训练数据未提供真实控制标签。
后续 Genie 3进一步强调实时、可导航、较长一致性的通用世界模型,并公开列出:
- action space 仍有限;
- 多 agent 互动困难;
- 真实地点无法完美复现;
- 文字生成受限;
- 连续互动仅能维持数分钟而非数小时。
1. Genie 解决的关键瓶颈
传统 RL 需要人工建环境;现实经验又昂贵。若模型能从视频学习:
- 隐含行动;
- 场景转移;
- 可交互视觉世界;
就可能自动生成大量训练环境。
这与 Clune 的环境生成、Fei-Fei 的空间智能和 Levine/Finn 的机器人世界模型相汇。
2. 交互视频不等于可靠模拟
Genie 能根据动作生成下一观察,首先证明 learned renderer / dynamics。要训练现实 agent,还需要:
- 行动语义与真实控制对齐;
- 隐藏状态持久;
- 物理干预正确;
- 稀有危险事件可模拟;
- 长时间误差不积累;
- sim-to-real 验证。
Hassabis 把它视为 AGI 的 stepping stone 是合理研究押注,不是已经拥有物理世界模型的证据。
十二、2026 年 AlphaGo 十周年:Hassabis 把路线正式压成三个组件
在 AlphaGo 十周年回顾中,Hassabis 明确提出未来关键组合:
- Gemini 的 world models;
- AlphaGo 式 search and planning;
- specialized AI tool use。
这比“LLM 会不会直接变 AGI”的争论更具体。
1. World model 提供跨模态状态和先验
Gemini 从一开始被设计为多模态,处理文本、图像、音频、视频和代码。其目标不是只生成语言,而是让不同观察进入共同可推理模型。
2. Search / planning 提供运行时适应
一次前向传播像直觉;复杂问题需要:
- 提出候选;
- 展开后果;
- 评价;
- 回退;
- 重新分配计算。
这是 AlphaGo 留下的核心架构遗产。
3. Tools 提供专门能力和外部事实
通用模型不应把所有算法、数据库和科学模拟都压进权重。它可以调用:
- AlphaFold;
- 计算器和代码;
- 形式验证器;
- 搜索与数据库;
- 实验设备;
- 专门预测模型。
工具既扩大能力,也提供验证信号。
4. 真正创造力的标准被他主动抬高
回顾文章区分:
- 在围棋中发现一个出人意料的好着;
- 发明一个像围棋一样深刻、值得人长期研究的新游戏。
前者是在既定规则内搜索,后者要生成规则、价值和问题本身。这个区分与 Clune 的开放性路线接近,也承认 Move 37 不是创造力终点。
十三、Hassabis 的世界观:AGI 是系统工程,不是一个纯净算法
1. 他不太迷信单一机制
DeepMind 的代表项目通常混合:
- 神经表征;
- RL;
- 搜索;
- 记忆;
- 符号工具;
- 领域结构;
- 大规模工程。
Hassabis 的判断标准更像“这些机制能否在一个系统里跨过公认难题”,而不是维护某种理论纯洁性。
2. Benchmark 选择本身是一项研究能力
好标杆应:
- 简单定义、极难解决;
- 有明确进步信号;
- 不易靠表面捷径;
- 成功会验证一般机制;
- 对科学或社会有外溢价值。
围棋、CASP、IMO 和算法优化都是这种风格。
3. 内部模拟是记忆与行动之间的桥
从海马 scene construction 到 AlphaGo rollout、MuZero latent dynamics、Genie 交互环境,持续出现同一功能:
在真正行动前,构造若干足够一致的可能未来,并比较它们。
“想象”不要求生成给人看的漂亮画面;只需保留决策相关反事实。但面向人和机器人时,视觉、空间与物理一致性又会重新变重要。
4. 科学发现是能力与价值最可能同时提高的终点
Hassabis 不满足于聊天或自动化现有工作。他长期把 AGI 价值定位在:
- 找到人未发现的结构;
- 攻克根节点问题;
- 提出新假说;
- 加速实验循环;
- 让通用知识与专门模型互相调用。
这是技术路线,也是研究组织战略。
十四、与其他路线的关系
1. 与 LeCun:共识很大,方法风格不同
共同点:
- 纯文本自回归不是完整世界智能;
- 需要 world model、memory、planning;
- 潜在状态应支持行动;
- 物理世界理解是关键;
- 仅一次前向生成不足以可靠推理。
差异:
- LeCun 更想找一套干净、分层、JEPA 式学习目标和认知架构;
- Hassabis 更接受混合系统,只要组件经实证互补;
- LeCun 对逐像素生成更警惕;
- DeepMind 同时推进 Gemini/Genie 生成世界、RL search 和符号工具;
- LeCun 强调儿童式自监督样本效率;
- Hassabis 的成功多来自可海量模拟或严格验证的问题。
如果 LeCun 在设计认知系统的内核,Hassabis 更像在构建含模型、搜索器、工具链和科学应用的整机。
2. 与 Sutton / Silver:Silver 是算法主线,Hassabis 是组织与组合主线
Silver 直接推动 AlphaGo、AlphaZero、MuZero 的 RL/search 算法。Hassabis 的个人贡献更适合描述为:
- 选择问题;
- 形成跨学科研究纲领;
- 组织大团队;
- 把方法迁移到科学;
- 设定 AGI 组合框架。
不应把团队每个技术细节都人格化给 CEO。
Sutton 会更强调奖励与持续经验的一般性;Hassabis 更愿意使用人类数据、领域结构和专门工具,只要它们加快解决重要问题。
3. 与 Fei-Fei Li:都押注 world model,但接口不同
Fei-Fei 路线强调:
- 三维空间;
- renderer / simulator / planner;
- 可编辑、可导出的世界状态;
- 机器人与内容工具。
Hassabis 路线强调:
- 对 agent 有用的多模态世界先验;
- latent rollout;
- search;
- 通用模型调用专门工具。
MuZero 甚至主动不重建完整观察;World Labs 则强调显式三维作为共同接口。未来系统很可能结合:任务相关潜空间负责高效计划,外显几何/模拟负责校验与交互。
4. 与 Brown:搜索哲学相近,起点不同
Brown 从隐藏信息、belief 和 exploitability 出发;DeepMind 经典路线从完美信息棋类和已知状态出发。
LLM agent 与现实科学需要两者:
- Hassabis/Silver 式世界模型和规划;
- Brown 式不确定信念、对手与测试时计算;
- 工具提供硬反馈。
十五、判断记录:哪些已经命中,哪些仍是组合愿景
A. “学习 + 搜索”是复杂决策的强结构
结论:强力命中。
AlphaGo、AlphaZero、MuZero、形式数学、代码搜索和 reasoning model 都支持。纯搜索组合爆炸,纯 policy 又在罕见局面缺乏适应。
B. “人类专家数据可逐步被自我对弈替代”
结论:在完美模拟器任务中命中。
AlphaGo Zero / AlphaZero 证明可以去掉棋谱。现实任务中自我经验受模拟器、reward 和安全限制,不能简单外推。
C. “规划模型无需复刻全部世界,只需预测决策相关量”
结论:MuZero 强力支持。
这是极具影响的模型观。问题在于多任务/开放世界中什么是“相关”会变化,过度任务压缩可能损害迁移。
D. “游戏方法可以推动科学”
结论:在问题选择与搜索哲学层面部分命中。
AlphaFold、AlphaTensor、AlphaDev、AlphaGeometry/Proof、AlphaEvolve 显示 AI 可产生可验证科学/算法结果。
但没有一套 AlphaGo 算法直接通吃科学;每个领域仍需专门数据、架构和 evaluator。
E. “Gemini world model + AlphaGo planning + tools 会汇成 AGI”
结论:清晰路线图,尚未兑现。
三个部件分别有证据,统一系统仍面对:
- 长期记忆;
- 目标稳定;
- 开放世界反馈;
- 工具安全;
- world model 误差;
- 跨任务持续学习;
- 计算成本。
F. “科学将成为高级 AI 的最佳价值证明”
结论:已有强早期证据,完整闭环未成。
预测结构和发现算法已成功;独立提出重要问题、设计现实实验、解释异常、迭代理论的端到端 scientist 仍远未成熟。
十六、他最强的论证与最弱的外推
最强论证:直觉、搜索和工具是互补能力,不能相互替代
- 没有学习先验,搜索空间太大;
- 没有搜索,模型在陌生局面只能依赖一次模式匹配;
- 没有工具,计算和验证容易停留在语言自洽;
- 没有反馈,搜索无法学会怎样更有效。
这套分工已跨棋类、数学、代码和蛋白结构得到多次支持。
最弱外推:把若干已成功组件连接,就会自然出现统一一般智能
系统集成的困难不是 API 对接:
- world model 的状态未必适合 planner;
- planner 可能利用 simulator 漏洞;
- tool 输出会含噪声或恶意内容;
- 长程目标无法由短程 value 稳定评价;
- 不同领域 evaluator 不可比较;
- 通用模型可能不知道何时不应行动;
- 组件误差会在闭环中放大。
“组件都存在”是必要证据,不是组合后性质的证明。
十七、怎样评价这条路线
1. Search 是否真的增加了能力
- 固定模型时,搜索深度增加是否稳定提高成功率;
- 提升来自更多计算还是 benchmark 特定调参;
- value 能否识别新题中的进展;
- rollout 误差何时超过规划收益;
- 模型是否学会自适应停止。
2. World model 是否支持反事实而非只生成画面
- 干预一个变量后,后果是否系统改变;
- 对象和约束是否跨长时间保持;
- 未见动作组合能否正确预测;
- 潜在状态能否支持新目标;
- 不确定性是否校准。
3. Tool use 是否闭合验证
- 工具结果能否被正确解释;
- 模型会不会选择错误工具;
- 多工具结果冲突时如何处理;
- 形式验证之外的实验噪声怎样进入 belief;
- 外部数据是否有来源和版本追踪。
4. AI for Science 是否产生真正新增知识
- 结果是否在训练截止后出现;
- 是否由独立实验确认;
- AI 是否只重发现文献已有假说;
- 发现对下游研究是否有实际解锁;
- 人类专家投入应怎样计入;
- 负结果和失败实验是否被利用。
十八、按思想演进阅读原始材料
第一阶段:记忆与想象
- Patients with hippocampal amnesia cannot imagine new experiences
- 重点看碎片细节与空间连贯场景的差异;
- 不要把神经科学结果直接等同算法。
第二阶段:从像素到控制
- Human-level control through deep reinforcement learning / DQN
- 看 experience replay、target network 与同一算法跨游戏;
- 同时记录每游戏单独训练和数据效率限制。
第三阶段:学习与搜索的合流
-
- 理解 supervised policy、RL policy、value 与 MCTS 的分工。
-
AlphaGo Zero: Starting from scratch
- 看 search policy 怎样成为网络训练目标;
- 明确“zero”移除了哪些知识、保留哪些结构。
-
- 用来比较从已知规则到学习潜在 dynamics 的转折。
-
- 重点理解不重建观察、只预测 reward/value/policy 的含义。
第四阶段:从解决游戏到解决科学根节点
-
- 看专门领域结构、置信度和数据库开放;
- 不要把它误写成 AlphaGo 架构直接迁移。
-
- 这是 2026 年 Hassabis 对路线最完整的自我总结;
- 重点看 world model、search/planning、specialized tools 三组件。
第五阶段:可交互世界与统一系统愿景
-
Genie: Generative Interactive Environments
- 看无动作标签视频中怎样学习 latent actions;
- 区分可交互 renderer 与可靠物理模拟。
-
- 重点读官方列出的 action、multi-agent、真实地点和时长限制。
-
- 适合长期追踪各项目负责人;
- 对 CEO 路线图仍需用论文和独立验证约束。
十九、最后的压缩:怎样长期跟踪 Hassabis
不要只跟踪“AGI 还有几年”或下一次演示。更有价值的八个问题是:
- 世界模型是否能在行动干预下保持因果和空间一致?
- 搜索深度增加时,收益是否超过模型误差积累?
- 通用模型能否自己选择正确专用工具并处理冲突结果?
- 棋类/形式数学中的 verifier 优势,怎样迁移到迟延、昂贵的实验科学?
- AI 是否开始提出训练资料中没有、且经现实实验确认的重要假说?
- 通用模型与 AlphaFold 等专门模型之间能否双向学习,而不只是单向调用?
- 系统能否从“规则内的新着”走向“发明值得研究的新问题和新评价标准”?
- 大型团队的系统成功中,哪些机制真正跨领域,哪些只是每次重新做一套领域工程?
Hassabis 最值得关注的判断可以压成一句:
高级智能不是把所有知识塞进一个模型,而是让模型知道怎样记忆世界、在内部想象不同未来、用搜索分配思考,并调用能把猜想变成证据的工具。