AI for Science 解读报告硅谷101 · 曹原
硅谷101 · 101视频播客 · 深度访谈解读

AI for Science 爆发:
一个新时代到来了

Jeff Dean 携旧部创办 Discovery Loop 的第二天,前 Google DeepMind 资深研究科学家曹原坐进硅谷101的录制间,把 AI 科研闭环拆到最小颗粒度——从验证瓶颈、符号主义,一路谈到「AI 能否创造新概念」这一 AGI 的最后一英里。

嘉宾 曹原 · 前 DeepMind 资深研究科学家 / Unreasonable Labs 联合创始人 主持 陈茜 · 硅谷101 创始人 时长 1:49:22 发布 2026-08-15 录制 2026-08-06(Jeff Dean 官宣次日)
OVERVIEW

导读速览:六个核心判断

如果只有三分钟,这六条足以带走本期访谈的骨架。

  1. 爆发条件已齐。过去两年 AI 在代码与推理两条曲线上的跃迁,叠加 Agent 体系(Harness)成熟,模型第一次能够自主提出假设、写代码分析数据、迭代实验——AI4S 的能力地基在 2026 年补齐,从「愿景」变成「工程问题」。
  2. 真正的瓶颈是验证。越容易计算、越容易验证的问题(数学、代码),AI 进展越快;一旦进入真实物理世界,实验周期、成本与反馈速度就成为闭环卡点。破局两条路:自动化实验室,以及让 AI 聪明到「少做实验、一次做对」。
  3. 三巨头路线分化,但 AI4S 都不是最高优先级。谷歌布局最早最广却被 Gemini 追赶战挤压;OpenAI 最激进却优先级摇摆;Anthropic 后来居上、挖来 John Jumper 补生物医药短板。窗口期反而属于创业公司与 NeoLab。
  4. 发现 ≠ 组合。当前 AI 的「发现」,本质是在既有表征空间里做高明的搜索与排列组合;从经验观察中抽象出全新概念(如「数」),可能是 AGI 的最后一英里——曹原甚至怀疑它不可计算。
  5. 严肃数学离不开形式化。AI 生成的证明必须经 Lean 等形式化系统兜底验证;自然语言到 Lean 的自动形式化翻译效率是行业级瓶颈;而定义新的数学对象这类「发明」,AI 目前完全做不到。
  6. 长期主义时间表。AI4S 商业化分层推进——靶点发现、分子设计等环节已可变现;但要让 AI 独立做出诺贝尔奖级发现,须先攻克因果推理、长期记忆、持续学习等基础能力,曹原的估计:至少还需二三十年。
EPISODE

本期信息

节目硅谷101 ·【101视频播客】《对话前 DeepMind 曹原:AI for Science 爆发,一个新时代到来了》
嘉宾曹原——前 Google DeepMind 资深研究科学家,此前参与 Gemini 模型迭代与后训练;现为 AI 初创公司 Unreasonable Labs 联合创始人,方向为 AI for Knowledge Creation、AI for Science 与 R&D。
主持陈茜——硅谷101 创始人
录制 / 发布录制于 2026 年 8 月 6 日(Jeff Dean 宣布离职创办 Discovery Loop 的次日);2026 年 8 月 15 日上线,全长 1 小时 49 分 22 秒。
观看YouTube · Bilibili(BV1GQgg6yEy5)
本报告依据节目官方时间轴与官方发布的对谈文字稿整理重构;观点归属嘉宾与主持人,时间戳均可点击跳转 YouTube 对应位置。
TIMELINE

时间轴导航

本期母题是「闭环」(Loop)。点击任意时间码,可直接跳转 YouTube 对应片段;章节正文中的绿色时间码同样可点。
编者注

「抽象出新概念」在官方时间轴中标注为 01:08:47,但按对谈内容顺序应位于「AI 与数学」(01:11:18)之后、「证明过剩」(01:25:44)之前,疑为 01:18:47 之笔误,本报告按内容顺序校正呈现;若跳转位置不准,可从 01:11:18 起顺看。

AI4S 为什么在此刻爆发

开场即是一连串行业信号:明星团队出走、悬案数学题被推进、科学家批量涌向 AI 实验室。

触发本期录制的事件发生在录制前一天:2026 年 8 月第一周,谷歌灵魂人物 Jeff Dean 宣布离职,与 Oriol Vinyals、Sanjay Ghemawat、Quoc Le 等老搭档共同创办新公司 Discovery Loop,目标是加速生命科学及其他行业的研究进程。在硅谷的语境里,这被视为 AI for Science(AI4S)赛道正式爆发的标志。

节目开场还列举了同期的几组信号:大批数学家、物理学家、生物学家加入 OpenAI 与 Anthropic 等顶尖实验室;OpenAI 宣布其模型 Astra 推导出了 10 道人类长期悬而未决的数学难题;Anthropic 一款尚未发布的科研版 Claude,将黎曼猜想相关零点的下界从 41.6% 推进至 67.2%;生物制药、材料、物理等领域的科学前沿也在被快速推进。

主持人陈茜给本期定下的主题句是:当大模型学会推理、编程和调用工具,AI 不再只是回答问题,而是开始提出假设、设计实验;AI 自进化、形成研发闭环,是科研加速的核心——而在这个闭环中,人的角色开始变得微妙。

要点

AI4S 并非一夜爆发:AlphaFold、RoseTTAFold 等早已铺垫多年。真正的变化是推理、代码、Agent Harness 三件套在近两年集体成熟,让「AI 当研究员」第一次从愿景变成可施工的工程问题。

Jeff Dean 出走与谷歌的取舍

「一个时代结束了」?曹原给出三层解读,并明确反对这种说法。

三层解读

  • 组织层面。谷歌与 DeepMind 内部向来人才济济,过去各团队各自为战、互不干涉;但三四年前 Gemini 项目启动后,公司走上「集中力量办大事」的路线,团队被迫整合,组织、人事与项目管理面临巨大挑战,内部摩擦难以避免。
  • 产品层面。年初 Gemini 3.1 Pro 在排行榜上尚属优秀,但此后三四个月里,无论 Anthropic、OpenAI 还是中国开源公司都在快速迭代,相比之下 Gemini 3.5 Flash 与最新的 3.6 Flash 表现平平,外界期待的 3.x Pro 迟迟未发布。在这种局面下,若还要把商业模式转向 Anthropic 主导的 coding agent 方向,难度不小。
  • 方向层面。Discovery Loop 要做的事——让 AI 自主进行知识发现与自动科研——是数学与代码能力成熟后的自然延伸,也与曹原自己的创业方向一致。2026 年起,围绕 Knowledge Discovery、AI4S 与 RSI 的初创公司明显增多;Jeff Dean 这样的明星团队出来,必然想树立新标杆,成为一种新型的 NeoLab。

「时代结束」言过其实:谷歌的全栈底牌

曹原明确反对「谷歌时代结束」的叙事:谷歌是极少数具备 AI 全栈要素的公司——从底层芯片(TPU)、基础设施、数据中心、工具链,到模型、人才、数据,再到覆盖海量消费者的产品分发渠道,完全不依赖外部生态。问题不是谷歌做不好,而是优先级与资源投入需要调整,这些能力之后仍会补回来。

人才外流则有结构性原因:DeepMind 当前的最高优先级是把 Gemini 做到 SOTA(至少与 Anthropic、OpenAI 齐平),大量工作重心必须向 Gemini 迁移——包括此前从事 AI4S 的研究者。团队如此庞大、又压着一个超高优先级项目,「不可能让每一个人都非常满意」。在 Jeff Dean 之前,AlphaFold 联合发起人、诺贝尔奖得主 John Jumper 已加入 Anthropic。

人物侧写 · JEFF DEAN 为什么是「灵魂人物」

从 MapReduce、Spanner、BigTable 等互联网级基础设施,到创立 Google Brain,再到最早的深度学习框架之一 TensorFlow、Google TPU,直至 Gemini——谷歌二十余年的技术脊梁上到处是他的名字。曹原回忆,Jeff Dean 与 Sanjay Ghemawat 每周固定有一天做结对编程,两人都亲手写代码;Oriol 与 Quoc 也是早期 Google Brain 成员。这批长期默契的老搭档一起创业,是顺理成章的组合。

曹原自己为什么离开

曹原此前在 DeepMind 负责 Gemini 的模型迭代与后训练,但他持续追问的是更底层的问题:怎样让模型真正变得更智能。现在的模型已能很好地做数学、写代码,但要真正解决科学问题,还需要提出新假设、验证新假设并不断自我更新——这些能力距离「帮助人类实现科学知识的指数增长」仍然很远。弄清这些能力为何缺失、如何补上,是他选择创业的动机。

谷歌在变好吗?Demis 去哪了?

曹原的判断是「状况在变好」:做大模型不能再沿用传统大公司的管理方式,谷歌要做的是「革自己的命」,把 Gemini 团队尽可能做得像一家初创公司。参照系是 Meta——Alex Wang 进入 MSL(Meta Superintelligence Labs)后,Muse Spark 与最新编程模型都出现改善迹象。但他也提醒:从 0 分到 80 分可以快速追赶,从 80 分到 100 分、再到超越 100 分,难度完全不同——谷歌本就处在高位,向上的每一步都更贵。

至于 Demis Hassabis:Sundar 的内部邮件确认,他虽从 DeepMind CEO 转任 Chairman,但仍主管 AGI 与科学相关部门。曹原认为 Demis 的气质本就更像科学家而非产品型 CEO;DeepMind 伦敦时期对 Alpha 系列的长期投入,正是后来诸多商业化成果(AlphaEvolve 自动更新算法、AlphaFold 摘得诺奖并商业化为 Isomorphic Labs)的源头。谷歌既有能力、也有责任继续推动长期研究,Demis 非常适合这个角色。

要点

谷歌不会放弃 AI4S,只是短期让位于 Gemini 追赶战;AI 驱动科学「不只对一家公司重要,对社会乃至国家都重要」。

悬而未决

当三巨头都把 AI4S 排在编程与商业化之后,「科学」会不会成为创业公司独有的窗口期赛道?§6 将正面回应。

概念地图:AI4S、AI4AI 与 RSI

三个高频缩写,一句话即可分清:前两者是任务对象不同,后者是方法。

  • AI4S / AI4AI:都是把 AI 模型当成「研究员本身」,区别只在研究对象——前者研究科学问题,后者研究 AI 自身的问题。
  • RSI(Recursive Self-Improvement,递归式自我改进):不是一个任务,而是一种方法——让系统通过不断自我迭代来更新任务与方案,把事情越做越好。它可以同时服务于 AI4AI 与 AI4S。

一个 AI4AI 的典型工作流

给模型一个任务:在限定预算下,用最少的资源与 GPU 把模型训练到最好。它会读取当前代码库,发现某个参数可能需要调高,于是提出方案 → 自动写代码实现 → 在沙盒里运行实验 → 读取训练结果 → 依据反馈提出下一步。若调参有效就沿此方向继续,如此一轮轮迭代,性能不断上升——一个典型的自我回归过程。前沿的 AI4AI 公司还在探索更野心的问题:寻找 Transformer 之外的新架构、寻找不依赖反向传播(Backpropagation)的新优化算法。这类问题的共性是搜索空间巨大、闭环可以高效运转,恰是 AI 的主场。

为什么偏偏是现在

过去两年 AI 进步最快的两条曲线是代码推理。当 AI 能可靠写代码、智能体 Harness(驾驭系统)也趋于成熟,才有条件处理更复杂的科学问题:第一步提出假设、决定做什么实验(推理);第二步拿到数据后自己写代码分析(代码);第三步数据异常时回溯原因、自我迭代。科学问题真正需要的是一整套能力——推理、数据分析、数学、代码、agent loop 与长期记忆管理,每次实验后都要把观测结果存入记忆容器。这套能力栈直到现在才凑齐。

哪些领域先被盯上:四个判据

一个科学领域对 AI4S 是否有吸引力,取决于四点:市场规模与潜力、是否适合 AI 做(流程标准化、结构化、数据丰富)、研发迫切性、AI 当下能否做好

领域吸引力曹原的判断
生物 / 制药最高市场巨大;流程相对标准化、数据丰富;新药周期长达多年、成本数亿美元——AI 自动化任何一个环节都极具吸引力,是创投最聚焦的方向。
材料大而碎总盘子很大,但金属、皮革、生物、半导体、稀土等各自流程与应用迥异,难以用统一方法处理;即便 AI 发现新结构,也只是价值链第一步(谁制造、用在哪、如何封装),价值难以一次性捕捉。
芯片 / 电池 / 量子计算探索期新兴方向都在尝试,AI 最终能发挥多大作用尚难判断。

提效还是发现:AI 的两种角色

  • Co-Scientist(协同科学家):加速科学家的研究流程,但不必然提出新方法。典型如 Claude Science——一个偏科学家的 workbench,类似编程世界的 IDE:调用工具、分析数据、对话获取建议、运行实验或模拟。
  • 自主发现者:AI 自己提出新发现,如 AlphaEvolve 自主发现新算法、AlphaFold 产出蛋白质结构相关新知识。

角色取决于具体领域,也取决于它是一个垂类模型,还是嵌在 agent loop 里的通用模型——这正是下一章闭环拆解的起点。

科研闭环逐环拆解

本期含金量最高的一段:把科学家的日常拆成「定义 → 表征 → 建模 → 实验 → 闭环 → 因果 → 验证 → 发现」,逐环审视 AI 的位置与短板。

4.1 问题定义:出题人必须是人 24:58

曹原的立场干脆:问题定义必须由人来完成。AI 目前没有自己的「品位」,无法自主找出值得研究的问题;人类科学家先明确要解决什么、动机为何,AI 才能在其上辅助——搜索文献、分析既有信息、把初始问题结构化。

4.2 什么问题适合切给 AI:可计算 × 可验证

两把标尺。其一是可计算:问题能否被精确建模——AlphaFold 是范本,「给定氨基酸序列、预测三级结构」,定义明确、结构清晰、可以计算。其二是可验证,这可能是 AI4S 全链条里最难的一环:代码写完立刻能跑、数学证明立刻能查,而一款新药不到上市,很难真正知道效果。若某些中间步骤可以用模拟工具计算特性、稳定性、副作用,就适合切给 AI。AI4S 能迭代多快,很大程度上取决于结果能多快被验证。

「验证不了」的原因不只是人手不够,还包括实验本身的复杂度与成本——AI 若生成一个新的核聚变装置设计,真做实验的代价可能极其高昂。曹原给出一个物理学式的框架:宇宙的基本要素是信息、物质与能量。数学与编程活在信息层;AI4S 哪怕能提方案、做模拟,也仍在信息层——但真正的科学必须穿透到物质层,进入湿实验。这一步逃不掉,也是当下投入最大、探索最多的方向。

案例 · GPT-5 × GINKGO BIOWORKS 自动实验闭环

OpenAI 将 GPT-5 与 Ginkgo Bioworks 的机器人自动化实验室打通:模型提出蛋白质相关配方 → 机器人执行实验 → 结果回流给模型 → 迭代下一轮,形成自动闭环。曹原视之为目前最有说服力、效果最好的闭环实验之一。更广义的 AutoLab / Cloud Lab 也在铺开:标准化步骤交给专用机器人,部分云端实验室甚至支持 API 远程调用。

案例 · A-LAB:17 天 353 次实验

Google DeepMind 与劳伦斯伯克利国家实验室合作的自动化材料实验室 A-Lab,曾在 17 天内执行 353 次实验,完成 57 个目标中的 36 个。曹原提醒这是较早期的案例(彼时尚非 Gemini),自动实验室的概念远早于大模型;当前的壁垒在机器人一侧——特定领域专业机器人的操作流程、精度、速度与成本,都是与模型同属一个体系的课题。

4.3 表征与模型:主管与专家的分工 30:37

讨论表征前先分清两类模型:

  • 通用模型(GPT、Gemini):整个 AI4S 流程的 Orchestrator(总调度器),像实验室主管——理解问题、分析数据、调用工具、推进工作流;可接受自然语言、代码、JSON 等多种输入。
  • 垂直模型(AlphaFold、材料领域的 GNoME 等):某个领域的专家,只接受领域相关输入(氨基酸序列、DNA、元数据),不承担领域之外的通用推理。

「预测与逆向设计」环节由此各归其位:给定疾病靶点生成候选分子,属于药物开发垂直模型的能力;通用模型则汇总此前全部实验记录、分析数据与研究者要求,生成下一步实验设置或研究方案。

至于「哪些东西根本无法表征」——只要数据能被数学化、格式化(字符串、某种模态表示、结构化输入或 Embedding),原则上就能表征;真正难的是本身无法测量之物(如大脑的状态)。无法测量,就无法表征——这是 AI 的普遍边界,并不专属 AI4S。

编者注

对谈原文提及「做天气预报的 MatterGen」。MatterGen 实为微软的材料生成模型,天气预报方向的代表工作是 GraphCast、WeatherNext 等,此处疑为口误,特此说明。

4.4 实验即搜索:树、打分与价值函数 34:27

AI 会自己决定下一步做什么实验吗?会——本质上这是一个搜索过程。把探索空间想象成一棵树,每个节点是一个已尝试的方案;系统给每个节点打分,决定从哪个节点继续展开。这正是 Exploitation 与 Exploration 的平衡:既不能沿着当前最优一路推到底(可能只是局部最优),也不能忽视它(可能确实最好),必须给不确定但可能带来惊喜的方案留出概率。

人靠直觉做这种取舍;翻译成算法,就是用 Value Function(价值函数)估计节点未来回报的期望——与后训练中的强化学习一脉相承。最终的分数永远是综合分:当前价值、未被探索的概率,再叠加这条路径已被访问的次数(高分节点走过太多遍,就该把机会让给别的路径)。

4.5 闭环:代码为何率先跑通,科学如何跟上 37:39

为什么编程智能体先形成了商业闭环?因为代码天然易验证:程序写完马上能跑、对错立刻可知,用户由此产生信任,敢把更完整的任务托付出去——这让 Claude 编程智能体成为目前最成功、甚至可能是唯一实现指数级应用增长的 AI 商业闭环。AI4S 的困难恰在于科学实验牵涉物理世界,验证远没有这么快。破局两条路:

  • 自动化实验室:流程足够标准的环节交给专用机器人(美国大量创业公司在做,医药领域尤其密集);流程不标准、需要频繁调整配方与操作的,则要等更通用的具身智能——那还比较遥远。
  • 少做实验、一次做对:既然物理验证又贵又慢,就必须倒逼 AI 更聪明——原本要跑 10 次实验才能得到合格蛋白,就把模型能力提到跑 2 次、甚至 1 次。这对数据分析、失败经验复盘、实验历史管理等「智能本体」能力提出了更高要求。
要点

曹原反复强调:AI4S 不是简单地「把科学当成 AI 的一个应用」,而是 AI 与 Science 的互相成就——AI 本身不够聪明,闭环就转不动;反过来,攻坚科学难题也在逼出更强的 AI。

闭环还有一层进阶:闭环自身也要进化。简单闭环是「给问题 → 提方案 → 做实验 → 拿数据 → 再分析」;但做 AI4AI 或训练新模型时,需要 Meta-recursive(元递归)过程与 Meta agent——不能永远依赖同一套 agent harness,系统必须随观测与迭代的积累改进自己的工作流,甚至决定何时更新自身代码。这是当下许多团队正在攻关的前沿。

4.6 因果机制:相关不等于因果 42:59

因果建模本身历史悠久(Judea Pearl 等人早有系统研究);今天的问题是大语言模型分不清相关性(correlation)与因果性(causation),且对表述形式过度敏感。大量研究发现:同一个推理问题,按训练数据里常见的方式表述前提,模型能答对;稍微改换措辞或调换语序——意义不变——结果却可能出错。原因在于训练数据通常只覆盖某一种「正确或最常见」的描述方式。

这正是 Yann LeCun 等人力推世界模型的理由:对规律的掌握应当独立于语言如何表征与描述。若模型学到的是物理世界内部的规律,它对因果的理解就不会被措辞绑架。目前的模型在正常表述下多数时候可以处理因果,但遇到反常表述、或需要主动干预的问题——Do-Calculus 意义上的「把某个值调高会怎样」「去掉某个条件会怎样」——常常做不到。曹原的措辞很精确:是「不可靠」,而不是「不能」

4.7 验证:技术上最难的一步 48:00

被问及全链条哪一步最难,曹原毫不犹豫:物理世界里的验证。他给了一个思想实验:如果理想情况下每分钟都能拿到一次实验验证,哪怕用最简单的 AI4S 方法也能生成无数数据,随即对模型做后训练——像刷代码与数学能力一样快速迭代。验证瓶颈一旦被打破,飞轮立刻转动。但这不代表问题就此终结——

4.8 发现:组合式创新的天花板 49:58

另一半难题是:AI 能否提出真正的新见解?若模型永远局限于已有论文与知识,无论怎样推理,都只是在闭环里调参数、改配方、做排列组合——效率确实已远超人类,但能力上限有限且偏低。诺奖得主 Jennifer Doudna 在采访中的评价颇具代表性:她的团队会用 AI 辅助科研,但 AI 给出的方案没有一个是团队此前不知道的——或许有些角落平时被忽略,但基本都能在现有知识与论文中找到。

曹原把人类的「发现」拆成三级跳:① 感知输入——观察实验与数据,这只是经验材料;② 抽象概念——看到人推车、车前行,从表面现象中抽象出「力」并符号化为 F;③ 形式化理论——把概念凝结成公式与体系,如牛顿第二定律 F=ma。今天的 AI4S 只停留在第一级之上的搜索:在既有表征空间内探索,尚不能产生全新的理论或知识。

那么 AlphaGo 的第 37 手(「神之一手」)算发现吗?算——它采样到了一条过去罕见、低概率的好路径,是货真价实的新发现;但它没有创造新概念,仍是既有内在表征的重新排列组合。

悬而未决

组合式发现的天花板究竟有多高?「新概念」能否被外挂机制逼出来?§5 的符号主义与 §7 的数学讨论,是曹原给出的两条回答线索。

符号主义 × 连接主义:Unreasonable Labs 的混合路线

既然「发现」按定义就在现有知识之外,怎样让一个由固定数据训出的模型产出新知?曹原的答案:在 LLM 之外加一层不是 LLM 的机制。

动机:LLM 的宇宙由训练数据划定

语言模型能吸收的思维模式、知识与推理过程,全部来自训练数据;而科学发现按定义必在现有知识之外——让这样的模型发现全新的东西,不是绝对不可能,但概率极低,因为新知识必然不曾在训练数据中高频出现。外挂机制若还是另一个语言模型,只会回到同一个问题;Unreasonable Labs 选择的方向是符号主义

两大范式速览

符号主义连接主义(神经网络)
知识来源先验规则,人工写定——已知 A>B、B>C,即可推出 A>C,无需学习从数据中学习,用分布式向量表征,向量各元素的意义由观测数据自己学出
长处精确、可先验指定;数学与代码本质上都是符号;今天 agent harness 的工作流(第一步做什么、何时调 memory)同样是先验符号规定擅长处理充满模糊与歧义的对象(自然语言、图像),表达能力极强——今天所有大模型皆循此道
短板表征脆弱:用「尖耳朵+长胡须+毛茸茸」定义猫,猫一低头规则就失效——无法用刚性逻辑刻画整个世界黑盒、依赖数据分布,难以产出分布之外的新知

混合方案怎样运作

思路是用符号规则把跨论文、跨领域的人类知识串成骨架:某概念在论文 A 中提出,它与论文 B 中另一概念是什么关系——这些关系用符号逻辑表达,织成一张可推理的网。这些关系很难直接从训练数据里挖出(概念太多、关系组合爆炸,且每天都有新论文,不可能天天重训模型),但符号层可以增量维护。提取出的知识骨架、推理关系与连接方式,成为模型之外的一层「新直觉」,把原本处在小概率区间的想法顶到台前。

真正的瓶颈在 novelty 与可行性的平衡:让模型「创新」很容易——随便采样、塞个随机词都能生成不一样的东西;难的是新想法必须合理、可执行、贴合当前问题,不能为了创新而创新。

符号主义会复兴吗

曹原不用「复兴」这个词:现实世界充满歧义,符号主义不可能替代连接主义;最终格局也许是 98% 连接主义 + 2% 符号主义。事实上,今天的 AI for Math 与 AI for Coding 已经是 neuro-symbolic(神经符号)结构:神经网络生成数学证明(连接主义),再交给 Lean 这样的纯符号系统验证(与神经网络毫无关系)——两部分都不可或缺。

从培根到黑格尔:一场哲学的转写

符号主义提供先验、连接主义依赖经验——曹原指出,这正是认识论两千年主线的计算转写:

哲学脉络核心主张AI 语境的映射
经验派(培根、洛克)认知完全来自经验,大脑是感官输入的映射大模型:随机初始化,经万亿 token 喂养,智能完全由经验输入决定
唯理派(笛卡尔)「我思故我在」——先有先天结构,再以之理解世界先验规则、归纳偏置、符号系统
康德经验提供材料,但材料须经先验结构(时间、空间、因果等十二范畴)才产生意义数据 × 结构先验的混合架构:没有先验结构,看再多圆球与轮胎也形不成「圆」
黑格尔理性、感性与经验辩证统一;概念在自我否定中持续更新,绝非一经建立便恒定Continual Learning(持续学习):最终的 AGI 不会是一个参数冻结的 checkpoint,而要在交互与任务中不断认错、不断变强
要点

符号主义与连接主义之争,讨论的是同一个古老问题——人如何认识世界、知识如何产生。不同时代的人用不同语言,像不同的镜子照向同一个事物。

三大 AI 巨头的 Science 路线

同样在抢科学家,三家的切入点、赌注与软肋各不相同。

GOOGLEOPENAIANTHROPIC
定位 布局最早、铺面最广、纵深最深,生态最完整 最激进的追赶者 后来居上的补位者
代表动作 Alpha 系列(AlphaFold / AlphaEvolve 等)→ Co-Scientist、Gemini for Science;AlphaFold 商业化为 Isomorphic Labs GPT-5 白皮书晒出数学 / 计算机科学 / 生物战果;公开目标 2027 年做出自动化 AI Scientist;GPT-5 × Ginkgo Bioworks 闭环实验;GPT-Rosalind 强化生物 / 化学 / 材料推理;Astra 处理 10 道前沿数学题 Claude Science 平台(通用 Claude 驱动+接入生物化学数据库与工具+科学家工作流界面);vibe physics 协助物理学家推导;发布 BioMysteryBench 等生物基准;挖来 John Jumper
软肋 Gemini 冲 SOTA 的最高优先级挤压 AI4S 资源与人才(Jumper、Jeff Dean 相继离开) 优先级混乱:原 AI4S 负责人 Kevin Weil 离任后,相关工作并入 Codex,押注「通用 GPT+智能体」打天下;同时铺广告、硬件、企业版,战线过长 三家中唯一尚未推出特定领域垂直模型的公司;同时受上市、商业化与中国开源模型竞争的牵制
下一步看点 Demis 转任 Chairman 后仍主管 AGI 与科学,长期不会放弃 AI4S 通用路线若成立,科学问题被「顺便」解决;若不成立,垂类窗口留给别人 John Jumper 大概率补上生物医药垂直模型——这正是最大的市场
要点

三家共同点:AI4S 都不是当前最高优先级——编程、商业化与模型规模排在前面。大公司受制于创新者窘境(innovator's dilemma):挖到明确的商业化路径就不愿轻易转移资源。RSI 长远是「没人敢落后」的战略必投,但短期商业优先——这正是 NeoLab 与创业公司的节奏差与窗口期。

AI 与数学:Lean、五等级与「发明」

2026 年,邓煜与王虹摘得菲尔兹奖,AI for Math 也战报频传。但曹原提醒:数学没有看上去那么容易——取决于你说的是哪一种数学。

严肃数学的流水线与三重瓶颈

当前 AI 攻坚复杂数学的标准流程:语言模型提出证明 → 将证明形式化为 Lean → Lean 编译通过,结果即确证无误。两家代表性初创 Axiom Math AI 与 Harmonic AI 走的都是这条路,商业化则瞄准 EDA(电子设计自动化)、软件验证等可验证场景。流水线上有三重瓶颈:

  1. 模型要够强——能提出可能成立的证明方式或新的数学结果;
  2. 自动形式化——把自然语言或数学符号描述的证明翻译成 Lean,这个转换过程并不容易,是两家公司投入最重的环节;
  3. Mathlib 覆盖度——Lean 的数学库必须收录足够多的既有定义、定理与引理,系统才能组合它们去解更难的问题;缺的概念要现场重新定义。

Lean 什么时候可以省

并非所有场景都必须 Lean。IMO(国际数学奥林匹克)这类考试,考的是复杂而有创意的构造,知识不必特别深、证明通常一两页——模型训练得足够好,用自然语言作答即可信赖,且交卷后很快就有人工验证(这也是 OpenAI 参加 IMO 时坚持纯自然语言输出的底气)。但若要做职业数学家级别的工作——比如王虹那种上百页的证明——纯自然语言无法保证正确,必须形式化兜底。

案例 · PETER SCHOLZE:菲尔兹奖得主也需要 LEAN

Peter Scholze(2018 年菲尔兹奖得主)几年前处理一个非常庞大的问题时,连自己都无法确认证明是否成立——与合作者反复讨论仍无人能拍板。最终他们把相关定理、定义与引理全部人工翻译成 Lean,前后至少花了一两年;Lean 编译通过的那一天,证明才真正落定。另一个注脚:谷歌参加 IMO 时,答题限时两天,而把证明翻译成 Lean 却花了三天——翻译效率是行业级瓶颈。慢的原因在于 Lean 是结构化、类型化的语言:推导涉及的一切概念、定义与前置定理都必须严格按类型转换,库里没有的还要重新定义。

由此形成两条并行路线:其一,把模型训得更强,让规模较小、易验证的任务摆脱对形式化的依赖;其二,把「自然语言 ⇄ Lean」的翻译过程做得更快更准——对专业数学而言,后者是必经之路。

「五等级」为什么不是好尺度

主持人引用一位教授对数学问题的五级划分:博士生练手题 → 普通期刊级 → 四大顶刊级 → 菲尔兹奖级(如王虹解决的挂谷猜想)→ 超菲尔兹奖级。曹原认为这不是衡量 AI 的合适尺度——真正的分水岭是:问题是否需要发明新的数学对象或定义。只要结论能由既有定义、定理与引理推出,表征空间就是固定的;模型够强、搜索强度够大,再难的问题都可能被搜出来——提出证明本质上就是生成一串数学公式,在推理中持续寻找概率更高、回报更大的路径,永远是搜索。

数学的灵魂在发明 ≈01:18:47

那数学是不是就是「证明的科学」?曹原不同意:更重要的是发明的过程。没有数学对象的发明与定义,就没有数学——先定义「数」,才有加减法;微积分中的积分与微分、线性代数中的特征值、微分几何中的黎曼度量,全是被抽象和定义出来的概念。对一个好数学家而言,找出优雅的概念、抽象出本质定义,可能远比推导过程更重要:只盯着一堆矩阵而抽象不出「特征值」,就永远抓不住矩阵的内在结构。

AI 能做这件事吗?曹原:现在做不到——他甚至怀疑抽象概念不是一个可计算过程。他的思想实验:原始人看到三只鹅、四只鸟、五棵树,学会了数数,并把「数」这个概念推及万物;可若只给一个从未接受数学训练的模型看三只鸟、四只鹅,很难想象有一个程序能凭这些感官输入自发提出「数」的抽象。

「概念抽象可能是 AGI 的最后一英里。」

—— 曹原(他补充:这一英里甚至可能永远无法跨越,人脑最底层未必等价于图灵机)

数学是发现还是发明

上世纪以来,形式主义、逻辑主义、直觉主义诸学派对「数学的本质」争论不休,至今无解、或许永远无解。若必须选边,曹原倾向数学是人的发明,理由有二:其一即上述的概念起源——人从鸭、鹅、鸡中抽象出数,再以公式化为语言;其二是哥德尔不完备定理——任何足够强的形式逻辑系统,总存在为真却无法在系统内部证明的命题。曹原不相信宇宙自身有不自洽之处;宇宙作为自在之物只是存在,不需要描述。数学之所以带着无法调和的限制,恰因为它是人造的符号与规则体系,而非物自体本身。他也坦承:这只是个人的想法,无法验证。

当数学证明开始过剩

陶哲轩的观察:数学正从「证明稀缺」进入「证明过剩」——难题网站下堆着几十份 AI 解答,人类专家却没有带宽逐一验证。

结果正确 ≠ 价值等同

曹原的回应从一个比喻开始:假设音乐会上钢琴由机器人演奏,且保证每个按键的力度与时长绝对完美、严格遵循作曲家的要求——你可能仍然不想听。因为听众要的不只是音色,还有演奏者自发的情感状态、那些让人共鸣与被打动的东西。科学同理:证明正确当然重要,但若论证过程没有可阐释的洞见,再正确也像机器人在弹琴——对数学的贡献未必很大。人的价值判断,永远是重要的一环。

案例 · 四色定理:工具价值 vs 数学价值

20 世纪 70 年代,四色定理借助计算机完成证明——地图着色最多只需四种颜色。结论毫无疑问是对的,可直接用于地图着色(工具价值成立);但证明大量依赖枚举、颇为乏味,未必带来新定理或深刻洞见(数学价值存疑)。一项发现是否有意义,取决于从工具角度还是价值角度评判。

黑盒的经济代价

如果心安理得接受 AI 是黑盒,会发生什么?曹原分两层:边界清晰的单一任务可以容忍黑盒——早期计算器同样不透明,但输出标准可信赖。麻烦在于开放场景:今天 AI 能写出大量正确代码,但维护成本反而更高——工程师看不懂 AI 写的代码,就无法定位 bug、无法调试,只能让 AI 继续自我调试,而下一轮迭代又可能把代码改乱。语言模型本质上是随机采样机器:同一个编程任务跑两次,可能生成完全不同的代码——这种不确定性带来严重的信任问题。

要点

可解释性差会系统性抬高整个经济的运行成本。曹原的极端推演:假设有一天 AI 能完成 80% 有经济价值的活动,但每一项都需要人介入验证——那还不如不用 AI。可信赖性、可解释性、以及让人合理介入的机制,与能力本身同等重要;短期内甚至可能催生大量「验证 AI 答案」的新岗位。

AI 与物理:走出逻辑空间

数学只需活在人类定义的逻辑世界里;物理必须走出去,接受物质世界的裁决。

与数学的本质差异

数学是物理的一部分——许多物理定律与新结论都需要数学推导;但两者最大的区别在于:数学在理想逻辑世界内即可成立,物理最终一定要靠实验验证。当前的 AI for Physics 大多仍停留在数学与形式逻辑层面:求解偏微分方程;或如 Anthropic 用 Claude 辅助物理学家推导新结论。此外还有 PhysicsX 这类初创,把流体力学、空气动力学等现象做成专门的物理世界模型用于预测——方向可能有用,但相关工作还比较少。

随机的馈赠与溯因推理

主持人提出一个耐人寻味的观察:人类历史上许多发现带有随机性——牛顿与苹果(即便故事被夸张,灵感的触发是真的);器官移植所用的免疫抑制药环孢素,最初源自对挪威土壤中一种真菌的偶然发现(《十亿美元分子》记载)。而 AI 的发现过程似乎没有任何「随机感」。

曹原把问题拆开:随机事件的发生是一回事,能否从中溯因发现规律是另一回事——后者需要 abductive reasoning(溯因推理):苹果落下只是触发,人类还要反过来追问「什么导致了它」,并由此发展出一套物理体系。人类推理有三种:演绎、归纳、溯因。今天 AI 做得最好的是演绎(给定前提、定理与定义推出新结论,逻辑上相对容易);而溯因——给定现象、想象一个合理解释、并让解释泛化到其他现象——需要抽象力、想象力与世界模型,AI 目前做不到,未来很长时间也难做到。任何抽象层面的智力活动,都属于 AGI 的最后一英里。

无用之大用

谈到数学的「无用之美」,曹原扩展到美学、艺术与哲学:从直接效用看它们都是「无用之物」——家里挂一幅画有什么用?但这正是「无用之大用」:没有出于好奇与对美的追求的纯粹思考,就不会有后来的物理。思考过程会改变人的大脑状态与对世界的认知,作用只是未必立刻可感。理论科学、纯数学与人文艺术,皆属此类。

信号 · EDWARD WITTEN 的脚注

从实用角度看,AI for Math 已有大量落地:科学工程领域的方程求解、芯片验证、程序验证……甚至在最前沿的理论物理,AI 也已参与——弦理论奠基人、当代最伟大的理论物理学家之一 Edward Witten 最近在 arXiv 发表论文时,于脚注中注明某一段思路由 Claude 协助想出。最艰深处已被 AI 加速,且这种现象只会越来越普遍。

离「AI 创造新概念」还有多远

取决于概念的层级。可落地(grounding)到观测的具体概念——看过五把椅子,第六把特征相似的自动归入同类——任何聚类或概率流形都可视为概念,这早已可行。难的是抽象概念:一个概念适用于无穷多种场合,而这些场合之间没有稳定的表面相似性。从具体到抽象有很多层次,越过某个层级会变得极难,甚至可能永远无法靠计算程序实现。

商业化与时间表

AI 行业狂热,而 AI4S 是条更慢的路——ARR 未必年年翻倍。资本怎么看?曹原的答案是「分层」。

商业化不能一刀切

AI4S 已有落地空间:即便还没有一款完全由 AI 生成的药物上市,靶点发现、分子结构设计等中间环节,已可作为产品或服务变现;数学侧的 EDA、程序验证等可验证场景同理。但若目标是诺贝尔奖级成果,那就不再是「把科学当作 AI 的应用」,而是 AI 的基础研究问题——必须先提升 AI 本身的抽象、推理、实验与编程能力,否则更上层的科学问题根本够不着。

要点

曹原的核心论断:科学不应只是 AI 的应用,还应反过来成为促进 AI 自身发展的刺激与催化剂——能解决最难科学问题的模型,在编程、推理等一切任务上也必然更强。AI4S 既是应用,更是发展更强 AI 的驱动力。

「很长」到底是多久

AlphaFold 已经拿了诺贝尔奖,但那不是 AI 自主完成的科学发现。若问 AI 独立做出诺奖级成果需要多久,曹原的估计:至少还需二三十年。理由是欠账太多:且不说凭空创造新概念,现阶段连从实验结果中稳定地做正向与反向因果推理都做不好;还要解决长期记忆(做过无数实验后如何取用相关记忆)与持续学习——仅把这些前沿问题逐一攻克,可能五六年就过去了,之后才谈得上真正的科学实验能力。

如果那一天真的到来

AI 是一种 meta technology(元技术)、general purpose technology(通用目的技术)——本质上是一个可与科学、技术、商业几乎一切领域结合的通用大脑;足够智能的系统不只解科学题,也能像代理 CEO 一样优化人类经济活动的方方面面。参照 OpenAI 与微软对 AGI 的定义方式——「能以多高准确率完成多少有经济价值的工作」——能拿诺奖的模型,必然同时重塑其他一切经济活动。

资本心态由此清晰:AI4S 更慢、更难、商业化不如 AI for Coding 迅猛,但 RSI 长远是没人敢缺席的战略必投;大公司受创新者窘境牵制短期商业优先,NeoLab 与创业公司则据此获得节奏差。

哲学余响与人的位置

「很多研究 AI 和物理的人,研究到最后都会开始碰哲学问题。」——因为越往底层想,撞上的越是根本问题。

认识论两千年

曹原认为,AI 发展中的许多问题在哲学史上都有缩影——认识论长期讨论的正是「人怎样认识世界」。从柏拉图的理念世界开始:我们一生从未见过一个完美的圆,轮胎与盘子都不完美,但人能从这些不完美的观察中提出「完美的圆」——这就是在讨论知识如何产生、概念如何抽象。哲学、AI 与认知科学讨论的对象常常相同,只是语言与视角不同,「像不同的镜子照向同一个事物」。

给从业者的建议:多一点自上而下

AI 是当下科技界最热的课题,绝大多数应用与研究采取自下而上的视角:Transformer 有效、Scaling Law 尚未失效、优化 harness、建好 infra、发布产品——这对短期商业化与落地当然重要。但曹原呼吁保留一部分立意更高、自上而下的研究:从第一性原理追问——智能到底是什么?人类怎样认识世界?哪些特性是目前 AI 做不到的?倒过来想,会发现大量 AI 仍然做不到的事,也会过滤掉狂热天然滋生的浮躁与浅见。

他还留下一个更大的问题:AI 本质上是用计算自动化人的思考;但计算能自动化的不只有智能,也能建模与自动化各种物理过程——当 AI 逼近人类水平之后,「计算」本身还能做什么?

节目收束:人类价值的锚点

节目结尾的追问留给所有人:当 AI 完成「模型 → 实验」的闭环并开始自进化,将带人类抵达从未到过的高度——那时我们必须更清楚,人类的价值在哪里:是定义问题,是验证结果,是落地应用,还是握有最终的审判权。唯一确定的是,那时的世界与现在会很不一样。

APPENDIX

观点速记

一句话版的关键论断(据对谈内容归纳转述,非逐字原文),便于引用与回查。

  • AI4S 的正确姿势是 AI 与科学互相成就,而不是把科学当成 AI 的又一个应用场景。曹原 · §4.5 / §10
  • 验证是第一瓶颈:若能每分钟拿到一次实验反馈,后训练飞轮立刻转起来。曹原 · §4.7
  • 今天 AI 的「发现」,是既有表征空间里的高明排列组合;AlphaGo 第 37 手是新发现,但不是新概念。曹原 · §4.8
  • AI 辅助科研的建议,没有一条超出团队既有认知。Jennifer Doudna(对谈转述)· §4.8
  • 符号主义不会替代连接主义,终局也许是 98% 对 2%;而 AI 数学早已是神经+符号的混合体。曹原 · §5
  • 数学正在从证明稀缺走向证明过剩——瓶颈从「解出来」变成「验过来」。陶哲轩(对谈转述)· §8
  • 完美的机器演奏你也未必想听:科学要的是洞见与共鸣,不止是正确。曹原 · §8
  • 数学更像发明而非发现;哥德尔式的不自洽属于人造符号体系,而非宇宙本身。曹原 · §7
  • 可解释性差会抬高整个经济的运行成本——若 80% 的工作都要人复核,不如不用 AI。曹原 · §8
  • 让 AI 独立摘取诺贝尔奖级成果,至少还需二三十年;先要还清因果推理、长期记忆、持续学习的欠账。曹原 · §10
APPENDIX

术语速查

按出场顺序排列;点击章节号可跳回上下文。

术语一句话释义章节
AI4S / AI4AI把 AI 当研究员:研究对象分别为科学问题 / AI 自身的问题§3
RSI 递归式自我改进一种方法而非任务:系统通过不断自我迭代更新任务与方案§3
Agent Harness智能体的「挽具 / 驾驭系统」:工作流、工具调用与记忆管理的先验框架§3
Orchestrator 总调度器通用模型在 AI4S 平台中的角色,如实验室主管:理解问题、调工具、推流程§4.3
垂直模型领域专家型模型(AlphaFold、GNoME 等),只吃领域输入,不做通用推理§4.3
Co-Scientist协同科学家:加速研究流程但不必然提出新方法的 AI 角色§3
Exploitation / Exploration开发与探索的平衡:沿当前最优 vs 给不确定方案留概率§4.4
Value Function 价值函数估计某节点未来回报期望的函数,「直觉」的算法化§4.4
AutoLab / Cloud Lab自动化 / 云端实验室:标准化实验步骤交给机器人,支持 API 远程调用§4.2
in silico / 湿实验计算机模拟 vs 真实物理 / 生化实验;后者是 AI4S 绕不开的物质层§4.2
Do-Calculus因果干预演算:「调高某值 / 去掉某条件会怎样」类问题的形式化§4.6
世界模型独立于语言表述、直接建模物理规律的模型主张(Yann LeCun 力推)§4.6
符号主义 / 连接主义先验规则 vs 数据学习的两大 AI 范式;今日格局或为 2% : 98%§5
Neuro-symbolic 神经符号两范式的拼接:神经网络生成证明 + Lean 符号系统验证§5
Lean / Mathlib形式化证明语言及其数学库:编译通过即证明成立;库的覆盖度决定可解上限§7
自动形式化自然语言 / 数学符号 → Lean 的翻译过程,当前行业级瓶颈§7
溯因推理 Abductive Reasoning给定现象、想象合理解释并使之泛化——AI 三种推理中最弱的一环§9
哥德尔不完备定理足够强的形式系统总有真而不可证的命题;曹原「数学是发明」的论据之一§7
元递归 Meta-recursive闭环自身的进化:系统随迭代改进自己的工作流乃至代码§4.5
NeoLab新型 AI 实验室:Discovery Loop 式的明星团队创业形态§2
创新者窘境大公司挖到商业化路径后不愿转移资源,给后来者留出窗口§6
Meta Technology 元技术通用目的技术:可与科学、技术、商业一切领域结合的「通用大脑」§10
APPENDIX

人物与机构索引

人物 / 机构身份与本期关联章节
曹原本期嘉宾;前 Google DeepMind 资深研究科学家(Gemini 迭代与后训练);Unreasonable Labs 联合创始人全篇
陈茜硅谷101 创始人,本期主持全篇
Jeff Dean谷歌灵魂人物(MapReduce / BigTable / Google Brain / TensorFlow / TPU / Gemini),离职创办 Discovery Loop§2
Oriol Vinyals / Sanjay Ghemawat / Quoc LeDiscovery Loop 联合创始人;Google Brain 早期成员与谷歌元老§2
Demis HassabisDeepMind 创始人,转任 Chairman 后仍主管 AGI 与科学;主导 Isomorphic Labs§2
John JumperAlphaFold 联合发起人、诺奖得主;加入 Anthropic,预计补生物医药垂直模型§2 / §6
Kevin WeilOpenAI 原 AI4S 负责人;离任后相关工作并入 Codex§6
Alex Wang进入 Meta MSL 后带来改善迹象(Muse Spark、新编程模型)§2
陶哲轩「证明过剩」观察的提出者§8
王虹 / 邓煜2026 菲尔兹奖得主;王虹解决挂谷猜想(百余页证明的形式化范例)§7
Peter Scholze2018 菲尔兹奖得主;人工 Lean 化自证的著名案例§7
Jennifer Doudna诺奖得主;「AI 建议无一超出团队既有认知」§4.8
Edward Witten弦理论奠基人;arXiv 论文脚注致谢 Claude 的思路贡献§9
Judea Pearl / Yann LeCun因果建模先驱 / 世界模型主张者§4.6
Ginkgo Bioworks与 GPT-5 打通的机器人自动化实验室,最有说服力的闭环案例§4.2
A-LabDeepMind × 劳伦斯伯克利的自动化材料实验室(17 天 353 次实验)§4.2
Axiom Math AI / Harmonic AI两家 AI 数学初创;主攻自动形式化,商业化瞄准 EDA 与软件验证§7
PhysicsX物理世界模型初创(流体力学、空气动力学预测)§9
Unreasonable Labs曹原的创业公司:LLM × 符号主义混合路线,方向为 AI for Knowledge Creation§5
SOURCES

来源与说明

  • 视频原片:YouTube《对话前 DeepMind 曹原:AI for Science 爆发,一个新时代到来了》(发布于 2026-08-15,时长 1:49:22);Bilibili 同步版
  • 文字底本:硅谷101 官方微信公众号发布的对谈文字改写稿(虎嗅转载,2026-08-18);时间轴取自节目官方 show notes。
  • 本报告为个人阅读用途的整理与解读:全部观点归属节目嘉宾与主持人,文字为归纳转述而非逐字实录;如需精确引用,请以视频原片为准(各时间码可直达对应片段)。
  • 编者注两处:① 时间轴「抽象出新概念」的时间码疑为笔误(见时间轴节);② 对谈中「做天气预报的 MatterGen」疑为口误(见 §4.3)。
整理日期:2026-08-20 · 本页为自包含 HTML,可离线阅读与打印 · 侧栏搜索支持中英文关键词定位