审阅于 2026 年 9 月 29 日。如今,AI 科学家可以检索论文、提出假设、编写代码、规划实验、分析结果并起草论文。在一些边界明确的环境中,它甚至可以向实验室设备发送指令。这听起来像是不需要科学家的科学,但事实并非如此。
更有用的问题要具体得多:系统究竟完成了发现过程中的哪一部分,又有哪些证据在系统之外经受住了检验?流畅的文献综述不是新假设;新假设不是实验结果;一次成功实验也不会自动成为经得起时间考验的发现。
近期系统跨过了一些重要门槛。Google 的 Co-Scientist 协助提出生物医学假设,研究人员随后进行了体外测试。FutureHouse 的 Robin 在“实验室参与闭环”工作流中连接文献检索、假设生成和数据分析。Sakana AI 的 AI Scientist 端到端生成机器学习论文,后来其中一篇通过了研讨会评审。自动驾驶实验室也已经在化学和材料科学中执行实体实验。证据确实存在,边界也同样真实。
什么是 AI 科学家?
“AI 科学家”是一个非正式称呼,指协调多个研究阶段,而非只执行单项任务的系统。目前多数案例把基础模型与搜索、科学数据库、代码执行、专业模型结合起来,有时还接入机器人或云实验室界面。
代理架构之所以重要,是因为科学不是一个提示词就能完成的。系统可能需要检索相关工作、比较互相竞争的解释、排列假设优先级、设计测试、操作软件或仪器、解释带噪数据,并决定下一步尝试什么。多代理系统把这些工作交给不同的专业组件,让它们相互生成、批评和改进成果。
这让它们比通用聊天机器人更有能力,但这个名称掩盖了自主程度上的巨大差异。一套系统可能只是总结论文并建议研究;另一套可能编写并运行模拟代码;自动驾驶实验室则可能在人设定的搜索空间内选择下一个实验。把三者都叫作“AI 科学家”,不代表它们拥有同等的证据、自由度或可靠性。
人们经常混淆的四个层次
| 层次 | AI 做什么 | 尚不能证明什么 |
|---|---|---|
| 总结 | 检索并组织已有发现 | 综合结果完整、正确或具有新意 |
| 生成假设 | 提出可检验的解释、靶点或候选项 | 假设为真 |
| 实验 | 编写代码、指定实验方案或控制仪器 | 设计有效或结果可推广 |
| 发现 | 为有实证支持的新发现作出贡献 | 发现能够复现、转化或在实践中重要 |
这种区分不只是语义问题。科学知识通过证据、批评、确认和纠正不断积累。当方法透明,且独立研究人员能够检验结果在相同或相关条件下是否成立时,结果才会更可信。
当前系统究竟发现了什么
Co-Scientist:提出假设并由实验室跟进
Google 的 Co-Scientist 使用专业代理,围绕研究人员定义的目标生成、批评、排序并迭代假设。在发表于 Nature 的研究中,该系统协助识别急性髓系白血病的药物再利用候选项和联合疗法,随后通过细胞实验得到验证。[1]
这比自动总结更进一步,因为输出变成了可证伪的提议,并接受了新实验数据的检验。但这仍不能表明 Co-Scientist 独立选择了疾病、亲自执行湿实验,或确立了一种治疗方案。体外证据属于早期研究结果,而不是临床结局。科学家提供了目标、约束、实验室工作,以及判断哪些内容值得测试的专业意见。
Robin:迭代式发现闭环,实验台前仍有人参与
Robin 把文献代理与数据分析代理连接起来。在一个干性年龄相关性黄斑变性项目中,它提出增强视网膜色素上皮的吞噬作用,协助选择治疗候选项,并分析后续数据。已发表研究报告了 ripasudil 和 KL001 的体外疗效,随后描述了一项后续 RNA 测序分析,该分析提出一种可能的机制与靶点。[2]
这是 AI 跨越多个认知阶段作出贡献的最清晰案例之一:分解问题、生成候选项、规划实验、分析和修订假设。不过,论文将这一过程明确称为半自主。研究人员执行实体实验并提供结果。这些候选药物仍处于临床前阶段;在培养细胞中发现活性,不等于已经证明对患者安全或有效。
The AI Scientist:产出研究不等于确立事实
Sakana AI 的系统面向计算型机器学习研究。它可以提出想法、修改代码、运行实验、制作图表、撰写论文并评审结果。其后续系统生成的一篇论文通过了 ICLR 研讨会第一轮评审。经同行评审的 Nature 报告指出,该研讨会接受率为 70%,并描述了基于模板和不使用模板的两种模式。[3]
通过评审是有意义的发表里程碑,却不是科学事实的证书。对早期系统的一项独立评估发现,12 个拟议实验中有 5 个因代码错误而失败。评估还报告了新颖性检查薄弱、引用稀少且陈旧、结构错误和捏造数值结果等问题。[4]这种对比很有启发:代理生成一篇形式完整的论文,可能比可靠地证明主张新颖、实现正确且有证据支持容易得多。
自动驾驶实验室:AI 与实体证据相遇之处
在化学领域,Coscientist 将网页与文档检索、代码执行和实验室自动化结合起来。它规划并执行了包括反应优化在内的任务,不过部分设置仍需人工移动孔板,研究人员也对实验进行了监督。[6]
在材料科学领域,A-Lab 结合机器人、计算数据库、基于文献训练的模型、X 射线衍射分析和主动学习。经更正的 Nature 记录报告称,系统在 17 天内完成 353 次实验,并成功合成 57 种目标无机材料中的 36 种。[7]这为特定领域内的自主实验优化提供了强有力证据,但不能证明一台不受限制的机器会选择自己的科学议程。
这些系统揭示了核心权衡。环境越结构化——输入标准化、仪器可由机器读取、测量客观、搜索空间有边界——就越能实现更高自主程度。开放式生物学、野外科学以及涉及模糊证据的问题,仍会把更多工作留给人。
AI 科学家目前最擅长什么
- 搜索庞大的候选空间。代理可以比较远超单个研究人员手工审查能力的论文、化合物、参数或实验路径。
- 把目标变成可测试的候选清单。为候选项排序可以减少昂贵的实体实验数量。
- 执行重复性计算工作。相比自由形式文本,代码执行、模拟、参数扫描和标准化分析更容易审计。
- 闭合有边界的实验循环。当仪器提供可靠的软件接口时,系统可以根据结果选择下一次试验。
- 记录中间工作。如果被保留和披露,工具日志、代码和机器可读实验方案可以让工作流更容易检查。
因此,近期机会不是一个独自工作的合成天才,而是一套压缩检索、实现和迭代过程的研究栈,让人把更多注意力投入问题定义、异常识别、因果解释和后果重大的决策。
为什么最难的部分仍是验证
AI 系统生成貌似合理假设的速度,可以远高于实验室测试这些假设的速度。这会形成验证瓶颈:更多候选主张争夺有限的时间、设备、样本和专家注意力。
实现能力是一个警示信号。PaperBench 要求代理从零开始复现 20 篇有影响力的机器学习论文中的实证贡献。在已发表基准中,表现最好的受测代理平均复现得分为 21%;机器学习博士在较小的三篇论文子集上用 48 小时达到 41.4%。[5]这些数字只适用于该测试协议,不应被视为通用智能排名。它们确实说明,即便只是正确重建已有研究仍然很困难,更不用说要求代理创造可靠的新成果。
其他失败模式更不容易看见:
- 新颖性错误。系统可能因为检索遗漏了正确术语、领域或负面结果,而重新发现一个已知想法。
- 代理闭环内的确认偏误。生成和评判彼此工作的代理可能共享同一模型的盲点。
- 结果幻觉。精致论文可能写入实验从未产生的数字,或误读一次失败运行。
- 代理指标优化。系统可能改善给定指标,却让真实科学目标变得更差。
- 隐藏的人类支架。选择问题、搭建代码模板、限制搜索空间,以及把计划转成实验方案,都可能包含大量科学判断。
- 外部有效性薄弱。基准、模拟、细胞系或某一自动化实验室中的结果,换到新环境后可能无法成立。
一篇 2025 年自动驾驶实验室综述认为,领先系统可在特定环境中自动完成几乎整个科学方法,同时也强调成本、安全、网络安全、问责和知识产权方面的挑战。[8]“特定”二字至关重要。自主始终是针对特定目标、工具集和环境的自主。
如何判断“AI 发现”主张
接受标题中的说法前,先问七个问题:
- 真正的新内容是什么?是总结、假设、候选项、实验结果,还是新的因果解释?
- 谁设定目标和限制?一个宽泛提示词,与精心设计的搜索空间和人编写的支架不同。
- AI 实际执行了什么?区分生成的文字、实际运行的代码、真正移动的仪器和采集到的测量数据。
- 人在哪里介入?留意样本制备、方案转译、故障排查、候选选择和解释。
- 关键主张是否对照原始输出检查?论文内容应能追溯到日志、数据、代码和仪器记录。
- 验证达到了哪个层次?模拟、体外测试、动物研究、临床试验和独立复现回答的是不同问题。
- 其他团队能否复现?开放代码、数据、提示词、实验方案、模型版本和负面结果可以让复现成为可能。
这套检查能避免两种同样严重的错误:因为人仍参与其中就否定真正的进展,或者在自然界给出答案之前就把生成的提议称作发现。
AI 会取代科学家吗?
它会取代并重塑科学工作的一部分。文献初筛、常规编码、参数搜索、初步分析和标准化实验循环都是明显的候选项。它也可能让小团队探索更多方向,并通过共享云实验室使用先进自动化能力。
但目前证据更支持协同科学家模式。人仍要决定哪些问题重要、代理指标是否捕捉到真实问题、异常何时值得关注、多少证据才足够,以及一项技术上可行的实验是否应该进行。这些不是科学外围的装饰步骤,而是决定科学意义的关键。
今天最优秀的 AI 科学家,是在我们已经让机器能够理解的环境中提出并测试各种可能性的引擎。它们最有力的“发现”是模型、数据库、仪器和人类判断共同作用的产物。这已经影响深远,也比宣称自主科学家已经到来更准确、更有用。
常见问题
AI 科学家能独自作出发现吗?
在有边界的计算或自动化实验室工作流中,AI 系统可以在很少干预下执行许多步骤。已发表案例仍依赖人来定义目标、建设基础设施、执行或监督实体工作,并验证结果。因此,“独自”需要逐阶段核算。
AI 生成的论文是发现的证据吗?
不是。它只能证明系统能够生成一篇论文。科学主张仍需要正确实现、恰当实验、透明数据和外部审查。
同行评审能证明 AI 结果为真吗?
不能。同行评审是一道质量筛选,而不是复现。评审者可以评价新颖性、方法和表达,但通常不会重新运行整项研究。
哪些领域最适合率先使用 AI 科学家?
拥有数字化数据、可执行模型、标准化测量和可编程仪器的领域最容易自动化。机器学习、化学和材料科学已经提供许多早期案例。湿实验生物学可以支持迭代式 AI 工作流,但实体执行和转化验证仍是主要限制。
什么能算更有力的证据?
采用已披露方法和原始输出、并由独立团队复现的结果,比开发者演示或单一团队研究更有力。对于医疗候选项,动物研究和临床试验会增加更多证据层次;仅有细胞培养结果不足以确立一种治疗。
披露与来源
本文依据截至 2026 年 9 月 29 日可获得的已发表论文、预印本和官方研究文档,并非对所讨论系统的上手测试。本文把“发现”严格限定为有实证支持的新主张;证据的强度和成熟度则单独说明。
- Gottweis 等,《使用 Co-Scientist 加速科学发现》,Nature(2026)。
- Ghareeb 等,《用于自动化科学发现的多代理系统》,Nature(2026)。
- Lu 等,《迈向 AI 研究的端到端自动化》,Nature(2026)。
- Beel、Kan 和 Baumgart,《评估 Sakana 的 AI Scientist》,arXiv(2025 年修订)。
- Starace 等,《PaperBench:评估 AI 复现 AI 研究的能力》,ICML(2025)。
- Boiko 等,《利用大型语言模型开展自主化学研究》,Nature(2023)。
- Szymanski 等,《用于加速无机材料合成的自主实验室》,Nature(2026 年更正)。
- Tobias 和 Wahab,《自主“自动驾驶”实验室》,Royal Society Open Science(2025)。
