AI 科學家已經到來,但它們真正能發現什麼?

AI 科學家能產生假說、執行程式並協助安排實驗,但科學發現不只是一篇精美論文。本文整理現有系統真正達成的成果,以及判讀證據的方法。

Candidate hypotheses move through automated laboratory testing to one verified result

審閱日期:2026 年 9 月 29 日。如今,AI 科學家能搜尋論文、產生假說、撰寫程式、規劃實驗、分析結果及起草論文。在某些範圍嚴格限定的環境中,它甚至能向實驗設備發出指令。這聽起來像是不需要科學家的科學研究,但事實並非如此。

更有用的問題應該更具體:系統究竟完成了探索流程中的哪個部分?哪些證據能在系統之外經得起檢驗?流暢的文獻摘要不是新假說;新假說不是實驗結果;實驗成功也不會自動成為經得起時間考驗的發現。

近期系統確實跨越了重要門檻。Google 的 Co-Scientist 協助提出由研究人員進行體外測試的生醫假說;FutureHouse 的 Robin 在實驗室參與的流程中串連文獻搜尋、假說生成與資料分析;Sakana AI 的 AI Scientist 能端到端產生機器學習論文,後來其中一篇通過工作坊審查;自動駕駛實驗室也已在化學與材料科學中執行實體實驗。證據是真的,界線也同樣真實。

什麼是 AI 科學家?

「AI 科學家」是一種非正式稱呼,指的是協調多個研究階段、而非只執行單一任務的系統。目前多數案例都結合基礎模型、搜尋、科學資料庫、程式執行、專業模型,有時也會連接機器人或雲端實驗室。

代理架構之所以重要,是因為科學研究不是一道提示就能完成。系統可能需要找出相關研究、比較相互競爭的解釋、排列假說優先順序、設計測試、操作軟體或儀器、解讀帶有雜訊的資料,再決定下一步。多代理系統會把這些工作分給專門元件,彼此產生、批評與修正成果。

這讓它們比一般聊天機器人更有能力,但「AI 科學家」這個名稱掩蓋了自主程度的巨大差異。某套系統可能只摘要論文並建議研究;另一套能編寫及執行模擬程式;自動駕駛實驗室則可能在人類定義的搜尋空間內選擇下一項實驗。把三者都稱為 AI 科學家,不代表它們具有相同證據、自由度或可靠性。

人們經常混淆的四個層次

層次AI 做了什麼仍無法證明什麼
摘要整理檢索並組織現有研究結果彙整內容完整、正確或具有新穎性
產生假說提出可測試的解釋、標的或候選項目假說為真
實驗撰寫程式、指定實驗流程或控制儀器設計有效,或結果能推廣到其他情境
發現對新的、獲實證支持的研究結果有所貢獻研究結果能被重現、轉化或在實務上具有重要性

這不只是語意之爭。科學知識透過證據、批評、確認與修正累積;方法越透明,獨立研究人員越能測試結果是否能在相同或相關條件下成立,可信度也就越高。

目前系統實際發現了什麼

Co-Scientist:假說進入實驗室驗證

Google 的 Co-Scientist 使用專門代理,根據研究人員定義的目標產生、批評、排序及演化假說。在發表於 Nature 的研究中,這套系統協助找出急性骨髓性白血病的藥物再利用候選項目及合併療法,之後並以細胞實驗驗證。[1]

這比自動摘要更進一步,因為輸出成為可否證的提案,並接受新實驗資料檢驗。但這仍不能證明 Co-Scientist 獨立選擇疾病、親自操作濕式實驗室或確立治療方法。體外證據是早期研究結果,不是臨床成效。科學家仍負責提供目標、限制、實驗室工作,以及判斷哪些項目值得測試。

Robin:反覆運作的發現迴路,實驗台前仍有人類

Robin 將文獻代理連接到資料分析代理。在乾性老年性黃斑部病變專案中,它提出增強視網膜色素上皮細胞吞噬作用,協助選擇候選療法並分析後續資料。研究報告了 ripasudil 與 KL001 的體外療效,之後又進行 RNA 定序分析,提出可能的作用機制與標的。[2]

這是 AI 參與多個知識工作階段最清楚的案例之一,包括拆解問題、產生候選項目、規劃實驗、分析及修訂假說。然而,論文本身將流程稱為半自主。實體實驗由研究人員執行,再將結果提供給系統。這些候選藥物仍處於臨床前階段;在培養細胞中找出活性,不等於證明對病患安全或有效。

The AI Scientist:產出研究不等於確立真相

Sakana AI 的系統以計算型機器學習研究為目標。它能提出構想、修改程式、執行實驗、製作圖表、撰寫論文並審查結果。其後續系統產生的一篇論文通過 ICLR 工作坊第一輪審查。經同儕審查的 Nature 報告指出,該工作坊接受率為 70%,並描述了以範本及不使用範本的兩種模式。[3]

通過審查是有意義的出版里程碑,但不是科學真理認證。針對早期系統的獨立評估發現,十二項實驗提案中有五項因程式錯誤而失敗;報告也指出其新穎性檢查薄弱、引用稀少且過時、結構錯誤,以及捏造數字結果。[4]這組對比很有啟示:代理可以快速產出外觀完整的論文,但要可靠確認主張是否新穎、實作正確且獲證據支持,遠比寫出論文更難。

自動駕駛實驗室:AI 與實體證據交會之處

在化學領域,Coscientist 結合網路與文件搜尋、程式執行及實驗室自動化。它規劃並執行了包括反應最佳化在內的任務,但部分設置仍需要人工移動孔盤,實驗也由研究人員監督。[6]

在材料科學領域,A-Lab 結合機器人、計算資料庫、以文獻訓練的模型、X 光繞射分析及主動學習。經更正的 Nature 紀錄報告其在 17 天內執行 353 次實驗,成功合成 57 種目標無機材料中的 36 種。[7]這充分證明系統能在指定領域內自主最佳化實驗,卻不是一台不受限制的機器能自行選擇科學議題的證據。

這些系統凸顯了核心取捨。環境越結構化——標準化輸入、機器可讀的儀器、客觀測量及範圍明確的搜尋空間——自主程度就越高。開放式生物學、田野科學及證據模糊的問題,仍需要更多人類工作。

現今 AI 科學家最擅長的工作

  • 搜尋龐大的候選空間。代理能比較遠多於單一研究人員可人工檢查的論文、化合物、參數或實驗路徑。
  • 把目標轉成可測試的候選清單。排列候選項目優先順序,可以減少昂貴的實體實驗數量。
  • 執行重複的計算工作。程式執行、模擬、參數掃描與標準化分析,比自由書寫的文字更容易稽核。
  • 完成有界的實驗迴路。當儀器提供可靠的軟體介面,系統就能根據結果選擇下一次試驗。
  • 記錄中間工作。如果妥善保存並揭露,工具記錄、程式碼及機器可讀的實驗流程能讓工作更容易檢查。

因此,近期機會不是一位獨自工作的人工天才,而是一套壓縮搜尋、實作與反覆修正時間的研究系統,讓人類投入更多心力於問題界定、異常偵測、因果解讀及影響重大的決策。

為什麼最困難的仍是驗證

AI 系統產生貌似合理假說的速度,遠快於實驗室驗證速度。這形成驗證瓶頸:更多候選主張競爭有限的時間、設備、樣本及專家注意力。

實作能力是一項警訊。PaperBench 要求代理從零開始重現 20 篇重要機器學習論文的實證貢獻。在已發表的基準測試中,表現最佳的受測代理平均重現分數為 21%;機器學習博士則在較小的三篇論文子集中,經過 48 小時後達到 41.4%。[5]這些數字只適用於該測試流程,不應視為通用智慧排名,但它們的確顯示:就連正確重建既有研究都很困難,更別說要求代理創造可靠的新研究。

其他失敗模式更不容易察覺:

  • 新穎性錯誤。檢索若錯過正確術語、領域或負面結果,系統可能重新發現已知構想。
  • 代理迴路內的確認偏誤。相互產生與評判成果的代理,可能具有同一模型的盲點。
  • 捏造結果。精美論文可能聲稱實驗根本未產生的數字,或誤讀失敗的執行結果。
  • 代理指標最佳化。系統可能改善指定指標,卻讓真正的科學目標變得更差。
  • 被隱藏的人類鷹架。選擇問題、建立程式範本、限制搜尋空間及將計畫轉為實驗流程,都可能包含大部分科學判斷。
  • 外部效度薄弱。在基準、模擬、細胞株或單一自動化實驗室中成立的結果,換到新環境可能無法成立。

2025 年一篇自動駕駛實驗室綜述認為,領先系統能在特定情境下自動化幾乎整套科學方法,同時也強調成本、安全、資安、責任歸屬與智慧財產權的挑戰。[8]特定二字很重要。自主永遠是針對特定目標、工具組與環境而言。

如何判斷「AI 發現」的主張

接受標題說法前,先問七個問題:

  1. 真正的新內容是什麼?是摘要、假說、候選項目、實驗結果,還是新的因果解釋?
  2. 誰設定目標與限制?寬泛提示與精心設計的搜尋空間、人類撰寫的鷹架截然不同。
  3. AI 實際執行了什麼?分清楚產生的文字、真正執行的程式、實際運轉的儀器,以及收集到的測量值。
  4. 人類在哪些地方介入?留意樣本準備、實驗流程轉譯、故障排除、候選項目選擇及結果解讀。
  5. 關鍵主張是否對照原始輸出檢查?論文內容應能追溯至記錄、資料、程式碼與儀器紀錄。
  6. 驗證達到哪個層次?模擬、體外測試、動物研究、臨床試驗及獨立重現回答的是不同問題。
  7. 其他團隊能否重現?開放程式碼、資料、提示、實驗流程、模型版本及負面結果能讓重現成為可能。

這套檢驗能避免兩種同樣嚴重的錯誤:因為流程仍有人類參與,就否定真正的進步;或是在自然界尚未給出答案前,就把生成的提案稱為發現。

AI 會取代科學家嗎?

它會取代並重塑部分科學工作。文獻初篩、例行程式設計、參數搜尋、初步分析與標準化實驗循環都是明顯候選項目。它也可能讓小型團隊探索更多方向,並透過共享雲端實驗室取得先進自動化能力。

但目前證據支持的是共同科學家模式。人類仍要決定哪些問題重要、替代指標是否真正反映問題、何時該關注異常、多少證據才足夠,以及技術上可行的實驗是否應該進行。這些不是科學研究外圍的裝飾性步驟,而是決定科學意義的核心。

現今最好的 AI 科學家,是在我們已整理成機器可理解的環境內,提出並測試各種可能性的引擎。它們最有力的「發現」是模型、資料庫、儀器與人類判斷的共同成果。這已帶來重大影響;相較於宣稱自主科學家已經到來,這種說法也更精確、更有用。

常見問題

AI 科學家能獨力做出發現嗎?

在有界的計算或自動化實驗室流程中,AI 系統能在很少介入的情況下執行許多步驟。已發表案例仍依賴人類定義目標、建置基礎設施、執行或監督實體工作,並驗證結果。因此,「獨力」需要逐階段交代。

AI 生成的論文算是發現證據嗎?

不算。它只能證明系統能產生論文。科學主張仍需要正確實作、適當實驗、透明資料及外部檢視。

同儕審查能證明 AI 結果為真嗎?

不能。同儕審查是品質篩選,不是重現。審查者能評估新穎性、方法與表達,但通常不會重新執行整項研究。

哪些領域最適合率先採用 AI 科學家?

具有數位資料、可執行模型、標準化測量及可程式化儀器的領域最容易自動化。機器學習、化學與材料科學已有許多早期案例。濕式實驗生物學也能採用反覆運作的 AI 流程,但實體執行與轉譯驗證仍是主要限制。

什麼才算更有力的證據?

由獨立團隊依據公開方法與原始輸出重現的結果,比開發者展示或單一團隊研究更有力。對醫療候選項目而言,動物研究與臨床試驗還能提供更高層次的證據;單憑細胞培養結果不能確立治療方式。

揭露與資料來源

本文依據截至 2026 年 9 月 29 日可取得的已發表論文、預印本及官方研究文件,並未實際操作文中系統。「發現」在此專指獲實證支持的新主張;證據強度與成熟度則分開說明。

  1. Gottweis 等人,〈以 Co-Scientist 加速科學發現〉,Nature(2026)。
  2. Ghareeb 等人,〈用於自動化科學發現的多代理系統〉,Nature(2026)。
  3. Lu 等人,〈邁向 AI 研究的端到端自動化〉,Nature(2026)。
  4. Beel、Kan 與 Baumgart,〈評估 Sakana 的 AI Scientist〉,arXiv(2025 年修訂)。
  5. Starace 等人,〈PaperBench:評估 AI 重現 AI 研究的能力〉,ICML(2025)。
  6. Boiko 等人,〈以大型語言模型進行自主化學研究〉,Nature(2023)。
  7. Szymanski 等人,〈加速無機材料合成的自主實驗室〉,Nature(2026 年更正)。
  8. Tobias 與 Wahab,〈自主「自動駕駛」實驗室〉,Royal Society Open Science(2025)。