AI 과학자는 이미 등장했다. 실제로 무엇을 발견할 수 있을까?

AI 과학자는 가설을 세우고 코드를 실행하며 실험 방향을 제시할 수 있다. 하지만 그럴듯한 논문만으로는 발견이 성립하지 않는다. 현재 시스템이 실제로 이룬 성과와 그 근거를 평가하는 방법을 살펴본다.

Candidate hypotheses move through automated laboratory testing to one verified result

2026년 9월 29일 검토. 이제 AI 과학자는 논문을 검색하고, 가설을 세우고, 코드를 작성하고, 실험을 계획하고, 결과를 분석하고, 원고를 작성할 수 있다. 범위가 엄격히 정해진 일부 환경에서는 실험실 장비에 지시를 보낼 수도 있다. 과학자 없이 과학이 가능해진 것처럼 들리지만, 실상은 그렇지 않다.

더 중요한 질문은 구체적이다. 이 시스템은 발견 과정의 어느 단계를 실제로 완료했으며, 시스템 밖에서도 확인되는 증거는 무엇인가? 유창한 문헌 요약은 새로운 가설이 아니다. 새로운 가설은 실험 결과가 아니다. 실험에 성공했다고 해서 그 결과가 곧 확고한 발견이 되는 것도 아니다.

최근 시스템들은 중요한 문턱을 넘었다. 구글의 Co-Scientist는 연구진이 시험관 내에서 검증한 생의학 가설을 도출하는 데 기여했다. FutureHouse의 Robin은 실험실과 사람이 참여하는 연구 과정에서 문헌 검색, 가설 생성, 데이터 분석을 연결했다. Sakana AI의 AI Scientist는 기계학습 논문을 처음부터 끝까지 작성했으며, 이후 시스템이 만든 논문 한 편은 워크숍 심사를 통과했다. 자율 실험실도 화학과 재료과학에서 실제 실험을 수행했다. 근거는 분명하지만, 그 한계도 분명하다.

AI 과학자란 무엇인가?

‘AI 과학자’는 한 가지 작업만 수행하는 대신 연구의 여러 단계를 조율하는 시스템을 가리키는 비공식 명칭이다. 현재 대부분의 사례는 기반 모델에 검색, 과학 데이터베이스, 코드 실행, 전문 모델을 결합하고, 때로는 로봇이나 클라우드 실험실 인터페이스까지 연결한다.

에이전트 구조가 중요한 이유는 과학이 한 번의 프롬프트로 끝나지 않기 때문이다. 시스템은 관련 연구를 찾아내고, 서로 경쟁하는 설명을 비교하고, 가설의 우선순위를 매기고, 검증 실험을 설계하고, 소프트웨어나 기기를 작동하고, 잡음이 섞인 데이터를 해석하고, 다음 시도를 결정해야 할 수 있다. 다중 에이전트 시스템은 이러한 일을 전문화된 구성요소에 나누어 맡기고, 서로의 결과를 생성·비판·개선하게 한다.

따라서 일반적인 챗봇보다 할 수 있는 일이 많지만, 같은 명칭 아래 자율성의 차이는 크다. 어떤 시스템은 논문을 요약하고 연구 방향을 제안한다. 다른 시스템은 시뮬레이션 코드를 작성하고 실행한다. 자율 실험실은 사람이 정의한 탐색 범위 안에서 다음 실험을 고를 수 있다. 셋 다 ‘AI 과학자’라고 부른다고 해서 근거, 자율성, 신뢰성이 같아지는 것은 아니다.

흔히 혼동하는 네 단계

단계AI가 하는 일아직 입증하지 못하는 것
요약기존 연구 결과를 찾아 정리한다종합 내용이 완전하거나 정확하거나 새로운 것인지
가설 생성검증 가능한 설명, 표적 또는 후보를 제안한다가설이 참인지
실험코드를 작성하고, 실험 절차를 지정하거나 기기를 제어한다설계가 타당하거나 결과를 일반화할 수 있는지
발견경험적 근거가 뒷받침하는 새로운 연구 결과에 기여한다결과가 재현되거나 다른 환경에 적용되거나 실제로 중요한지

이 구분은 말뜻의 차이에 그치지 않는다. 과학 지식은 증거와 비판, 확인과 수정을 거쳐 축적된다. 방법이 투명하고 독립적인 연구자가 동일하거나 관련된 조건에서 결과를 다시 시험할 수 있을 때 신뢰도는 높아진다.

현재 시스템들은 실제로 무엇을 발견했나?

Co-Scientist: 실험실 검증으로 이어진 가설

구글의 Co-Scientist는 전문 에이전트를 활용해 연구자가 정한 목표에 따라 가설을 생성·비판·평가·발전시킨다. Nature에 발표된 연구에서는 급성 골수성 백혈병에 대한 약물 재창출 후보와 병용 요법을 찾는 데 기여했으며, 이후 세포 실험에서 이를 검증했다.[1]

결과물이 반증 가능한 제안이 되어 새로운 실험 데이터와 맞닿았다는 점에서 단순한 자동 요약 이상의 성과다. 그러나 Co-Scientist가 스스로 질병을 선택하고 습식 실험을 수행하거나 치료법을 확립했다는 뜻은 아니다. 시험관 내 근거는 초기 연구 결과이지 임상 성과가 아니다. 목표와 제약 조건을 정하고, 실험을 수행하고, 무엇을 시험할지 판단한 것은 연구자들이었다.

Robin: 연구자가 실험대에 참여하는 반복적 발견 과정

Robin은 문헌 조사 에이전트를 데이터 분석 에이전트와 연결한다. 건성 연령관련 황반변성 연구에서 망막색소상피의 식세포 작용을 강화할 것을 제안하고, 치료 후보 선정과 후속 데이터 분석을 도왔다. 발표된 연구는 리파수딜과 KL001의 시험관 내 효능을 보고한 뒤, 가능한 작용 기전과 표적을 시사하는 후속 RNA 시퀀싱 분석을 설명한다.[2]

이는 문제 분해, 후보 생성, 실험 계획, 분석, 가설 수정이라는 여러 지적 단계에 AI가 기여한 가장 분명한 사례 중 하나다. 그러나 논문 자체는 이 과정을 반자율적이라고 부른다. 실제 실험을 수행하고 결과를 제공한 것은 연구자들이었다. 약물 후보는 아직 전임상 단계다. 배양 세포에서 활성을 확인한 것과 환자에게 안전성이나 효능을 입증한 것은 다르다.

AI Scientist: 연구 결과물을 만드는 것과 진실을 확립하는 것은 다르다

Sakana AI의 시스템은 컴퓨터를 이용한 기계학습 연구를 대상으로 한다. 아이디어 제안, 코드 수정, 실험 실행, 그래프 작성, 논문 작성과 자체 검토를 할 수 있다. 이후 버전의 시스템이 생성한 논문 한 편은 ICLR 워크숍의 1차 심사를 통과했다. 동료 심사를 거친 Nature 보고서는 해당 워크숍의 채택률이 70%였다고 밝히며, 템플릿을 사용하는 방식과 사용하지 않는 방식을 모두 설명한다.[3]

심사 통과는 출판 과정에서 의미 있는 이정표지만, 과학적 진실을 보증하지는 않는다. 초기 시스템에 대한 독립 평가에서는 제안된 실험 12건 중 5건이 코딩 오류로 실패했다. 새로운 연구인지 확인하는 과정의 미흡함, 적고 오래된 인용, 구조적 오류, 실제와 다른 수치 결과도 보고했다.[4] 이 대비가 시사하는 바는 명확하다. 에이전트는 그 주장에 새로움과 올바른 구현, 충분한 근거가 있는지 신뢰성 있게 확인하는 속도보다 그럴듯한 논문을 만드는 속도가 더 빠를 수 있다.

자율 실험실: AI가 물리적 증거와 만나는 곳

화학 분야의 Coscientist는 웹과 문서 검색, 코드 실행, 실험실 자동화를 결합했다. 반응 최적화를 포함한 작업을 계획하고 수행했지만, 장치 구성의 일부에서는 여전히 사람이 실험용 플레이트를 옮겨야 했고 연구자들이 실험을 감독했다.[6]

재료과학 분야의 A-Lab은 로봇, 계산 데이터베이스, 문헌으로 학습한 모델, X선 회절 분석, 능동 학습을 결합했다. 정정된 Nature 기록에 따르면 17일 동안 353건의 실험을 수행해 목표 무기물 57종 중 36종의 합성에 성공했다.[7] 이는 특정 분야에서 자율적으로 실험을 최적화할 수 있다는 강한 증거다. 아무런 제약 없이 스스로 연구 의제를 정하는 기계의 증거는 아니다.

이 시스템들은 핵심적인 절충 관계를 보여준다. 입력이 표준화되고, 기기의 출력을 기계가 읽을 수 있으며, 측정 기준이 객관적이고, 탐색 범위가 제한되어 있을수록 자율성을 높일 수 있다. 개방형 생물학 연구, 현장 과학, 근거가 모호한 문제에는 사람이 해야 할 일이 훨씬 많다.

오늘날 AI 과학자가 가장 잘하는 일

  • 방대한 후보군 탐색. 에이전트는 한 명의 연구자가 직접 살펴보기 어려울 만큼 많은 논문, 화합물, 매개변수, 실험 경로를 비교할 수 있다.
  • 목표를 검증 가능한 후보 목록으로 좁히기. 후보의 우선순위를 정하면 비용이 큰 실제 실험의 횟수를 줄일 수 있다.
  • 반복적인 계산 작업 수행. 코드 실행, 시뮬레이션, 매개변수 탐색, 표준화된 분석은 자유 형식의 서술보다 검증하기 쉽다.
  • 범위가 정해진 실험을 반복하며 개선하기. 기기가 안정적인 소프트웨어 인터페이스를 제공하면 시스템은 결과를 바탕으로 다음 시도를 선택할 수 있다.
  • 중간 작업 기록하기. 도구 로그, 코드, 기계가 읽을 수 있는 실험 절차는 보존하고 공개한다는 전제 아래 연구 과정을 더 쉽게 점검하게 해준다.

따라서 가까운 미래의 기회는 홀로 일하는 인공 천재가 아니다. 검색, 구현, 반복 작업에 드는 시간을 줄여 연구자가 문제 설정, 이상 징후 발견, 인과관계 해석, 중요한 의사결정에 더 집중하게 해주는 연구 체계다.

가장 어려운 과제가 여전히 검증인 이유

AI 시스템은 실험실에서 검증할 수 있는 속도보다 훨씬 빠르게 그럴듯한 가설을 만들어낼 수 있다. 그러면 제한된 시간과 장비, 시료, 전문가의 관심을 더 많은 후보 주장이 두고 경쟁하는 검증 병목이 생긴다.

구현 자체도 경고 신호다. PaperBench는 에이전트에게 저명한 기계학습 논문 20편의 실증적 기여를 처음부터 재현하도록 요구한다. 발표된 벤치마크에서 시험 대상 중 최고 성능의 에이전트가 얻은 평균 재현 점수는 21%였다. 기계학습 박사 연구자들은 48시간 동안 논문 3편만을 대상으로 한 더 작은 평가에서 41.4%를 기록했다.[5] 이 수치는 평가 절차에 좌우되므로 보편적인 지능 순위로 해석해서는 안 된다. 다만 신뢰할 만한 새로운 연구를 요구하기에 앞서, 기존 연구를 정확히 재구현하는 일부터 어렵다는 점을 보여준다.

눈에 덜 띄는 실패 유형도 있다.

  • 새로움 판단의 오류. 검색에서 적절한 용어, 다른 분야의 연구, 부정적인 결과를 놓쳐 이미 알려진 아이디어를 다시 발견할 수 있다.
  • 에이전트 간 반복 과정의 확증 편향. 서로의 작업을 생성하고 평가하는 에이전트들이 같은 모델의 맹점을 공유할 수 있다.
  • 결과의 환각. 매끄럽게 쓰인 원고가 실험에서 나오지 않은 수치를 제시하거나 실패한 실행 결과를 잘못 읽을 수 있다.
  • 대리 지표 최적화. 주어진 측정 지표는 개선하면서 실제 과학적 목표에는 오히려 해가 될 수 있다.
  • 드러나지 않는 사람의 설계와 지원. 질문 선택, 코드 템플릿 작성, 탐색 범위 제한, 계획을 실험 절차로 옮기는 과정에 과학적 판단의 상당 부분이 들어갈 수 있다.
  • 낮은 외적 타당도. 벤치마크, 시뮬레이션, 세포주 또는 한 자동화 실험실에서 얻은 결과가 새로운 환경에서도 유지되리라는 보장은 없다.

2025년 자율 실험실에 관한 리뷰는 선도적인 시스템이 일부 환경에서 과학적 방법의 거의 전 과정을 자동화할 수 있다고 결론 내리면서도 비용, 안전, 사이버보안, 책임 소재, 지식재산권 문제를 강조한다.[8] 여기서 일부라는 말이 중요하다. 자율성은 언제나 특정 목표, 도구, 환경을 전제로 한다.

‘AI의 발견’이라는 주장을 평가하는 방법

제목을 그대로 받아들이기 전에 다음 일곱 가지를 물어보자.

  1. 실제로 새로운 것은 무엇인가? 요약인가, 가설인가, 후보인가, 실험 결과인가, 새로운 인과적 설명인가?
  2. 목표와 제약 조건은 누가 정했는가? 포괄적인 프롬프트와 정교하게 설계된 탐색 범위 및 사람이 작성한 기본 틀은 다르다.
  3. AI가 실제로 실행한 것은 무엇인가? 생성된 설명문을 실제로 실행된 코드, 움직인 기기, 수집된 측정값과 구분해야 한다.
  4. 사람은 어디에 개입했는가? 시료 준비, 실험 절차로의 변환, 문제 해결, 후보 선정, 해석 단계를 살펴봐야 한다.
  5. 핵심 주장을 원시 출력과 대조했는가? 원고의 주장은 로그, 데이터, 코드, 기기 기록까지 추적할 수 있어야 한다.
  6. 어느 수준까지 검증되었는가? 시뮬레이션, 시험관 내 시험, 동물실험, 임상시험, 독립적인 재현은 각각 다른 질문에 답한다.
  7. 다른 연구팀이 재현할 수 있는가? 코드, 데이터, 프롬프트, 실험 절차, 모델 버전, 부정적인 결과를 공개해야 가능하다.

이 질문들은 사람이 참여했다는 이유로 진짜 진전을 과소평가하거나, 자연을 대상으로 검증하기 전에 생성된 제안을 발견이라고 부르는 두 가지 오류를 막아준다.

AI가 과학자를 대체할까?

과학 연구의 일부 작업은 대체하거나 재편할 것이다. 문헌 선별, 일상적인 코딩, 매개변수 탐색, 1차 분석, 표준화된 반복 실험이 대표적이다. 소규모 연구팀이 더 많은 방향을 탐색하고 공유 클라우드 실험실을 통해 첨단 자동화를 활용하는 데도 도움이 될 수 있다.

그러나 현재의 근거는 공동 연구자형 AI 모델을 뒷받침한다. 어떤 문제가 중요한지, 대리 지표가 실제 질문을 제대로 반영하는지, 어떤 이상 징후를 눈여겨봐야 하는지, 얼마나 많은 증거가 충분한지, 기술적으로 가능한 실험을 실제로 수행해야 하는지를 결정하는 주체는 여전히 사람이다. 이는 과학의 주변 절차가 아니라 과학의 의미를 결정하는 과정이다.

오늘날 가장 뛰어난 AI 과학자는 우리가 기계가 다룰 수 있게 만든 환경에서 가능성을 제안하고 시험하는 엔진이다. 이들의 가장 강력한 ‘발견’은 모델, 데이터베이스, 기기, 인간의 판단이 함께 만든 결과다. 그것만으로도 이미 의미가 크다. ‘자율 과학자가 등장했다’는 말보다 더 정확하고 유용한 설명이기도 하다.

자주 묻는 질문

AI 과학자가 혼자 힘으로 발견할 수 있나?

범위가 정해진 계산 연구나 자동화 실험실에서는 AI 시스템이 적은 개입만으로 여러 단계를 수행할 수 있다. 하지만 발표된 사례들도 목표 정의, 인프라 구축, 실제 실험의 수행 또는 감독, 결과 검증에는 사람에게 의존한다. 따라서 ‘혼자 힘으로’라는 표현을 쓰려면 단계별로 무엇을 했는지 따져봐야 한다.

AI가 작성한 논문은 발견의 증거인가?

아니다. 시스템이 논문을 작성할 수 있다는 증거일 뿐이다. 과학적 주장은 여전히 올바른 구현, 적절한 실험, 투명한 데이터, 외부의 검토가 필요하다.

동료 심사를 통과하면 AI의 결과가 참이라는 뜻인가?

아니다. 동료 심사는 품질을 가려내는 과정이지 재현 실험이 아니다. 심사자는 새로움, 방법, 서술을 평가할 수 있지만 일반적으로 연구 전체를 다시 실행하지는 않는다.

어떤 분야에서 AI 과학자를 활용하기 쉬운가?

디지털 데이터, 실행 가능한 모델, 표준화된 측정, 프로그래밍 가능한 기기가 있는 분야가 자동화하기 가장 쉽다. 기계학습, 화학, 재료과학에서 초기 사례가 많이 나왔다. 습식 실험을 하는 생물학에서도 AI를 반복적인 연구 과정에 활용할 수 있지만, 실제 실험 수행과 임상 등으로의 적용 검증은 여전히 큰 제약이다.

어떤 근거가 있다면 더 확실할까?

방법과 원시 출력을 공개하고 독립적인 연구팀이 재현한 결과는 개발자의 시연이나 단일 연구팀의 연구보다 강한 근거가 된다. 의학적 후보라면 동물실험과 임상시험이 추가적인 근거를 제공한다. 세포 배양 결과만으로 치료법이 확립되지는 않는다.

고지 및 출처

이 글은 2026년 9월 29일까지 공개된 논문, 사전 공개 논문, 공식 연구 문서를 바탕으로 작성했다. 여기서 다룬 시스템을 직접 시험한 후기는 아니다. ‘발견’은 경험적 증거가 뒷받침하는 새로운 주장이라는 좁은 뜻으로 사용했으며, 근거의 강도와 성숙도는 별도로 설명했다.

  1. Gottweis 외, 「Co-Scientist를 통한 과학적 발견 가속화」, Nature (2026).
  2. Ghareeb 외, 「과학적 발견 자동화를 위한 다중 에이전트 시스템」, Nature (2026).
  3. Lu 외, 「AI 연구의 종단 간 자동화를 향하여」, Nature (2026).
  4. Beel, Kan, Baumgart, 「Sakana의 AI Scientist 평가」, arXiv (2025년 수정).
  5. Starace 외, 「PaperBench: AI 연구 재현 능력 평가」, ICML (2025).
  6. Boiko 외, 「대규모 언어 모델을 활용한 자율 화학 연구」, Nature (2023).
  7. Szymanski 외, 「무기물 합성을 가속하는 자율 실험실」, Nature (2026년 정정).
  8. Tobias와 Wahab, 「자율 ‘셀프 드라이빙’ 실험실」, Royal Society Open Science (2025).