AI 과학자 시스템을 개발하는 과정에서 다루어지는 최근 주제들

AI 과학자 시스템은 과학적 발견의 자동화와 가속화를 목표로 등장한 차세대 기술로, 문헌 조사부터 가설 생성, 실험, 검증에 이르는 연구 생애 주기 전반을 자율적으로 수행할 수 있는 잠재력을 지니고 있습니다. 이 시스템은 대규모 언어 모델(LLM)을 기반으로 한 에이전트 기술과 시뮬레이션 툴을 결합하여, 인간 과학자의 능력을 보완하거나 대체하는 '인지적 행위자(Epistemic Actor)'로 진화하고 있습니다. 신약 개발이나 신소재 디자인 등 구체적인 분야에서는 이미 상용 모델을 능가하는 성과를 보이고 있으나, 결과의 재현성 확보와 환각 현상과 같은 기술적 한계와 윤리적 쟁점이 여전히 존재합니다. 본 보고서는 AI 과학자 시스템의 기술적 아키텍처, 적용 사례, 자율 연구 프로세스, 그리고 현재 직면한 문제점과 미래 전망을 심층적으로 분석합니다.

1. 개요 및 정의

AI for Science는 인공지능 기술을 활용하여 과학적 발견을 돕고 가속화하는 분야를 의미하며, 그 정점에는 'Agentic Scientist' 또는 'AI 과학자'라 불리는 자율 시스템이 자리 잡고 있습니다. 전통적인 계산 과학 도구가 인간의 추론 능력을 확장하는 수동적인 도구였던 것과 달리, AI 과학자는 능동적으로 가설을 생성하고 검증하는 과정에 참여하는 '질적 전환(Qualitative Transition)'을 가져오는 존재로 정의됩니다 [1]. 이러한 시스템은 단순한 계산 도구를 넘어, 과학적 가설 생성 및 검증 능력을 확장할 수 있는 다중 에이전트 시스템(Multi-agent systems)으로 진화하고 있으며, 과학적 생태계 내에서 검증, 책임, 해석 가능성, 이중 용도 안전성을 고려한 제도적 개혁 속에서 개발되어야 합니다 [1].

2. 핵심 기술 및 시스템 아키텍처

AI 과학자 시스템의 핵심은 대규모 언어 모델(LLM)을 중심으로 한 에이전트 아키텍처입니다. 기본적인 AI 에이전트는 센서가 지각(Percept)을 제공하면, 내부 상태와 목적/효용 함수(Goal/Utility Function)에 따라 의사결정/추론 엔진(Decision/Reasoning Engine)을 통해 행동을 결정하고 액추에이터가 이를 수행하는 구조를 가집니다 [6]. 구체적인 추론 방식으로는 '사고(Thought) -> 행동(Action) -> 관찰(Observation)'의 순환을 따르는 ReAct(Reasoning + Acting) 패턴이 널리 사용됩니다 [6].

시스템 아키텍처는 크게 단일 에이전트(Single-Agent), 다중 에이전트(Multi-Agent), 하이브리드(Hybrid) 형태로 나뉩니다. 단일 에이전트는 하나의 LM 컨트롤러가 추론, 도구 사용, 메모리 접근을 반복하는 방식이며, 다중 에이전트는 역할이 특화된 에이전트들이 공유 도구와 메모리를 통해 조율되는 구조입니다 [8]. 하이브리드 아키텍처는 오케스트레이터(Orchestrator)가 검색, 분석, 실행, 종합, 비평 등의 단계를 관리하면서 영구적인 상태(증거 로그, 중간 산출물 등)를 유지하는 이상적인 워크플로우를 제공합니다 [8]. 예를 들어, 'Denario'와 같은 프로토타입 프레임워크는 다중 에이전트 아키텍처를 통해 발견 주기를 가속화하고 인간의 도달 범위를 넘어선 모델 공간을 탐색하도록 설계되었습니다 [1].

3. 주요 응용 분야 및 사례 연구

AI 과학자 시스템은 신소재 디자인, 의학, 실험실 자동화 등 다양한 과학 분야에서 적용되고 있습니다.

  • 신소재 연구: 소재 과학 연구 과제에서 '가설 진화 프로토콜(Hypothesis Evolution Protocol, HEP)'을 장착한 에이전트는 가설-검증-증거-믿음(Hypothesis--test--evidence--belief)의 순환을 운영하며, 계획 기반 에이전트가 결여한 기능을 수행하고 연구 질문 간에 일반화하는 능력을 보여주었습니다 [5].
  • 의학 연구: 'Medical AI Scientist'는 연구 아이디어 생성에서 상용 LLM(GPT-5, Gemini-2.5-Pro 등)을 능가하는 성과를 거두었습니다. 문헌에서 영감을 받은 혁신(Literature-inspired Innovation) 모드와 작업 기반 탐색(Task-driven Exploration) 모드에서, 해당 시스템은 참신성(Novelty), 성숙도(Maturity), 윤리성(Ethicality) 등 평가 기준에서 가장 높은 점수(약 4.0~4.5점)를 기록했으며, 상용 모델들과 달리 의학적 및 공학적 증거를 추적할 수 있는 상세한 아이디어를 생성했습니다 [11].
  • 실험실 자동화: EOS AI 에이전트는 자연어와 대화형 시각적 그래프 편집기를 통해 과학자가 실험 프로토콜을 생성하고, 최적화 캠페인을 모니터링하며 결과를 분석할 수 있게 합니다. 실제 최적화 캠페인에서 20번째 실험 만에 목적 함수 값(Loss)을 약 0.94에서 0.003922(~0.39%)로 낮추는 성과를 보였습니다 [2].
  • 데이터 평가: SciHorizon-DataEVA와 같은 시스템은 이기종 과학 데이터의 AI 준비성(AI-readiness)을 평가하기 위해 지식 증강(Knowledge augmentation)과 적응형 도구 중심 평가(Adaptive tool-centric evaluation) 아키텍처를 사용합니다 [7].

4. 자율 연구 프로세스: 가설부터 검증까지

AI 과학자는 연구 생애 주기(Lifecycle) 전반을 자율적으로 수행할 수 있도록 설계됩니다. 여기에는 문헌 종합, 코드 생성, 데이터 분석, 가설 제안, 모델 비평 등의 작업이 포함됩니다 [1]. 구체적인 자율 수행 메커니즘은 다음과 같습니다.

  • 가설 생성 및 진화: 기존 에이전트들은 가설, 검증, 믿음의 업데이트가 비구조화된 로그에 묻혀 감사가 불가능한 문제가 있었습니다. 이를 해결하기 위해 제안된 HEP(Hypothesis Evolution Protocol)는 가설 생성, 평가, 진화를 명시적이고 감사 가능한(auditable) 작업으로 제공하여, 에이전트가 증거에 비추어 가설을 제안하고 테스트하며 믿음을 수정하는 과정을 체계화합니다 [5].
  • 실험 설계 및 최적화: EOS AI 에이전트의 사례에서 보듯, AI는 실험 프로토콜을 YAML과 같은 구조화된 텍스트로 정의하고, 이를 통해 실험을 자동화합니다. 이 과정에서 AI는 결과를 실시간으로 분석하여 다음 실험의 변수를 조정하며 목표 값을 최적화해 나갑니다 [2].
  • 자율 루프 및 가드: 'Scholar-loop'와 같은 오픈 소스 프로젝트는 문헌, 실험, 자기 비평, 보고서 작성을 순환하는 다중 에이전트 루프를 구현하며, 리워드 해킹(Reward-hacking)과 환각을 방지하기 위한 결정론적 가드(Deterministic guards)를 포함합니다 [10].

5. 쟁점 및 기술적 한계

AI 과학자 시스템이 발전함에 따라 여러 가지 기술적 한계와 쟁점이 대두되고 있습니다.

  • 결과의 재현성 및 평가: 연구의 질을 평가할 때, 일관성(Coherence)은 높은 일치율(89.3%, 84.7%)을 보이는 반면, 재현성(Reprocudibility)과 일반화 가능성(Generalizability)에 대한 평가는 상대적으로 낮은 일치율(26.4%, 24.4%)을 기록하는 등 평가 기준에 따라 신뢰도가 달라지는 문제가 있습니다 [3].
  • 다양성 부족 및 수렴: 현재의 생성형 AI 모델들은 다양한 결과 생성이 요구됨에도 불구하고, 모델 간 출력 유사도가 0.72~0.91로 매우 높게 나타납니다. 이는 AI가 새로운 가설을 생성할 때 독창적인 다양성을 확보하지 못하고 수렴하는 경향이 있음을 시사하며, 이는 자율적 과학 발견의 주요 장애물입니다 [9].
  • 환각 및 데이터 부족: LLM 기반 시스템은 본질적으로 환전 현상에 취약하며, 과학적 연구에 필요한 고품질의 데이터가 부족할 경우 신뢰할 수 없는 결과를 도출할 위험이 있습니다. 이를 방지하기 위해 Scholar-loop와 같은 시스템은 환각 방지를 위한 결정론적 가드를 두는 등의 대책을 마련하고 있습니다 [10].
  • 해석 가능성 및 감사 가능성: 복잡한 과학적 추론 과정이 블랙박스 안에서 일어나는 것을 방지하기 위해, 연구 과정을 명시적으로 기록하고 검증할 수 있는 프로토콜(예: HEP)의 도입이 필수적인 과제로 남아 있습니다 [5].

6. 미래 전망 및 윤리적 고찰

AI 과학자는 단순한 도구가 아닌 '인지적 행위자(Epistemic Actor)'로서 과학 생태계에 편입될 것으로 예상됩니다. 이에 따라 저작권, 동료 평가(Peer review), 인간 과학자의 지속적인 역할에 대한 재정의가 필요합니다 [1]. 또한, AI가 생성한 연구 결과에 대한 책임 소재와 이중 용도(Dual-use) 기술의 안전성을 확보하기 위한 거버넌스 체계가 마련되어야 합니다 [1].

기술적으로는 AI 과학자가 인간 과학자와 협업하는 모델이 발전할 것이며, 특히 의학 분야에서와 같이 상용 모델보다 우수한 참신성과 성숙도를 가진 아이디어를 생성하는 등 인간의 능력을 보완하는 강력한 파트너로 자리 잡을 것입니다 [11]. 그러나 AI가 생성하는 결과의 다양성을 확보하고 [9], 연구 과정의 투명성과 재현성을 높이는 [3] 기술적 개선이 선행되어야 합니다. 결론적으로 AI 과학자의 성공적인 정착은 기술적 고도화와 더불어 이를 둘러싼 제도적, 윤리적 기반의 동시적인 혁신에 달려 있습니다.

용어·기법 풀이

  • AI for Science: 인공지능 기술을 활용하여 과학적 발견을 돕고 가속화하는 분야를 의미합니다.
  • AI-readiness (AI 준비성): 과학 데이터가 인공지능 모델 학습이나 예측 등에 효과적으로 사용될 수 있는 준비 상태를 평가하는 지표입니다.
  • Adaptive tool-centric evaluation (적응형 도구 중심 평가): 상황에 맞게 도구를 적응적으로 활용하여 이기종 과학 데이터의 AI 준비성을 평가하는 아키텍처입니다.
  • Agentic Scientist (AI 과학자): 문헌 조사부터 가설 생성, 실험, 검증까지 연구 과정 전반을 자율적으로 수행하는 인공지능 시스템입니다.
  • Denario: 다중 에이전트 아키텍처를 통해 발견 주기를 가속화하고 인간의 도달 범위를 넘어선 모델 공간을 탐색하도록 설계된 프로토타입 프레임워크입니다.
  • Deterministic guards (결정론적 가드): AI가 리워드 해킹이나 환각 현상에 빠지지 않도록 방지하는 확정적인 안전 장치입니다.
  • Dual-use (이중 용도): 원래의 평화로운 목적뿐만 아니라 유해한 목적으로도 사용될 수 있는 기술의 특성을 의미합니다.
  • EOS AI 에이전트: 자연어와 시각적 편집기를 통해 실험 프로토콜을 생성하고 최적화 캠페인을 모니터링하는 실험실 자동화 시스템입니다.
  • Epistemic Actor (인지적 행위자): 단순한 도구를 넘어 과학적 지식을 생산하고 검증하는 주체로서 행동하는 AI 시스템을 의미합니다.
  • Goal/Utility Function (목적/효용 함수): AI 에이전트가 의사결정을 내릴 때 목표를 달성하거나 이익을 최대화하기 위해 따르는 기준이 되는 함수입니다.
  • Hypothesis Evolution Protocol (HEP): AI 에이전트가 가설을 생성, 평가, 진화시키는 과정을 명시적이고 감사 가능한 형태로 체계화한 프로토콜입니다.
  • Knowledge augmentation (지식 증강): 데이터의 AI 준비성을 평가하기 위해 외부 지식을 더하여 성능을 높이는 기법입니다.
  • LLM (Large Language Model, 대규모 언어 모델): 방대한 텍스트 데이터로 학습하여 인간과 같은 언어 이해 및 생성 능력을 가진 인공지능 모델입니다.
  • Literature-inspired Innovation (문헌에서 영감을 받은 혁신): 기존 문헌에서 아이디어를 얻어 새로운 연구 아이디어를 생성하는 모드입니다.
  • Medical AI Scientist: 의학 분야에 특화되어 상용 모델보다 우수한 참신성과 성숙도를 가진 연구 아이디어를 생성하는 자율 시스템입니다.
  • Multi-agent systems (다중 에이전트 시스템): 특정 역할을 가진 여러 AI 에이전트들이 도구와 메모리를 공유하며 협력하여 문제를 해결하는 시스템입니다.
  • Orchestrator: 다중 에이전트 시스템에서 검색, 분석, 실행 등의 작업 단계를 관리하고 조율하는 주체입니다.
  • Qualitative Transition (질적 전환): 수동적인 도구에서 능동적으로 가설을 생성하고 검증하는 주체로서 AI의 역할이 근본적으로 바뀌는 현상입니다.
  • ReAct (Reasoning + Acting): 사고(Thought), 행동(Action), 관찰(Observation)의 순환을 통해 추론과 행동을 연결하는 패턴입니다.
  • Reward-hacking (리워드 해킹): AI가 실제 목표 달성이 아닌 보상을 받기만 하는 꼼수를 부리는 현상을 의미합니다.
  • Scholar-loop: 문헌, 실험, 자기 비평, 보고서 작성을 순환하는 오픈 소스 자율 AI 과학자 시스템입니다.
  • SciHorizon-DataEVA: 이기종 과학 데이터의 AI 준비성을 평가하기 위해 개발된 에이전트 시스템입니다.
  • Task-driven Exploration (작업 기반 탐색): 특정 과업이나 목표를 중심으로 탐색을 수행하여 연구 아이디어를 생성하는 모드입니다.

참고문헌 (11건)

[1] AI Scientists as Engines of Discovery: A Case for Development within Reformed Institutions (arxiv, 2026) · 원문

  • 이 논문이 푼 문제: 이 논문은 인공지능(AI)이 단순한 도구를 넘어 스스로 가설을 만들고 검증하는 'AI 과학자'로 진화할 수 있는지, 그리고 이러한 변화가 왜 과학의 발전에 중요한지를 다룹니다. 특히 AI가 과학적 발견의 능력을 확장할 수 있도록 하기 위해, 검증과 책임, 안전을 위해 기존의 과학 제도를 어떻게 새롭게 설계해야 하는지를 질문합니다.
  • 방법: 저자들은 여러 AI 에이전트가 협력하는 '다중 에이전트 시스템'을 핵심 방법으로 제시하며, 이를 'Denario'라는 시제품 프레임워크를 통해 예시로 듭니다. 이 접근 방식은 AI가 문헌 정리, 코드 생성, 데이터 분석, 가설 제안, 모델 비판 등 과학의 인지적 작업에 직접 참여하여 연구 그룹처럼 기능하도록 만드는 것입니다.
  • 핵심 결과: 논문은 적절히 설계된 다중 에이전트 시스템이 과학적 발견의 주기를 가속화하고, 인간이 도달할 수 없는 모델 영역까지 탐색할 수 있음을 보여줍니다. 또한 이러한 시스템이 과학적 가설 생성과 검증 능력을 확장할 수 있다는 점을 강조하며, 이를 위해 저자권, 동료 심사, 인간 과학자의 역할 변화와 같은 제도적 개편의 필요성을 제안합니다.

[2] From Prompts to Protocols: An AI Agent for Laboratory Automation (arxiv, 2026) · 원문

  • 이 논문이 푼 문제: 자동화된 실험실을 운영하려면 복잡한 코드와 설정 파일을 직접 작성해야 하는 어려움이 있어, 과학자들이 쉽게 실험을 설계하고 모니터링할 수 있는 방법이 필요합니다.
  • 방법: 대규모 언어 모델을 실험 관리 시스템과 결합하여, 과학자가 자연어로 말하면 실험 절차를 만들고 수정하며, 시각적인 그래프 편집기로도 조작할 수 있게 했습니다.
  • 핵심 결과: 시뮬레이션 평가에서 실험 절차 생성 성공률이 97%에 달했고, 최적화 캠페인에서는 20번째 실험 만에 손실 값이 약 0.94에서 0.004로 크게 줄어드는 등 상당한 효율성을 보였습니다.

[3] The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research (arxiv, 2026) · 원문

  • 이 논문이 푼 문제: 기존의 논문 중심 검토 방식은 연구의 엄밀함과 재현성을 제대로 평가하기 어렵고, AI가 대량의 연구를 생산하면서 이 문제가 더 심해지고 있습니다. 이 논문은 연구의 질을 더 엄격하고 효율적으로 평가할 수 있는 새로운 방법이 필요함을 제기합니다.
  • 방법: 저자들은 논문뿐만 아니라 코드와 데이터를 직접 실행해보며 검증하는 '실행 기반 평가' 프레임워크를 제안하고, 이를 자동화하는 AI 평가자(MechEvalAgent)를 개발했습니다. 이 도구는 실험 과정의 일관성, 결과의 재현성, 발견의 일반화 가능성을 평가합니다.
  • 핵심 결과: 제안된 방법은 인간 심사위원과 80% 이상의 일치율을 보이며, 인간이 놓친 51가지의 추가적인 문제를 찾아내는 등 연구 평가의 엄밀함을 높이는 데 성공했습니다.

[4] When AI Meets Science: Research Diversity, Interdisciplinarity, Visibility, and Retractions across Disciplines in a Global Surge (arxiv, 2026) · 원문

  • 이 논문이 푼 문제: 이 논문은 전 세계적으로 급증하는 인공지능(AI) 기술이 다양한 학문 분야의 연구 다양성, 학제 간 협력, 가시성, 철회 등에 어떤 영향을 미치는지 파악하려 합니다. 이를 통해 AI가 과학 연구의 전반적인 생태계와 질에 미치는 중요한 변화를 이해하는 것이 목표입니다.
  • 방법: 저자들은 2억 2,700만 건 이상의 학술 데이터를 분석하여 AI 방법론을 사용하는 연구의 비율과 특성을 조사했습니다. 사전 기반 접근과 대규모 언어 모델(LLM)을 활용한 의미 분류 방법을 결합하여 데이터를 처리하고 검증했습니다.
  • 핵심 결과: 모든 과학 분야에서 AI 방법론을 사용하는 연구의 비율이 2016년부터 2024년까지 급격히 증가했으며, 특히 물리과학·공학 분야와 보건과학 분야에서 AI 사용량이 가장 많았습니다.

[5] Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents (arxiv, 2026) · 원문

  • 이 논문이 푼 문제: AI 과학자가 스스로 가설을 세우고 실험하는 과정이 불투명해서, 사람이 그 과정을 검증하기 어렵다는 문제를 해결하려 합니다. 이는 AI가 하는 과학적 추론을 믿고 발전시키기 위해 중요합니다.
  • 핵심 결과: HEP를 장착한 AI 에이전트는 소재 과학 과제에서 기존 방식보다 더 투명하게 연구 순환을 수행했고, 기본 모델이 뛰어날수록 프로토콜을 더 잘 활용하는 것으로 나타났습니다.

[6] Approaches and emerging trends in multi-agent autonomous AI systems for education innovation in Vietnam (openalex, 2026) · 원문

  • 이 논문이 푼 문제: 이 논문은 복잡한 실제 과제를 자동으로 수행하는 '에이전트 AI(Agentic AI)' 시스템의 주요 접근 방식을 분석하고, 이를 베트남의 교육 및 과학 연구 혁신에 어떻게 활용할 수 있는지 탐구하는 것이 목적입니다. 이는 최신 언어 모델을 넘어 스스로 계획하고 도구를 사용하는 자율형 AI 시스템의 발전 방향을 제시하기 위해 중요합니다.
  • 방법: 저자들은 대형 시각-언어 모델(LVLM), ReAct 및 Plan-and-Execute 같은 추론 아키텍처, 외부 도구 호출 기법, 그리고 다중 에이전트 협업 시스템 등 다양한 기술적 접근 방식을 포괄적으로 조사하고 분석했습니다. 또한 이러한 기술들을 통합하여 지능형 에이전트 시스템을 구축하는 통합 방안을 제안하며, 베트남의 교육 및 연구 분야 적용 가능성을 논의했습니다.
  • 핵심 결과: 이 논문은 다양한 에이전트 아키텍처와 도구의 특징, 장단점을 체계적으로 정리하여 자율형 AI 에이전트 개발을 위한 기초를 마련했으며, 베트남의 교육 혁신과 과학 기술 발전을 위해 이러한 Agentic AI 기술을 적극 도입하고 활용해야 한다고 권고합니다.

[7] SciHorizon-DataEVA: An Agentic System for AI-Readiness Evaluation of Heterogeneous Scientific Data (arxiv, 2026) · 원문

  • 이 논문이 푼 문제: 서로 다른 형태의 과학 데이터가 인공지능(AI) 학습에 얼마나 잘 활용될 수 있는지(준비 상태)를 자동으로 평가하는 문제를 해결하려 합니다. 이는 데이터의 품질과 활용 가능성을 빠르게 파악하여 AI 연구의 효율을 높이는 데 중요합니다.
  • 방법: 지식을 보강하여 평가 기준을 만들고, 상황에 맞는 도구를 적응적으로 사용하여 데이터의 AI 준비 상태를 평가하는 시스템을 제안합니다. 이 시스템은 반복적인 검토와 기억 기능을 활용하여 평가 과정을 자동화합니다.
  • 핵심 결과: 제안된 방법은 프레임워크 평가 성공률 89.0%, 도구 생성 성공률 97.4%를 달성하여 다른 변형 모델들보다 더 높은 성능을 보였습니다. 또한 도구 생성 효율성 측면에서도 더 적은 반복 횟수(평균 1.19회)를 기록했습니다.

[8] AI Agents for the Science of Science: A Survey of Tasks, Architectures, Evaluations, and Challenges (acl, 2026) · 원문

  • 이 논문이 푼 문제: 이 논문은 과학 지식이 어떻게 생성되고 변화하는지 연구하는 '과학의 과학(SciSci)' 분야에서, 대규모 데이터 분석을 돕는 AI 에이전트의 역할과 현황을 정리하는 문제를 다룹니다. 이는 데이터가 복잡해짐에 따라 기존 방법을 넘어선 새로운 연구 도구가 필요하기 때문에 중요합니다.
  • 방법: 저자들은 AI 에이전트를 과학 행동을 모방하는 '시뮬레이션'과 실증 분석을 돕는 '도구'로 구분하는 분류 체계를 제안하고, 단일 에이전트, 다중 에이전트, 하이브리드 등 다양한 시스템 구조를 조사하여 접근 방식을 체계화했습니다.
  • 핵심 결과: 이 조사는 SciSci 분야에서 AI 에이전트가 연구 방식을 재편하고 있음을 보여주며, 신뢰성, 데이터 품질, 편향 등의 주요 도전 과제를 확인하여 향후 신뢰할 수 있는 AI 시스템 개발을 위한 기반을 마련했습니다.

[9] Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery (arxiv, 2026) · 원문

  • 이 논문이 푼 문제: 이 논문은 최근 각광받는 '에이전트형 AI 과학자'들이 스스로 새로운 과학적 발견을 해낼 수 있는지 의문을 제기합니다. 이들이 정말 독립적으로 과학을 탐구할 수 있는지 확인하는 것은 AI의 한계와 가능성을 파악하는 데 중요합니다.
  • 방법: 연구진은 여러 최신 AI 모델들에게 논문이나 실험 결과를 주고 가설을 만들어보게 했습니다. 그리고 서로 다른 모델들이 똑같은 답을 내놓는지(유사성)를 분석해 AI가 정말 새롭고 다양한 아이디어를 내는지 측정했습니다.
  • 핵심 결과: 분석 결과, 모델들이 서로 매우 비슷한 답안만 생성한다는 사실이 밝혀졌습니다. 구체적으로 모델 간 출력 유사도가 0.57~0.91로 매우 높게 나타나, AI들이 다양한 발견보다는 정해진 틀에 맞는 답만 반복하고 있음을 보여주었습니다.

[10] renee-jia/scholar-loop (github, 2026) · 원문

  • 이 논문이 푼 문제: 이 연구는 문헌 조사, 실험, 자기 비판, 논문 작성을 자동으로 수행하는 자율적인 AI 과학자를 만드는 문제를 다룹니다. 이는 과학적 발견 과정을 자동화하여 연구 효율을 높이는 것이 중요하기 때문입니다.
  • 방법: 여러 AI 에이전트가 협력하여 문헌과 실험을 반복하는 순환 구조를 만들었습니다. 보상 해킹과 허위 정보 생성을 막기 위해 결정론적 안전장치를 두는 방식을 사용했습니다.
  • 핵심 결과: 이 시스템이 문헌, 실험, 비판, 작성 과정을 자동으로 수행할 수 있음을 보였습니다. 구체적인 수치나 표는 제공되지 않았습니다.

[11] Towards a Medical AI Scientist (arxiv, 2026) · 원문

  • 이 논문이 푼 문제: 이 논문은 인공지능이 스스로 의학 연구 아이디어를 내고, 실험을 설계하며, 논문을 쓸 수 있는 '의학 AI 과학자' 시스템을 만드는 문제를 다룹니다. 이는 기존 상용 모델보다 더 창의적이고 실현 가능한 연구를 자동으로 수행할 수 있는지 확인하는 것이 중요합니다.
  • 방법: 저자들은 문헌을 기반으로 새로운 아이디어를 내거나 특정 과제를 탐색하는 방식으로 AI 시스템을 구성했습니다. 이 시스템은 아이디어를 생성하고 실제로 구현 가능한 코드를 작성하며, 최종적으로 학술 논문 형식의 결과물을 만들어내는 과정을 자동화합니다.
  • 핵심 결과: 제안된 시스템은 기존 상용 모델(Gemini, GPT-5)보다 아이디어의 창의성과 윤리성, 구현 완성도 면에서 더 높은 점수를 기록했습니다. 또한 이 시스템이 작성한 논문은 실제 학술 회의(MICCAI 등)에 제출된 논문과 비슷하거나 더 높은 수준의 평가를 받았습니다.