https://arxiv.org/abs/2608.13331
2026.8.13
[Training AI Scientists to Replicate Research]
이 논문은 인공지능이 스스로 과학 논문의 실험 결과(그림)를 재현할 수 있도록 훈련하는 'Faraday'라는 AI Scientist 에이전트와 그 학습 환경인 'Replica'를 소개합니다. 연구진은 1990년부터 2026년까지의 논문들을 바탕으로 자동 생성된 루브릭 기반의 판별기를 구축하여, 정답이 명확하지 않은 과학 연구 영역에서도 정밀한 보상 신호를 제공하는 혁신적인 학습법을 제시했습니다. 270억 개의 파라미터를 가진 Faraday는 더 거대한 모델들을 도구로 활용하는 'CAT(Coding Agent as a Tool)' 패러다임을 통해 기존의 최첨단 모델들보다 더 뛰어난 과학적 탐구 역량과 논리적 엄밀함을 보여주었습니다. 결과적으로 이 기술은 인공지능이 단순한 코딩 보조를 넘어, 장기적인 과학적 혁신을 주도할 수 있는 동료 연구자로 진화할 수 있음을 증명하고 있습니다.

그림 1 :우리는 Replica에서 Faraday를 학습시킵니다. (1) 우리는 큐레이팅을 통해 Replica 작업 공간을 구성합니다.1001990년부터 2026년 사이에 발표된 ML 및 AI-for-science 논문을 대상으로 연구를 진행했습니다. 각 논문에 대해 Gemini 2.5 Pro를 사용하여 개별 결과 그림을 삭제함으로써 일련의 재현 작업을 생성했습니다. 삭제된 그림 하나당 하나의 작업이 생성됩니다. (2) Codex를 코드 작성 도구로 활용하여 에이전트 Faraday를 통해 이러한 작업에 대한 롤아웃을 생성했습니다. 에이전트에는 작업 프롬프트, 삭제된 논문 PDF, Codex 바이너리, 다양한 유용한 연구 라이브러리, H200 GPU의 1/7 MIG 슬라이스, 그리고 인터넷 접속이 포함된 containerd 컨테이너가 제공됩니다. (3) 각 작업에 대해 메타 루브릭을 사용하여 Claude Opus 4.7로 작업별 채점 루브릭을 생성했습니다. (4) 생성된 그림, 재현 코드베이스, 에이전트 롤아웃, 그리고 원 논문의 "골드 플롯"이 포함된 롤아웃 컨테이너에 접근할 수 있는 Codex 기반 평가 도구를 사용하여 각 롤아웃을 해당 작업의 루브릭에 따라 평가했습니다. 심판은 전체 보상과 턴별 크레딧 할당 가중치를 제공하며, 이는 수정된 GRPO 버전을 사용하여 패러데이 에이전트를 훈련하는 데 사용됩니다.

그림 3 : 본 논문에서 개발한 루브릭 기반 평가 시스템은 기준 평가 시스템보다 높은 인간 일치도와 낮은 노이즈를 달성합니다. 각 작업에 대한 루브릭 기반 프롬프트를, 작업 간에 변하지 않는 더 간단한 기준 프롬프트와 비교합니다. Codex GPT-5.5는 이 프롬프트를 사용하여 Claude, Codex, Faraday에서 샘플링된 롤아웃을 평가합니다. (왼쪽) 루브릭 평가 시스템과 기준 평가 시스템 간의 불일치가 최대화되는 롤아웃을 가진 작업을 선택합니다. 전문가들에게 좋은 재현이라고 생각하는 직관적인 기준에 따라 동일한 롤아웃의 순위를 매기도록 요청합니다. 일치도는 Kendall 척도를 사용하여 측정합니다.
















'07.AI > 5. AI 자율성' 카테고리의 다른 글
| AI 해석력 - 인공지능 시대 수학의 가치 재정립 (0) | 2026.08.21 |
|---|---|
| AI 해석력 - AI 스케일링(Scaling) 법칙 - 작은 모델로 큰 미래를 예측 (0) | 2026.08.21 |
| 에이전트 AI - GCP, 지식 공유 포멧 : OKF (Open Knowledge Format) (0) | 2026.08.19 |
| 에이전트 AI - 앤스로픽(Anthropic) 공식 강의: 에이전트 스킬 소개 (0) | 2026.08.17 |
| AI 해석력 - Anthropic, 텍스트 워터마킹:EU AI Act 투명성 기술적 조치 (0) | 2026.08.12 |


