반응형
https://arxiv.org/pdf/2608.23552
2026.8.24
[Prime Agent: A Self-Improving RLM Harness]
이 기술 보고서는 복잡하고 장기적인 과제를 수행할 때 발생하는 모델의 한계를 극복하기 위해 설계된 오픈 소스 하네스인 Prime Agent를 소개합니다. Prime Agent는 단순히 언어 모델의 지능에 의존하는 대신, 지속적인 실행 환경(REPL)과 계층적 정보 관리 체계(L0-L3)를 결합하여 모델이 외부 연산과 기억 장치를 자유롭게 활용하도록 돕습니다. 특히 재귀적 언어 모델(RLM) 추상화를 통해 여러 보조 에이전트를 생성하고 직접 통신하게 함으로써, 고정된 워크플로우를 넘어 모델 스스로 전략을 구축하는 검증 시간 컴퓨팅(test-time compute)의 극대화를 꾀합니다. 이러한 구조적 혁신은 ARC-AGI-3와 같은 난도 높은 벤치마크에서 인간 수준의 성능인 95.5%의 정확도를 기록하게 하며, 코딩 및 자율 연구 분야에서 기존 하네스의 성능을 뛰어넘는 강력한 효율성을 입증합니다. 본 보고서는 궁극적으로 모델이 하네스의 제약 때문에 실패하는 것을 방지하고, 가용한 모든 컴퓨팅 자원을 활용해 모델의 진정한 잠재력을 끌어내는 것을 목적으로 합니다.

1. 핵심 아키텍처: “LLM + 외부 상태 계층”으로의 전환
논문은 에이전트 상태를 네 층으로 제시합니다.[2]
| 계층 | 상태 | 의미 |
| L0 | 모델 가중치 | 사전학습 지식·추론 능력 |
| L1 | 활성 컨텍스트 | 현재 대화·작업 창 |
| L2 | 지속 REPL·재귀 서브에이전트 | 코드를 통한 정보 처리 및 시험시 추론(test-time compute) |
| L3 | 디스크 기반 이력·메모리·스킬 | 세션을 넘는 장기 상태·재사용 자산 |
이는 에이전트를 단발성 프롬프트 시스템이 아니라, 주소 지정 가능한 외부 상태를 읽고·변환하고·기록하는 실행 시스템으로 재정의합니다. 특히 다음 세 가지가 결합됩니다.
- Programmatic context management 긴 입력을 단순히 컨텍스트에 넣는 대신, 파일·REPL을 통해 검색·요약·분할·재검증하게 합니다.
- Continual Harness 작업 이력에서 프롬프트 보충정보, 메모리, 스킬, 서브에이전트 명세를 작은 단위로 수정·버전관리·롤백합니다. 기본 시스템 프롬프트는 불변으로 둡니다.
- 재귀적 병렬 실행 부모 에이전트가 지속 REPL 안에서 서브에이전트를 생성하고, 자식 결과는 명시적 메시지나 파일을 통해 회수합니다. 비용은 부모 작업에 귀속해 전체 자원 사용량을 추적합니다.
2. 이 논문이 보여주는 연구동향 5가지
| 동향 | 기존 초점 | 이 논문이 강화한 방향 | 판단 |
| ① 컨텍스트 윈도우 → 외부 상태 관리 | 긴 컨텍스트 길이와 RAG | 파일·REPL·메모리·이력의 능동적 조작 | 가장 중요한 전환 |
| ② 단일 에이전트 → 지속적 재귀 에이전트 | 한 세션 내 tool calling | daemon-backed 세션, 재개, 자식 에이전트, 스케줄 | 장기 과업에 필수 |
| ③ 고정 워크플로 → 모델 주도 전략 구성 | 개발자가 설계한 DAG/Role | 모델이 실행 중 프로그램·서브에이전트·피드백루프 구성 | 유연성 증가, 통제 난도 증가 |
| ④ 정적 벤치마크 → test-time scaling 평가 | 단일 점수·고정 토큰 | 시간·비용·토큰 대비 성능곡선 및 plateau 측정 | 평가방법론의 핵심 쟁점 |
| ⑤ 대화 로그 → 재사용 가능한 trajectory 자산 | 대화 종료 후 소멸 | 작업 이력에서 스킬·메모리·프롬프트를 정제 | 온라인 학습·거버넌스와 연결 |
특히 이 논문은 “에이전트 성능”을 모델 × 하니스 × 도구환경 × 운영예산 × 검증기(verifier)의 결합 성능으로 봐야 한다는 방향을 강하게 제시합니다.
3. 실험 결과의 의미와 해석 유의점
논문은 ARC-AGI-3, 장문맥 과업, EmulatorBench, GPU kernel 생성, nanoGPT speedrun, Factorio 등을 사용합니다.[2]
- ARC-AGI-3 RHAE Best@1이 30% → 95.5%로 상승했다고 보고합니다.
- 다만 저자들도 Claude Code·Codex의 자체 실행 결과가 각 제공사의 공개 결과보다 낮았다고 명시합니다. 즉, ARC 수치는 하니스의 순수 인과효과를 분리한 결과라기보다, 외부 공식 수치와의 위치 비교 성격이 있습니다.
- 장문맥 비교표는 Prime Agent가 여러 과업에서 경쟁력이 있다고 보고하지만, 표에 신뢰구간·유의성 검정이 제공되지 않는다고 스스로 명시합니다.
- nanoGPT speedrun에서는 최종 기록 차이가 하니스 선택보다 실험 잡음에 더 가까웠으나, Prime Agent 환경의 모델이 REPL 기반으로 더 많은 사전 실험·프로브를 수행하는 행동 차이를 보였습니다.
- Factorio 7일 실행에서 Sonnet 5가 2,340만 출력 토큰으로 24개 기술을 완료했지만, 비가역적 행동을 잘 다루지 못한 사례도 제시합니다.
종합 판단: 이 논문의 신뢰할 수 있는 기여는 “하니스 설계가 에이전트의 행동 공간과 장기 과업 지속성에 실질적 영향을 준다”는 실증적 문제제기입니다. 반면 “95.5%” 같은 절대 성능 주장은 독립 재현, 동일 모델·동일 예산·동일 verifier·복수 seed 조건에서의 비교가 선행되어야 합니다.
4. [보완 필요] 연구·평가의 공백
| 우선순위 | 보완 필요 사항 | 이유 |
| 높음 | 동일 모델·동일 프롬프트·동일 예산·동일 verifier의 다중 seed 비교 | 모델과 하니스 효과를 분리해야 함 |
| 높음 | 비용·지연시간·전력·실패복구율의 통합 지표 | 장기 에이전트는 점수만으로 운영성이 판단되지 않음 |
| 높음 | 메모리 수정의 정확성·오염·망각 평가 | 지속 메모리는 성능 향상과 오류 전파를 동시에 야기 |
| 높음 | 권한·격리·감사 통제 | 공개 구현체도 모델 생성 Python·shell 명령이 사용자 권한으로 실행되며, 프로세스 경계는 보안 샌드박스가 아니라고 명시합니다.[3] |
| 중간 | 서브에이전트의 중복 작업·조정비용·책임성 측정 | 병렬화가 항상 순효익을 보장하지 않음 |
| 중간 | 작업 이력→스킬 정제의 품질 게이트 | 잘못된 실행 이력이 장기적으로 재사용될 위험 |
| 후순위 | 벤치마크 외 실제 업무 성과 검증 | 코드·게임 과업에서 공공행정·감리·정책문서 업무로의 일반화는 별도 검증 필요 |
















728x90
반응형
'07.AI > 5. AI 자율성' 카테고리의 다른 글
| 에이전트 AI - 재귀적 자기 개선(RSI) 자율성 5단계 개요 및 대표 시스템 (0) | 2026.09.20 |
|---|---|
| 에이전트 AI - IBM Research, ALTK-Evolve: 에이전트 일관성 격차 프레임워크 (0) | 2026.09.20 |
| 에이전트 AI - Frontis-MA1: 머신러닝 엔지니어링(MLE) AI4AI 모델 훈련 (0) | 2026.09.20 |
| 에이전트 AI - Google Cloud AI Research, ScientistOne: 증거의 연쇄 (Chain-of-Evidence) (0) | 2026.09.20 |
| 에이전트 AI - IBM Research, ALTK-Evolve: 에이전트 일관성 격차 보완 (0) | 2026.09.20 |


