https://www.philschmid.de/evocode-bench
2026.7.27
[Evaluating Agents Beyond the First Prompt]
이 글은 인공지능 코딩 에이전트의 성능을 단발성 작업이 아닌 실제 업무와 유사한 연속적인 상호작용 환경에서 평가하는 새로운 벤치마크인 EvoCode-Bench를 소개합니다. 해당 시스템은 개발 과정에서 요구사항이 계속해서 수정되거나 추가되는 상황을 모의하여, 에이전트가 이전의 결정 사항을 유지하면서도 새로운 기능을 결함 없이 통합할 수 있는지를 중점적으로 측정합니다. 분석 결과에 따르면, 최신 모델조차 작업이 반복될수록 과거에 완성한 기능을 망가뜨리는 회귀 오류(Regression)에 취약한 모습을 보이며 성능이 급격히 저하되는 한계를 드러냈습니다. 결과적으로 이 텍스트는 에이전트의 지속 가능한 개발 능력을 높이기 위해서는 단순한 지능을 넘어 체계적인 구조화와 문서화 관리가 필수적임을 강조하고 있습니다.
Single-Turn Eval (SWE-bench):
[Prompt] → [Agent works] → [Pass/Fail] → Container discarded
Multi-Turn Eval (EvoCode-Bench):
[Prompt 1] → [Agent works] → [Test 1] →
[Prompt 2] → [Agent works] → [Test 1+2] →
[Prompt 3] → [Agent works] → [Test 1+2+3] → ...
1. 저자 신뢰도
필립 슈미트는 현재 Google DeepMind에서 개발자 경험/개발자 관계(DevRel) 담당 Staff Engineer로, Google DeepMind의 AI 연구를 개발자들에게 전달하는 최초의 AI DevRel/DevX 팀을 구축하고 있으며, 그 이전에는 Hugging Face에서 Technical Lead로 AWS·Google Cloud·Azure 등 주요 클라우드 업체와의 전략적 파트너십을 이끈 인물이다.
2. 원 논문과의 수치 교차 검증
블로그가 소개한 EvoCode-Bench는 실제 존재하는 논문에 근거한다.
arXiv:2605.24110 "EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions" (2026년 5월 22일 게재, UniPat AI·베이징대·칭화대·홍콩대 공동 연구)을 (arXiv) 직접 확인해 블로그의 핵심 수치를 대조했는데, 다음과 같이 정확히 일치했다.
- 벤치마크 규모: 26개 과제, 227개 순차 라운드(과제당 5~15라운드), 5개 기술 영역 — 논문 본문과 동일
- 순위 역전 현상: Opus 4.6이 단일 라운드 점수는 가장 높지만(78.9%) 멀티턴에서는 3위(44.0%)로 떨어지고 Opus 4.7(54.0%), GPT-5.5(52.4%)에 뒤진다
— 논문의 실제 결과표(Opus-4.7 MT@4 54.0/SR 76.7, GPT-5.5 52.4/74.4, Opus-4.6 44.0/78.9)와 정확히 일치
- 라운드별 성능 저하: 라운드 1의 46.7%에서 라운드 5의 21.3%, 라운드 10의 7.7%로 급락
— 논문 본문의 "라운드 1의 46.7에서 라운드 3의 26.9, 라운드 5의 21.3, 라운드 10의 7.7로 하락"이라는 서술과 동일
숫자가 임의로 만들어진 것이 아니라 실제 논문의 표·본문과 하나하나 맞아떨어진다는 점에서, 이 글은 원자료를 왜곡·과장하지 않고 충실하게 전달한 것으로 판단된다.
3. 편향 가능성
저자가 Google DeepMind 소속이라 자사 모델에 유리한 서술을 했을 가능성을 의심할 수 있지만, 실제로는 리더보드에서 Gemini-3.1은 MT@4 13.7%로 13개 평가 대상 중 하위권에 속하고, Anthropic Opus 계열과 OpenAI GPT-5.5가 상위를 차지한다. 저자가 이를 그대로 소개했다는 점은 자사 편향보다는 벤치마크 결과를 있는 그대로 전달하려는 태도로 볼 수 있다.














'07.AI > 7. AI 벤치마크' 카테고리의 다른 글
| 에이전트 AI - 벤치마크 - PAST-Bench: 재귀적 자기개선(RSI) 기반 (0) | 2026.08.07 |
|---|---|
| 에이전트 AI - 벤치마크 - 누적되는 다중턴 코딩, EvoCode-Bench (0) | 2026.07.31 |
| 에이전트 AI - 벤치마크 - MCP 벤치마크, MCPToolBench++ (0) | 2026.07.19 |
| 성과측정 - AI 검증 및 평가 - LLM 검증 프레임워크 (0) | 2026.07.16 |
| 성과측정 - AI 검증 및 평가 - OpenAI, SWE-Bench Pro 문제 (0) | 2026.07.15 |


