반응형

https://arxiv.org/pdf/2608.04003

https://github.com/Gen-Verse/PAST-Bench

2026.8.4
[PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents]

PAST-Bench는 인공지능 에이전트가 과거의 경험을 통해 스스로 성능을 높이는 재귀적 자기 개선(Recursive Self-Improvement) 역량을 체계적으로 측정하기 위해 고안된 벤치마크입니다. 이 도구는 에이전트가 이전 세션에서 습득한 기억(Memory), 절차 재사용(Procedural reuse), 정보 수집(Information gathering), 업데이트(Update)라는 네 가지 핵심 차원에서 정보를 얼마나 잘 보존하고 활용하는지 평가합니다. 연구진은 단순히 작업 성공률을 확인하는 데 그치지 않고, 대조군 설정(Matched controls)과 메커니즘 증거(Mechanism evidence) 분석을 통해 성과 향상이 실제 경험의 재사용 덕분인지 아니면 모델 자체의 기본 성능 덕분인지를 명확히 구분합니다. 또한 진단 결과를 바탕으로 에이전트 루프의 각 단계에 개입하여 성능과 신뢰성을 개선한 새로운 프레임워크인 Hermes+를 제안하며, 지속 가능한 학습을 목표로 하는 차세대 AI 에이전트 연구의 토대를 마련하였습니다.

 

재귀적 자기 개선은 에이전트가 축적된 경험을 더 나은 미래 행동으로 전환하는 것을 요구합니다. 개인 AI 에이전트는 세션 간에 선호도, 작업 이력, 도구 루틴 및 학습된 기술을 유지하기 때문에 이러한 능력을 연구하기 위한 구체적인 환경을 제공합니다. 그러나 저장된 경험이 실제로 시간이 지남에 따라 에이전트를 개선하는지 여부는 체계적으로 검증되지 않았습니다.

 

본 연구에서는 이 질문을 집중적으로 다루기 위해 설계된 벤치마크인 PAST-Bench를 소개합니다. 각 에이전트는 저장된 경험을 켜고 끄는 동일한 조건에서 새로운 세션 작업의 순차적인 시퀀스를 실행합니다.

 

이 벤치마크는 메모리, 절차 재사용, 정보 수집 및 업데이트에 걸쳐 26개의 시나리오와 204개의 에피소드로 구성됩니다. 우리는 후속 작업에서의 향상과 이러한 향상이 의도된 저장, 검색 및 업데이트 경로를 따르는지 여부를 모두 보고합니다. 7개의 기본 모델과 4개의 에이전트 프레임워크에서 향상은 실제로 존재하지만 기능별로 불균등합니다. 동일한 주요 향상을 ​​보이는 에이전트라도 의도된 경로에 대한 증거로 뒷받침되는지 여부는 현저하게 다를 수 있습니다.

 

이러한 결과를 바탕으로 에이전트 루프의 각 단계에 걸쳐 5가지 목표 개입을 추가하여 Hermes를 확장한 Hermes+를 개발했습니다. Hermes+는 경험 축적을 통한 평균 이득을 높이고 더 명확한 경로 증거를 제공하며, 특히 오래된 상태를 교체해야 하는 작업에서 가장 큰 개선 효과를 보입니다.

 

다만, 그 효과는 에이전트의 역량과 모델에 따라 달라집니다. PAST-Bench와 Hermes+는 함께 지속적인 에이전트가 경험을 축적하는 단계에서 이를 통해 체계적으로 개선해 나가는 과정을 연구하기 위한 평가 및 진단 기반을 제공합니다.

 

 

 

 

 

728x90
반응형
Posted by Mr. Slumber
,