반응형

https://arxiv.org/pdf/2609.11873

2026.9.15
[The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement]

이 논문은 인공지능이 스스로의 성능을 지속적으로 고도화하는 진정한 재귀적 자기 개선(RSI)의 개념과 발전 단계를 탐구합니다. 저자들은 기존 언어 모델의 한계를 분석한 후, 실행 및 전략의 자율성부터 환경 적응과 재귀적 메타 개선에 이르는 구체적인 기술 로드맵을 제시합니다. 특히 과학적 발견이나 소프트웨어 공학 등 다양한 실전 분야에서 RSI가 어떻게 적용될 수 있는지 검토하며, 이론과 실제 시스템 사이의 격차를 줄이는 데 집중합니다. 궁극적으로 이 연구는 인간의 개입 없이도 AI가 자신의 지능을 스스로 진화시키는 인류가 만든 마지막 AI로 향하는 여정과 그 과정에서 직면할 핵심 도전 과제들을 체계화하고 있습니다.

 

 

그림 1 :RSI 자율성 5단계 개요 및 대표 시스템. 자율성은 규정된 개선 사항 실행(L1)에서 시작하여 개선 전략 선택(L2), 미래 학습 경험 습득(L3), 배포 및 환경 피드백을 통한 적응(L4), 그리고 궁극적으로 후속 개선을 관리하는 메커니즘 개선(L5)으로 점진적으로 확장됩니다. 시스템 세부 정보는 부록 B: 산업 현황을 참조하십시오 .

 

그림 2 :5단계 반복 패턴. 회색 점선 프레임은 사람이 제어하는 ​​구성 요소를 나타냅니다. 녹색 점선 프레임은 RSI 루프 내의 구성 요소를 나타냅니다. 주황색 ​​윤곽선은 각 단계에서 새롭게 내재화된 구성 요소를 강조합니다. 확장되는 녹색 프레임은 AI가 개선 프로세스의 더 많은 부분을 점진적으로 자동화하고 있음을 보여줍니다.

 

그림 3 :다양한 도메인 역량 궤적 및 RSI 확장 예시. 각 선은 HCI 분야의 연간 도메인 한계를 나타내며, 0은 벤치마크 도입 연도의 한계이고 100은 만점입니다. 점선으로 표시된 사이버 보안 영역은 Cybench 하위 집합 또는 pass@1 집계의 변화를 나타냅니다. 2026년 이후 영역은 RSI를 활용한 도메인 확장을 보여줍니다.

 

1. 핵심 프레임: B0–L5 자율성 단계

단계 AI가 자율적으로 담당하는 범위 대표적 변화 대상 RSI 관점의 의미
B0 단일 작업 안에서 답안·추론 개선 현재 출력/컨텍스트 영속성이 없으므로 RSI 아님
L1 정해진 개선안의 실행 데이터 라벨, 프롬프트, 정책 등 인간이 목표·방법·평가기준을 정함
L2 실패 원인 진단 및 개선전략 선택 도구, 프롬프트, 하네스, 모델 구성 AI어떻게 개선할지결정
L3 향후 학습경험·커리큘럼 획득 과제, 합성데이터, 탐색환경 AI무엇을 더 배울지결정
L4 운영환경 피드백에 따른 지속 적응 메모리, 스킬, 도구, 코드, 하네스, 일부 가중치 배포 경험이 다음 작업의 동작을 바꿈
L5 개선기제 자체의 수정·상속 improver, evaluator, 연구정책, successor generator 다음 라운드의 개선 능력을 높임

논문은 L5만이 ‘genuine RSI’에 가장 가까운 상태라고 봅니다. , L5라 하더라도 개선기제의 변경 사실만으로는 부족하며, 그 변경이 이후 라운드에서 더 나은 개선안을 발견·검증·채택하게 했음을 장기적으로 증명해야 합니다.

 

2. 연구동향: “모델 성능 향상에서개선 루프의 운영체계화

① Test-time self-refinement → Persistent self-evolution

초기 흐름은 reflection, self-critique, tree search, multi-agent debate처럼 한 작업 내 추론 품질을 높이는 B0 방식이 중심이었습니다.

최근은 다음과 같이 이동합니다.

  • 실패 궤적을 재사용 가능한 스킬·규칙·도구로 증류
  • 운영 로그를 기반으로 agent harness, retrieval, prompt, tool interface 수정
  • 과거 성능·실패 데이터를 바탕으로 이후 훈련과제·환경을 자동 생성
  • 연구정책 또는 평가기제를 다음 개선 라운드로 상속

, 관심 대상이이번 답을 더 잘 만드는가에서 이번 경험이 이후 시스템의 지속 능력으로 전환되는가로 이동했습니다.[1]

② LLM 자체보다 agent system / harness가 주요 개선 대상

이 논문에서 인상적인 흐름은 모델 가중치 업데이트보다 다음 자산의 진화입니다.

  • 장기 기억(memory)
  • 스킬 라이브러리
  • 실행 가능한 도구(code tools)
  • 컨텍스트 구성 정책
  • agent harness
  • 평가·검증 규칙
  • 실험·연구 정책

이는 대규모 재학습보다 낮은 비용으로 반복 개선할 수 있고, 운영 중 관찰되는 오류를 빠르게 반영할 수 있기 때문입니다. 하지만 축적된 스킬·메모리는 검색 저하, 잘못된 재사용, 오래된 규칙의 고착이라는 library drift 위험을 동반합니다.[1]

③ L3/L4가 실무적 최전선, L5는 아직 실증 부족

논문 기준으로 실질적 진전은 다음 범위에 집중됩니다.

  • L2: 오류 진단 후 prompt/tool/harness를 수정
  • L3: 현재 약점을 기준으로 다음 학습과제·경험을 선택
  • L4: 운영 경험을 기억·스킬·도구·코드로 영속화하고 이후 작업에 재사용

반면 L5는 아직 제한적 사례 중심입니다. 예를 들어 A-Evolve-Training은 실험 결과를 연구정책과 discovery log로 축적하고, meta-agent가 이를 다음 post-training 의사결정에 반영합니다. 그러나 논문도개선기제의 상속그 상속이 장기적 개선 효율을 높였다는 증명을 구분해야 한다고 지적합니다.

 

3. 논문의 HCI 분석이 시사하는 투자 우선순위

저자들은 서로 다른 벤치마크 점수를 직접 비교하지 않고, 각 벤치마크의 초기 frontier 0, 만점을 100으로 정규화한 HCI(Headroom-Closed Index)를 제시합니다.

2026년 기준 논문 내 추정치는 다음과 같습니다.

역량 영역 HCI 해석
고급 수학 86.4 비교적 높은 성숙도
대학원 수준 과학 85.8 비교적 높은 성숙도
일반 지식 77.2 성숙 단계 진입
법률 추론 64.5 여전히 개선 여지
멀티모달 추론 62.2 여전히 개선 여지
소프트웨어 엔지니어링 52.6 장기·상태기반 실행 병목
Search/Terminal agent 56.8 환경 상호작용 병목
Tool-use agent 39.9 가장 큰 미해결 영역

따라서 RSI의 실질적 가치는 정적 QA보다 도구 사용, 장기 워크플로우, 상태 추적, 오류 복구, 운영환경 적응에서 먼저 나타날 가능성이 큽니다.[1]

다만 [확인 필요: 방법론] HCI는 저자들이 이 논문에서 구성한 합성 지표입니다. 특히 벤치마크 프로토콜·태스크 세트·pass@k가 시점별로 동일하지 않을 수 있어, 절대 성능 비교 지표라기보다 연구 포트폴리오 우선순위를 설명하는 탐색적 지표로 해석하는 것이 타당합니다.

 

4. 진짜 RSI의 판정 기준: 성능이 아니라검증된 상속

이 논문이 제시하는 가장 유용한 판정 질문은 아래 5개입니다.

  1. 무엇이 영속적으로 변경되었는가? 메모리인지, 스킬인지, 도구인지, 하네스인지, 가중치인지 명확해야 합니다.
  1. 그 변경을 누가 결정했는가? 인간이 정한 절차를 AI가 실행한 것(L1)인지, AI가 진단과 전략을 선택한 것(L2 이상)인지 구분해야 합니다.
  1. 변경안이 독립적으로 검증되었는가? 개선 과정에 사용된 evaluator와 최종 승인 evaluator를 분리해야 합니다.
  1. 후속·미지 과제에서 전이 이득이 있었는가? 동일 벤치마크 반복 최적화가 아니라 hidden/fresh task에서 확인해야 합니다.
  1. 악화 시 되돌릴 수 있는가? 버전 이력, 승인 게이트, 롤백, 영향범위 관리가 필수입니다.

특히 논문은 동일 evaluator를 반복 조회하면 test leakage, reward hacking, cherry-picking이 발생할 수 있다고 경고합니다. 평가기 자체를 진화시키는 경우에는 epoch 내 평가기를 동결하고, 외부의 독립 ground-truth anchor로 교체 평가기를 검증해야 한다는 입장입니다.

 

5. 공공·기업 운영 AI에 주는 설계 시사점

[보완 필요: 운영통제] “자기개선을 곧바로 자동 배포로 연결하면 안 됨

공공·고위험 업무의 현실적 목표는 L5가 아니라 거버넌스가 결합된 L4입니다.

권장 구조는 다음과 같습니다.

textCopy

운영 로그·사용자 피드백·오류 사례

실패 원인 분류

개선 후보 생성

→ Sandbox / 회귀시험 / 독립 평가

승인위원회 또는 책임자 gate

버전 배포

모니터링·드리프트 탐지·롤백

통제 항목

통제영역 최소 요구사항
변경관리 변경 전·후 상태, 변경 사유, 근거 로그, 영향범위, 승인자 이력
검증독립성 개선용 평가와 승격용 평가 분리
데이터 품질 오류 데이터·편향된 사용자 피드백이 장기 메모리/스킬로 승격되지 않도록 admission test
재현성 모델·프롬프트·도구 버전, 실행환경, 평가셋, seed, 비용 기록
안전성 고위험 변경은 shadow mode → 제한 배포단계 확산
롤백 artifact 단위의 폐기·복원 및 영향 받은 후속 결과 재검토
책임성 목표·권한·접근범위·승인기준은 인간이 명시적으로 유지

논문의 표현대로 L4에서도 목표, 접근경계, 보호된 평가, 중요한 배포 권한은 외부 거버넌스가 보유해야 합니다.

 

6. 향후 연구과제 8개 중 실무적으로 중요한 4

  1. 교차 구성요소 원인진단 실패가 데이터·검색·도구·프롬프트·모델·평가기 중 어디에서 기인했는지 분리하는 문제입니다. 실제 운영에서는 가장 우선순위가 높습니다.
  1. 신뢰 가능한 경험 획득과 학습 신호정답 여부현재 모델에게 학습 가치가 있는 경험인가는 다릅니다. 경험의 정확성·난이도·다양성·전이효과를 분리 검증해야 합니다.
  1. 영속 자산 관리와 재사용 검증 축적된 메모리·스킬·도구가 실제로 호출되고, 올바르게 실행되며, 후속 과제 성능을 높이는지 각각 측정해야 합니다.
  1. 장기·총비용 기준 평가 성능 향상에 필요한 후보 생성, 평가, 인프라, 인간 검토, 재작업 비용까지 포함해 비교해야 합니다. “자동저비용을 의미하지는 않습니다.[1]

 

종합 평가

이 논문의 기여는 RSI를 과장된 AGI 서사에서 분리해, 변경 대상자율성상속검증거버넌스라는 감리 가능한 체계로 바꾼 데 있습니다.

다만 다음 한계도 분명합니다.

  • 산업 사례와 최신 preprint 인용 비중이 높아 독립 재현·동료심사 수준의 실증 근거는 고르지 않습니다.
  • HCI 기반 미래 확장 구간은 저자도 가상적(illustrative)이라고 밝힌 시나리오이며, 예측값으로 해석하면 안 됩니다.
  • “L5 달성보다, L4에서의 안전한 영속화·독립 평가·재현성 있는 롤백 체계가 현재 산업 적용의 핵심 과제입니다.

한 줄 결론:
RSI
의 경쟁력은 AI가 스스로 코드를 고치는 데 있지 않고, 운영 경험을 검증 가능한 개선자산으로 승격하고, 그 자산이 후속 개선 역량을 실제로 높였음을 독립적으로 증명하는 체계에 있습니다.[1]

 

728x90
반응형
Posted by Mr. Slumber
,