반응형

https://arxiv.org/pdf/2607.23802

https://github.com/wangqinsi1/RLSVR/tree/SpyRL

(이 저장소에는 Vision-Zero (ICLR 2026) 도 포함되어 있습니다.)

2026.7.31
[From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement]

이 논문은 수학이나 코딩처럼 정답이 명확한 분야를 넘어, 요약이나 창의적 글쓰기 같은 개방형 작업에서도 대규모 강화학습이 가능하도록 돕는 RLSVR(자기 검증 가능 보상을 통한 강화학습) 패러다임을 제안합니다. 핵심은 외부 평가자나 인간의 피드백 대신, 작업 변환 기술을 통해 데이터 자체에서 검증 가능한 보상 신호를 스스로 만들어내는 자기 지도 학습 원리를 강화학습에 도입한 것입니다. 연구진은 이를 구체화한 SpyRL 프레임워크를 통해, 정보가 부족한 '스파이' 모델을 찾아내는 사회적 추론 게임 형태로 학습 환경을 재설계함으로써 출력물의 품질을 객관적으로 측정할 수 있는 수치로 변환했습니다. 실험 결과, 이 방식은 정답이 없는 주관적 과제에서 기존 방식보다 월등한 성능 향상을 보였으며, 결과적으로 검증 가능성이 작업의 본질적 특성이 아닌 환경 설계를 통해 충분히 부여될 수 있음을 증명했습니다. 무엇보다 이 연구는 외부 도움 없이 모델이 스스로의 역량을 확장할 수 있는 확장 가능한 자기 개선의 새로운 경로를 제시했다는 점에서 큰 의의가 있습니다.

 

검증 가능한 보상을 사용하는 강화 학습(RLVR)은 대규모 최적화를 가능하게 함으로써 추론 중심의 대규모 언어 모델(LLM) 분야에서 최근 발전을 이끌어 왔습니다. 그러나 RLVR의 적용 범위는 정확성을 결정론적으로 검증할 수 있는 수학이나 코딩과 같은 영역에 국한되어 있습니다. 반면, 개방형 과제는 종종 인간의 선호도, 보상 모델 또는 LLM 기반 평가자에 의존하기 때문에 평가 편향, 평가자 능력의 병목 현상, 그리고 추가적인 추론 비용이 발생합니다.

 

데이터 자체에서 지도 학습을 유도하기 위해 사전 과제를 구성하는 자기 지도 학습 원리를 활용하여, 본 논문에서는 RLVR을 개방형 과제로 확장하기 위한 과제 변환 기반 훈련 패러다임인 자기 검증 가능한 보상을 사용하는 강화 학습(RLSVR)을 제안합니다. RLSVR은 개방형 과제를 내부 규칙과 상호 작용 결과가 자동으로 보상 신호를 생성하는 검증 가능한 프록시 환경으로 변환합니다.

 

본 논문에서는 사회적 추리 게임인 "누가 스파이인가?"에서 영감을 받은 자기 플레이 강화 학습 방법인 SpyRL을 통해 RLSVR을 구현합니다. 에이전트들은 비대칭 정보를 받고, 동일한 목표 작업을 완료한 후, 지정된 스파이를 식별하기 위해 투표합니다. 스파이의 신원이 미리 정해져 있기 때문에 투표 결과는 완전히 검증 가능한 보상을 제공하며, 성공적인 식별은 결과물의 품질과 밀접한 관련이 있습니다. 텍스트 요약, 창의적 글쓰기, 수학적 추론에 대한 실험 결과, SpyRL은 검증 불가능한 작업에서 기존의 자기 개선 방법보다 우수한 성능을 보였으며, 검증 가능한 추론 작업에서도 일관된 향상을 보여주었습니다.

 

이러한 결과는 작업 변환을 통해 확장 가능한 RLVR 기반 자기 개선을 본질적으로 검증 가능한 영역을 넘어 확장할 수 있음을 입증합니다.

 

 

728x90
반응형
Posted by Mr. Slumber
,