반응형

https://arxiv.org/pdf/2608.27448

2026.8.27
[TTPO: Test-Time Policy Optimization]

이 논문은 정답지가 없는 상황에서도 대규모 언어 모델(LLM)의 수학적 추론 능력을 스스로 향상시킬 수 있는 테스트 시간 정책 최적화(TTPO) 기술을 제안합니다. 기존의 방식들은 정답 라벨에 의존하거나 오답이 섞인 다수결 결과에 취약하다는 한계가 있었으나, TTPO는 다수결로 얻은 의사 라벨(Pseudo-label)의 오류를 수용할 수 있는 비대칭적 구조를 통해 이 문제를 해결합니다. 구체적으로, 다수 의견에 부합하는 답변은 온라인 자기 증류(OPSD)를 통해 모델의 사고 방식을 내면화하고, 다수 의견과 다른 답변은 그룹 강화학습(GRPO)을 적용해 효과적으로 배제합니다. 또한, 이미 학습된 부분은 제외하고 확신에 찬 오류만을 골라 수정하는 토큰 수준의 선택적 업데이트를 통해 학습의 정밀도를 높였습니다. 그 결과, TTPO는 정답 라벨 없이도 최고 수준의 수학 경시 대회 문제들에서 모델의 성능을 비약적으로 높였으며, 학습하지 않은 문제에서도 추론 능력이 향상되는 강력한 일반화 성능을 입증했습니다.

 

728x90
반응형
Posted by Mr. Slumber
,