반응형

https://arxiv.org/pdf/2511.00617

2026.3.12
[Belief Dynamics Reveal the Dual Nature of In-Context Learning and Activation Steering]

이 연구는 대규모 언어 모델(LLM)을 제어하는 두 가지 핵심 방식인 인-컨텍스트 학습(ICL)과 활성화 스티어링(Activation Steering)을 베이지안 관점에서 하나의 통합된 이론으로 설명합니다. 저자들은 모델의 행동 변화를 잠재 개념에 대한 모델의 확신(Belief)이 업데이트되는 과정으로 정의하며, 프롬프트를 통한 학습은 증거의 축적으로, 내부 활성화 개입은 사전 확률의 수정으로 해석합니다. 이러한 정교한 모델링을 통해 많은 수의 예시가 주어질 때 나타나는 S자형(Sigmoidal) 학습 곡선과 두 제어 방식이 결합하여 발생하는 상가적 효과를 정확하게 예측할 수 있음을 입증합니다. 결과적으로 이 논문은 서로 달라 보이는 모델 제어 기법들이 실제로는 동일한 확률적 원리를 공유하고 있음을 밝혀내어, AI의 행동을 더 체계적이고 과학적으로 조절할 수 있는 이론적 토대를 제공합니다.

 

728x90
반응형
Posted by Mr. Slumber
,