https://arxiv.org/abs/2608.09867
2026.8.10
[Stealing Reasoning Traces from Proprietary LLM APIs]
이 보고서는 현대 대규모 언어 모델(LLM)이 지적 재산 보호를 위해 암호화하여 숨겨둔 내부 추론 과정(chain-of-thought)을 외부로 추출해낼 수 있는 심각한 보안 취약점을 다룹니다. 연구진은 동일한 제공업체 내에서 서로 다른 모델 간의 암호화 블록 호환성을 악용하여, 보안이 강력한 최상위 모델의 숨겨진 사고 과정을 보안이 허술한 하위 모델을 통해 평문으로 복구하는 디코딩 탈옥 기법을 증명하였습니다. 이러한 취약점은 경쟁 모델을 학습시키기 위한 모델 증류 공격뿐만 아니라, 암호화된 데이터 속에 숨겨진 개인정보 및 자격 증명 유출, 그리고 모델의 최종 답변에는 나타나지 않는 유해 정보 노출 등 광범위한 위협을 초래합니다. 결과적으로 이 논문은 클라이언트 측에 저장되는 암호화된 추론 블록이 완벽한 프라이버시를 보장하지 못함을 경고하며, 이를 해결하기 위한 암호화 알고리즘의 개선과 시스템적 방어 체계 구축을 촉구하고 있습니다.

그림 1:Anthropic, OpenAI 및 Google API에서 추론 추적 디코딩.
위: 두 API 호출에서 추론 추적 추출. Opus 4.8 요청(왼쪽 위)은 서명된 사고 블록과 사고 요약을 반환합니다. Opus 4.8에서 사고 서명 만 Haiku 모델로 전송하고 <thinking-copy> 토큰 으로 자체 추론을 출력하도록 요청하면 Haiku는 Opus 4.8의 숨겨진 추론을 텍스트로 변환합니다(오른쪽 위).
아래: 추출된 추적은 생성된 사고 토큰 수와 밀접하게 관련되어 있습니다. 각 모델을 120개의 Codeforces 프로그래밍 문제에서 평가하고 API에서 보고한 소스 모델이 생성한 사고 토큰 수를 기록했습니다.엑스-축). 그런 다음 서명으로부터 추론 추적을 재구성하고, 이를 암호화된 추론을 생성한 동일한 모델에 입력 메시지로 전달한 후, API에서 보고된 토큰 수를 측정합니다.와이-중심선).


그림 2:세션 내 및 세션 간 호환성을 활용하는 생각 주입 방식. 사용 가능한 생각 주입 방식은 제공자와 정확한 모델에 따라 다릅니다. 현재 턴 주입은 생각을 현재 보조 턴에 배치하여 모델이 해당 턴에서 바로 가시적인 답변을 이어가도록 합니다. 2026년 7월 기준으로, 테스트한 모든 GPT 및 Gemini 모델과 Claude 4.5 버전에서 이 방식이 허용됩니다. 또한 Sonnet 4.5, Haiku 4.5 및 모든 Gemini 모델은 보조 턴의 가시적인 출력에 미리 입력하는 것을 허용합니다. 과거 턴 주입은 이전 추론 블록을 생략하지 않는 모델(예: Sonnet 5, Opus 4.8, Fable 5 및 GPT-5.6 시리즈)에서만 사용할 수 있습니다.

그림 3:Kimi K3의 추론 과정을 미리 채우면 표시되는 응답 스타일이 바뀝니다. 이 예시에서는 Claude가 생성한 추론 토큰 중 일부를 Kimi K3의 추론 과정에 미리 채우면 최종 출력이 Claude의 출력과 매우 유사해지는 것을 확인할 수 있습니다. 모든 경우에 표시되는 응답은 자유 형식 생성이며, 그 자체는 미리 채워지지 않습니다. 이 현상에 대한 정량적 분석은 부록 B 에서 확인할 수 있습니다 .














'07.AI > 9. AI Safety' 카테고리의 다른 글
| AI 안전성 - SOTA 정렬 평가(alignment assessments) 와 신뢰성 불일치 (0) | 2026.08.07 |
|---|---|
| AI 안전성 - AISI, 사건 보고서: 19건의 미승인된 에이전트 행위 (0) | 2026.08.07 |
| AI 안전성 - 환각(Hallucination)에 대한 통일된 정의 (0) | 2026.08.06 |
| AI 안전성 - LLM 제어 통합 (0) | 2026.08.06 |
| AI 안전성 - Anthropic, 클로드(Claude) 사이버 보안 평가 사고 (0) | 2026.08.04 |


