반응형
(개념) LLM의 토크나이저(tokenizer)에서 생성된 비정상적인 토큰
- 의미를 갖지 않거나 훈련 데이터·토크나이저 설계의 오류로 인해 생성된 이상 토큰
2025.9.19
[What GPT-oss Leaks AboutOpenAI's Training Data]
이 글은 오픈소스 모델의 가중치를 분석하여 OpenAI 학습 데이터의 비밀을 파헤치는 과정을 심도 있게 다룹니다. 저자는 글리치 토큰(Glitch Token)의 임베딩 값을 추적함으로써, 모델이 공식적인 데이터셋 설명에는 누락된 성인용 웹사이트 및 도박 스팸 문구 등을 대량으로 학습했음을 증명합니다. 특히 특정 토큰이 모델에 입력될 때 발생하는 환각 현상과 비정상적인 반응을 실험하며, 이를 통해 공개되지 않은 최신 모델(GPT-5 등)의 데이터 구성을 추론하는 기법을 제시합니다. 궁극적으로 이 분석은 오픈 가중치 모델이 기업의 기밀을 노출하는 새로운 보안 취약점이 될 수 있음을 경고하며 데이터 정제 방식의 개선을 촉구합니다.

(특징)
- 의미 결여: 실제 단어가 아니라 랜덤 문자열 형태
- 모델 출력 장애: 잘못된 프롬프트 처리, 의미 없는 반복, 예상치 못한 중단
- 임베딩 군집화: 고유한 임베딩 클러스터를 형성해 탐지가 가능
(발생원인)
- 훈련 데이터 노이즈 및 불완전성
- 비정상적 문서·코드 주입이나 특수 문자 처리 오류
- 토크나이저 설계 결함
- 서브워드 분할 과정에서 예상치 못한 바이트 시퀀스 발생
- 모델 보안 공격 가능성
- 악의적 공격자가 특정 glitch 토큰을 삽입해 모델 동작 왜곡
(주요연구)
Yuxi Li 등은 182,517개 토큰을 분석해 glitch 토큰을 카테고리별로 분류하고, LLM의 증상 유형을 정리했다.
- 카테고리 예시:
- 완전 무작위 문자열
- 반복적 패턴 기반 토큰
- 희소한 특수문자 조합
- 증상:
- 출력 중단 또는 프롬프트 드리프트
- 비문 생성
- 악성 코드 주입 가능성
|
https://en.wikipedia.org/wiki/Glitch_token
https://news.hada.io/topic?id=23479














728x90
반응형
'07.AI > 12. AI 모델' 카테고리의 다른 글
| LLM - Open AI, GPT-OSS - gpt-oss-safeguard (0) | 2025.11.04 |
|---|---|
| LLM - Open AI, GPT-OSS (5) | 2025.10.08 |
| LLM - 오픈 웨이트(Open Weight) - 메타 (Meta) CWM (0) | 2025.10.08 |
| LLM - Open AI, GPT-5 (1) | 2025.09.08 |
| LMM - 멀티모달 AI (LMM, Large MultiModal Model) (1) | 2025.08.01 |


