반응형
https://arxiv.org/pdf/2512.21577
2026.6.12
[A Unified Definition of Hallucination: It’s The World Model, Stupid!]
이 자료는 거대언어모델(LLM)의 고질적인 문제인 환각(Hallucination) 현상을 내부 세계 모델의 부정확성으로 재정의하여 학술적으로 통합하려는 시도를 담고 있습니다. 저자들은 환각을 단순히 틀린 답을 내놓는 오류와 구분하며, 모델이 가정한 세계관이 실제 참조 세계 모델(Reference World Model) 및 명시된 충돌 해결 정책(Conflict Policy)과 어긋날 때 발생하는 현상이라고 설명합니다. 이러한 체계적 프레임워크는 요약, 질의응답, 에이전트 활동 등 다양한 분야에서 파편화되었던 환각의 정의를 하나로 묶어주는 통합된 이론적 기반을 제공합니다. 결국 이 텍스트의 목적은 연구자들이 가정된 세계와 진실 함수를 명확히 규정하게 함으로써, 더욱 정밀하고 대규모인 환각 평가 벤치마크를 설계할 수 있도록 돕는 데 있습니다.














728x90
반응형
'07.AI > 9. AI Safety' 카테고리의 다른 글
| AI 안전성 - SOTA 정렬 평가(alignment assessments) 와 신뢰성 불일치 (0) | 2026.08.07 |
|---|---|
| AI 안전성 - AISI, 사건 보고서: 19건의 미승인된 에이전트 행위 (0) | 2026.08.07 |
| AI 안전성 - LLM 제어 통합 (0) | 2026.08.06 |
| AI 안전성 - Anthropic, 클로드(Claude) 사이버 보안 평가 사고 (0) | 2026.08.04 |
| AI 안전성 - TTA, AI 공격·방어 자동화와 보안표준의 재설계 (0) | 2026.08.04 |


