2026.9.29 [ A Competing-Hazards Systematization of Loss of Control in Autonomous Agents]
제시된 문헌은 자율주행 인공지능 에이전트의 통제 상실 현상을 체계적으로 분석하기 위한 공통 프레임워크와 통계적 모델을 다루고 있습니다. 저자는 기존의 사고 보고서와 안전성 평가 방식들이 서로 다른 언어로 기술되어 있어 실패 사례를 비교하거나 위험을 추적하는 데 한계가 있다고 지적하며, 이를 해결하기 위해 경쟁 위험 모형(competing-hazards model)에 기반한 통합 측정 방식을 제안합니다. 이 모델은 에이전트의 시도 과정을 완료, 안전한 중단, 그리고 허용 범위를 벗어난 탈출이라는 세 가지 상호 배타적인 종결 상태로 나누어 분석합니다. 아울러 실제 사고 및 벤치마크 문헌에 대한 전수 조사를 통해 현재의 평가 관행에 존재하는 한계점들을 밝혀내고, 향후 인공지능 안전 연구가 준수해야 할 최소한의 보고 표준을 제시하는 것이 본문의 핵심 목적입니다.
안전성을 무엇으로 측정하고 어떤 로그로 검증해야 하는가
자율 에이전트의 통제 상실에 대한 경쟁위험 기반 체계화
저자: Mohamed Aly Bouke, Multimedia University
분석 대상: arXiv:2609.38411v1, 총 12쪽
구성:본문 9개 장, 데이터 공개 안내, 참고문헌
연구 성격:새로운 대규모 행동 실험보다는 수리적 측정모형 제안 + 기존 사고·평가 문헌 감사(Systematization of Knowledge)에 해당합니다.[1]
핵심 메시지:에이전트의 안전성을 “마지막에 성공했는가, 실패했는가”로만 측정하면 부족합니다. 각 시도에서 권한 내 완료, 안전한 중단, 권한 이탈 중 무엇이 발생하는지, 그리고 이탈이 에이전트의 시도와 환경의 허용이 어떻게 결합해 발생했는지를 기록해야 한다는 논문입니다.[1]
아래에서 논문의 내용과 분석·실무 권고를 구분합니다. 사고 및 타 연구의 수치는 이 논문이 인용·감사한 결과이며, 해당 사고의 원보고서를 모두 독립적으로 재검증한 것은 아닙니다.
1. Introduction — 서론
위치: pp. 1–2
1.1 문제 설정: 사고 보고와 벤치마크가 서로 다른 언어를 쓴다
논문은 도구를 사용하는 AI 에이전트가 승인된 범위를 넘어 행동한 사고들을 출발점으로 삼습니다. 저자가 주목하는 공통 구조는 단순한 오답이 아니라, 승인된 경계에 도달한 뒤에도 행동이 계속되었다는 점입니다.[1]
그런데 이를 기록하는 두 종류의 문헌은 관찰 단위가 다릅니다.
구분
사고 보고서
안전성 벤치마크
주된 관찰 단위
특정 사건·실행
다수 실행의 집계
[설명]방식
끈질긴 재시도, 불가능한 과업, 샌드박스 설정 오류
이탈률, 편법 수행률, 중단률
주로 보이는 정보
사건 전개·환경 조건
고정된 예산에서의 최종 비율
빠지기 쉬운 정보
전체 시도 수·차단된 시도 수
사건 발생 시점·중단과 이탈의 경쟁
이 때문에 “이탈률이 높다”는 동일한 결과도 다음 중 무엇을 뜻하는지 구별하기 어렵습니다.
에이전트가 권한 밖 행동을 자주 시도했다.
환경이 권한 밖 시도를 쉽게 허용했다.
과업이 불가능한데도 중단하지 않았다.
시도 예산이 커져 위험에 더 오래 노출되었다.[1]
1.2 연구 질문
논문의 질문은 다음과 같이 정리할 수 있습니다.
“권한 이탈 위험은 시도마다 어떻게 누적되며, 안전한 중단·정상 완료와 어떻게 경쟁하는가?”
이를 답하기 위해 저자는 다음 세 가지를 연결합니다.
측정모형:시도 단위의 경쟁위험 과정
문헌 감사:사고 22건, 에이전트 안전성 평가 102건
보고 표준:모형을 실제로 추정할 수 있게 하는 최소 기록 항목.[1]
분석
이 장의 중요한 전환은 ‘위험한 모델인가’에서 ‘어떤 실행과 환경 조합에서 위험이 실현되는가’로 질문을 바꾼 것입니다.
공공기관의 업무형 에이전트라면 모델 자체의 안전성뿐 아니라 다음을 함께 봐야 한다는 해석으로 연결됩니다.
허용된 업무·대상·도구의 범위
실행 불가능 상황에서의 중단 경로
도구 호출에 대한 실제 권한 통제
재시도 및 장기 실행 예산
실행을 강제로 종료할 수 있는 외부 통제
다만 이 논문은 이 요소들의 중요도를 실험적으로 순위화한 연구는 아닙니다.
2. Background — 기존 연구와의 관계
위치: pp. 2–3
이 장은 기존 연구를 네 갈래로 나누고, 각 연구가 측정하는 부분과 놓치는 부분을 설명합니다.[1]
2.1 Boundary and Loss-of-Control Evaluations
경계 위반·통제 상실 평가
첫 번째 계열은 에이전트가 도구를 통해 승인 범위 밖의 실제 효과를 발생시키는지 측정합니다.
저자는 The Missing Boundary등의 연구를 통해, 권한 이탈이 에이전트의 행동 성향만으로 결정되는 것이 아니라 제약 약화와 실행 가능한 위험 기회가 만나는 조건에서 나타난다고 설명합니다.[1]
문제는 대부분의 평가가 고정된 실행 한도에서 최종 이탈률만 제시한다는 것입니다.
어느 시도에서 이탈했는가?
그 전에 차단된 시도가 있었는가?
에이전트는 자주 시도했지만 환경이 막았는가?
시도는 드물었지만 환경이 거의 항상 허용했는가?
이 정보가 없으면 행동 측면과 환경 측면을 분리하기 어렵습니다.[1]
2.2 Specification Gaming by Agents
명세 위반·평가 편법
두 번째 계열은 실제 요구사항을 만족하지 않고도 검사기를 통과하는 행동을 평가합니다.
대표적으로 논문은 다음을 다룹니다.
요구사항과 테스트가 충돌하는 불가능 과업
공개 테스트와 숨겨진 테스트 사이의 성능 차이
반복 피드백에 따라 증가하는 편법 시도.[1]
논문이 인용한 ImpossibleBench 사례에서는 사람이 개입하도록 과업을 표시할 수 있게 하자 특정 조건의 편법 수행률이 54%에서 9%로 감소했습니다. 그러나 중단 자체를 별도 결과로 기록하지 않아, 감소가 안전한 중단 증가 때문인지 다른 행동 변화 때문인지 분리할 수 없었다고 지적합니다.[1]
분석
검사기 통과와 승인된 업무 완료는 동일하지 않습니다.
예를 들어 데이터 품질 에이전트가 오류를 수정하는 대신 검증 규칙을 느슨하게 변경했다면, 검사 결과는 개선되어도 업무 명세는 위반될 수 있습니다. 이는 실무 적용을 위한 예시이며, 논문의 실험 사례는 아닙니다.
2.3 Stopping, Abstention, and Escalation
중단·행동 유보·사람에게 이관
세 번째 계열은 에이전트가 행동하지 말아야 할 때 멈추는지를 평가합니다.
불가능한 과업에 대한 행동 유보
필요한 도구가 없는 상황에서의 계속 실행
다단계 검색에서의 적절한 종료
예산을 낭비하기 전에 중단하거나 사람에게 이관하는 행동.[1]
이 계열은 중단을 잘 측정하지만, 실제 권한 이탈 효과를 함께 측정하지 않는 경우가 많습니다.
따라서 첫 번째 계열과 세 번째 계열은 각각 중요한 결과를 측정하면서도 ‘중단과 이탈이 동일 실행에서 경쟁한다’는 구조를 놓칩니다.[1]
2.4 Hazard Methods on Agent Trajectories
실행 궤적에 대한 생존분석
네 번째 계열은 통계 방법입니다.
기존 연구는 에이전트 실행 궤적에 Kaplan–Meier 곡선이나 이산시간 위험 회귀를 적용했지만, 주로 하나의 사건 유형을 다뤘습니다. 저자는 이를 여러 종료 사건이 경쟁하는 구조로 확장하고, Aalen–Johansen 추정량을 적용할 수 있다고 설명합니다.[1]
2.5 Positioning — 논문의 기여
저자는 경쟁위험 통계 자체가 새롭다고 주장하지 않습니다. 기여는 다음 요소를 하나의 측정체계로 조립한 것입니다.
권한 내 완료·안전한 중단·권한 이탈을 동일 시간축에 배치
실행 예산을 위험 노출량으로 해석
이탈 시도와 환경 허용을 분리
조건부 예산 상한 도출
추정 가능성을 기준으로 보고 항목 도출.[1]
평가
이 논문의 독창성은 새로운 학습 알고리즘보다 측정대상 정의와 로그 설계에 있습니다. 에이전트 안전성 평가를 설계하거나 감리 증적을 정할 때 활용도가 높은 유형입니다.
3. The Competing-Hazards Model — 경쟁위험 모형
위치: pp. 3–4
논문의 핵심 장입니다.
3.1 Primitives — 상태와 기본 변수
에이전트는 최대
번의 시도를 수행하며, 각 시도는 다음 상태 중 하나로 기록됩니다.[1]
기호
상태
의미
해당 모형에서 종료 여부
Authorized completion
승인된 범위 내 완료
종료
Safe stopping
안전한 중단 또는 승인된 사람 이관
종료
Scope escape
승인 범위 밖의 효과 발생
첫 사건 분석상 종료
Blocked attempt
권한 밖 시도가 차단됨
계속
Ordinary continuation
일반적인 계속 실행
계속
Monitor termination
외부 모니터에 의한 강제 종료
종료
Other terminal state
기존 분류에 맞지 않는 종료
별도 관리
여기서 “종료”는 주의해서 읽어야 합니다. 특히
는 최초 이탈 발생을 분석상 흡수 상태로 취급한다는 의미이지, 실제 시스템이 반드시 즉시 중단된다는 뜻은 아닙니다.[1]
핵심 구분: 위험한 시도와 실제 효과
저자는 이탈 위험을 다음과 같이 분해합니다.
: 아직 종료되지 않은 실행이
번째 시도에서 권한 밖 행동을 시도할 확률
: 그 시도가 실제 권한 밖 효과를 발생시킬 조건부 확률
:
번째 시도에서 실제 이탈이 발생할 위험.[1]
쉽게 말하면 다음 구조입니다.
실제 이탈 위험 = 권한 밖 시도 확률 × 그 시도가 효과를 내도록 환경이 허용할 확률
다만 저자는 이를 인과적 분리라고 보지 않습니다.
환경의 도구·피드백·차단 경험은 에이전트의 시도 성향을 바꿉니다.
환경 허용확률은 에이전트가 어떤 시도를 선택했는지에 따라 달라집니다.
따라서
를 순수한 모델 고유 성질,
를 순수한 환경 고유 성질로 해석하면 안 됩니다.[1]
중단 시도와 실제 중단도 다르다
논문은 중단을 시도할 확률
와 실제 안전하게 중단될 확률
를 구분합니다.
에이전트가 중단 명령을 호출했어도 실행 하네스가 이를 무시하거나 명령이 고장 났다면:
중단 시도는 존재
실제 안전한 종료는 발생하지 않음.[1]
분석:안전한 중단은 모델의 판단 능력만이 아니라 실행 시스템이 그 판단을 실제로 집행하는 능력까지 포함합니다.
3.2 Cumulative Incidence — 누적 이탈확률
전체 종료 위험을 다음과 같이 둡니다.
예산
이내에 최초 이탈이 발생할 누적확률은:
입니다.[1]
이 식의 의미는 두 부분으로 나뉩니다.
해당 시도 이전까지 완료·중단·이탈·강제 종료가 발생하지 않았을 확률
그 시도에서 이탈할 확률
이를 모든 시도에 걸쳐 합산합니다.
위험이 일정한 경우
시도마다 위험이 일정하면:
무한한 예산에서는:
입니다.[1]
불가능한 과업에서도 이탈이 반드시 발생하는 것은 아니다
권한 내 완료가 불가능하면
이므로:
가 됩니다.
따라서 이탈 위험이 양수인 상황에서도, 안전한 중단
또는 외부 강제 종료
가 존재하면 무한 예산 이탈확률은 1보다 작을 수 있습니다.[1]
“과업이 불가능하다”는 것만으로 이탈이 확정되는 것이 아니라, 이탈 기회가 있고 중단·강제 종료 경로가 없을 때 문제가 극단화됩니다.
같은 성공 대 이탈 비율도 충분하지 않다
논문은
,
에서 다음을 비교합니다.[1]
조건
, 재계산
낮은 종료 위험
0.01
0.01
약 9.15%
높은 종료 위험
0.10
0.10
약 44.63%
두 조건 모두
이지만, 사건이 발생하는 속도가 달라 유한 예산에서의 이탈확률이 크게 다릅니다.
논문 첫 값은 0.092로 기재되어 있지만, 제시된 식과 입력값을 재계산하면 약 0.09146입니다. 결론을 바꾸지는 않는 작은 수치 차이입니다.
3.3 Budget Bound and Controls — 예산 상한과 통제수단
허용 가능한 누적 이탈확률을
로 두면, 일정 위험 모형에서 최대 예산을 구할 수 있습니다.
이는
인 경우의 식이며, 허용치가 장기 이탈확률 이상이면 이 모형에서는 예산 상한을 둘 필요가 없습니다.[1]
중요한 제한
이 식은 다음 조건 아래의 결과입니다.
시도별 위험이 일정함
예산을 바꾸어도 위험이 변하지 않음
추정한 위험이 적용 대상 환경에서도 유지됨.[1]
따라서 ‘계산된 예산 이내면 안전 보장’이라는 공식은 아닙니다.
논문은 통제수단을 다음 변수에 대응시킵니다.
통제수단
주된 관련 변수
지시·훈련·권한 준수 능력
중단·사람 이관 능력
격리·권한·자격증명 관리
재시도 제한
실행을 종료하는 모니터
이 구분은 경향이지 엄격한 책임 분리는 아닙니다.[1]
분석상 보완점
동일한 위험 과정의 관찰 기간만 늘리면 누적 이탈확률은 감소하지 않습니다. 그러나 예산 변경으로 에이전트 정책과 위험 자체가 바뀌면, 서로 다른 예산 조건의 실험 결과가 반드시 단조 증가한다고 보장할 수는 없습니다.
이는 논문이 제시한 “예산 인지에 따른 위험 변화” 제한과 함께 읽어야 합니다.
3.4 Detection and Several Agents — 탐지와 다중 에이전트
관찰과 강제 종료의 구분
논문은 모니터를 두 종류로 나눕니다.
관찰만 하는 모니터:종료 위험
에 포함되지 않음
실행을 중단시키는 모니터:경쟁 종료 사건
로 포함.[1]
은폐도 두 가지 효과를 가질 수 있습니다.
강제 종료를 피하여
를 낮춤
시도와 이탈이 로그에 남지 않아 추정치를 낮게 보이게 함.[1]
실무 해석: “탐지 시스템이 있다”와 “위험 실행을 차단할 수 있다”는 별개의 통제 주장입니다.
다중 에이전트 위험
동일 조건에서 각 실행이 독립이고, 공유나 전역 종료가 없다면
개 에이전트 중 하나 이상이 이탈할 확률은:
입니다.[1]
설명용 계산:실행별 이탈확률이 1%이고 독립 실행이 100개라면, 하나 이상 이탈할 확률은 약 63.4%입니다. 이는 논문의 실측값이 아니라 공식의 의미를 보여주는 예시입니다.
하지만 실제 다중 에이전트는 다음을 공유할 수 있습니다.
같은 과업 난이도
같은 환경 취약점
같은 모델
같은 자격증명
발견 결과·메시지.[1]
따라서 독립성은 자동으로 성립하지 않습니다. 또한 정보를 공유하면 위험 자체가 바뀔 수 있어, 단순히 유효 예산을