https://www.kisa.or.kr/401/form?postSeq=3712#fnPostAttachDownload
2026.07.07
[AI 보안 위협 대응 매뉴얼]
이 자료는 한국인터넷진흥원(KISA)이 발간한 LLM 시스템 보안 위협 대응 매뉴얼로, 거대언어모델의 도입 확산에 따른 보안 체계와 실무적 가이드라인을 상세히 다룹니다. 본문은 인공지능의 내재적 위협(학습 데이터 편향, 환각, 정렬 실패 등)과 외재적 위협(탈옥, 모델 추출, 공급망 공격 등)을 체계적으로 분류하여, 모델 단독의 보안을 넘어 LLM 시스템 전체 생명 주기를 보호하는 데 목적을 둡니다. 특히 금융, 의료, 제조 등 8대 주요 산업별 위협 시나리오를 제시하고, 기술적 난이도에 따른 독자별 맞춤형 로드맵을 제공하여 실질적인 위험 관리와 투자의 우선순위를 결정하도록 돕습니다. 결과적으로 이 가이드는 인공지능의 안전과 보안을 통합적인 관점에서 관리함으로써, 고성능 모델이 야기할 수 있는 고도화된 사이버 공격에 선제적으로 대응하기 위한 전략적 지침서 역할을 수행합니다.








AI 보안 위협 대응 매뉴얼 요약
1. 개요
이 매뉴얼은 2022년 말 ChatGPT 공개 이후 LLM이 검색·고객응대·코드개발 등 기업 핵심 업무에 빠르게 도입되고, 2026년 4월 고성능 모델 등장으로 위협 행위자의 능력 상한이 한 단계 올라간 상황을 배경으로 만들어졌습니다. 국내 「인공지능기본법」과 국제 「범용 인공지능 행동강령」등 규제 환경을 반영해, LLM 시스템 특유의 위협(탈옥, 간접 프롬프트 인젝션, 에이전트 도구 오용, 모델 공급망 손상 등)을 진단·대응 차원에서 다룹니다.
- 분석 대상: AI 전체가 아니라 AI ⊃ 머신러닝 ⊃ 딥러닝 ⊃ 생성형 AI ⊃ LLM 및 이를 포함하는 LLM 시스템(애플리케이션 + 운영 인프라 + 외부데이터 + 사용자/운영자 경계)
- 권장 독자: 보안팀, CISO·CSO, SOC 분석가, AI·ML 개발자, IT 운영자, 의사결정자, 산업 도메인 보안 담당자, 데이터 엔지니어
- 핵심 구분 개념: AI 안전(비의도적 위험) vs AI 보안(악의적 위험) / 내재적 위협(모델 자체 결함) vs 외재적 위협(외부 공격자·공급망·인프라)
2. AI 보안 위협 분류 및 진단
위협을 3개 영역으로 재분류합니다.
① 데이터 및 모델 위협
- 데이터 위협: D01 불균형 데이터, D02 부정확한 데이터, D03 개인정보 비식별화 미흡
- 모델 위협: M01 학습데이터 유출, M02 벡터DB·임베딩 유출, M03 시스템프롬프트 유출, M04 모델 유출, M05 환각, M06 탈옥, M07 부적절한 출력처리, M08 모델 DoS
② 에이전트 및 공급망 위협
- 에이전트 위협: A01 부적절한 도구 설계, A02 에이전트 하이재킹, A03 에이전트 DoS, A04 에이전트 메모리 오염
- 공급망 위협: S01 데이터 포이즈닝, S02 모델 포이즈닝, S03 취약한 추론엔진 사용, S04 취약한 에이전트 확장요소 사용
③ 고성능 모델 위협
- H01 고도화된 사이버 공격 지원 위협, H02 자율성으로 인한 통제 상실 위협
각 항목마다 정의·발생원인·영향이 정리되어 있고, 국제 프레임워크(OWASP LLM Top 10, NIST AML, MITRE ATLAS)와 학술 논문 근거가 매핑되어 있습니다.
3. 산업별 위협 시나리오
금융·의료·공공행정·교육·제조에너지·통신·법률·IT 8개 산업에 걸쳐 총 32개 시나리오가 제시됩니다. 「고영향 인공지능 판단 가이드라인」의 고영향 AI 활용 영역을 기준으로 산업을 선정했습니다.
공통적으로 반복되는 위험 유형은 다음 4가지입니다.
- 민감정보·기밀정보 유출 (예: 고객상담 에이전트를 통한 개인정보 유출)
- AI 판단·의사결정 왜곡 (예: 대출심사 보조 에이전트를 통한 부적격 승인)
- 에이전트·외부도구 연계 기능 남용 (예: 주식매매 에이전트의 주문 API 남용)
- 고성능 모델 기반 자율 취약점 탐색 (예: 금융망·의료기기·행정시스템·산업제어시스템에 대한 자율 침투)
각 시나리오는 공격 전개 단계, 보안 취약 지점, 영향 분석으로 구성됩니다.
4. AI 보안 위협별 대응 방안
2장 분류에 정확히 대응하는 3개 절로 구성되며, 계층별 다층 방어 체계를 제시합니다.
- 데이터/모델 계층: 데이터 품질관리, 개인정보 비식별화, 모델 정렬(RLHF·DPO·숙고형 정렬 등), 가드레일, 안전한 API 설계(logit-bias 제한 등)
- 애플리케이션/에이전트 계층: 시스템 프롬프트 강화, RAG 접근권한 분리, 최소권한 원칙, Human-in-the-Loop, 실행권한 정보 분리, 실시간 모니터링
- 공급망 계층: 백도어·데이터오염 탐지, 외부 구성요소 출처·무결성 검증, 정기적 보안 업데이트
- 고성능 모델: 모델 수준(역량 제한·안전학습) + 시스템 수준(분류기·정적분석·단계적 배포) + 사회적 수준(정보공유·방어연구) 통제 결합, 자율성 위협 대응을 위한 킬스위치·롤백 기능













'07.AI > 9. AI Safety' 카테고리의 다른 글
| AI 안전성 - KISA, AI 보안 레드티밍 가이드 (0) | 2026.07.27 |
|---|---|
| AI 안전성 - ETRI, 인공지능의 국가안보화: 글로벌 동향과 정책적 함의 (0) | 2026.07.27 |
| AI 안전성 - KISA,인공지능(AI) 보안 안내서 발간 및 배포(2025. 12.) (0) | 2026.07.27 |
| AI - 편향성 측정 - 에이전트 루프 편향 심사 (1) | 2026.07.13 |
| LLM - 검색 증강 생성 (RAG) - 새벽 3시의 RAG 붕괴 (0) | 2026.07.10 |


