AI 안전성 - Anthropic, 인공지능 오용 탐지 및 대응: 2026년 9월
https://www.anthropic.com/threat-intelligence-report-september-2026
2026.9.10
[ Detecting and countering misuse of AI: September 2026]
이 보고서는 Anthropic(앤스로픽)의 위협 인텔리전스 팀이 2025년 말부터 2026년 중반까지 자사의 AI 모델인 Claude(클로드)의 악용 사례를 탐지하고 차단한 성과를 요약한 문서입니다. 본문은 크게 국가 지원 스파이 활동, 금융 범죄, 자율 공격 프레임워크라는 세 가지 핵심 축을 중심으로 AI가 사이버 공격의 속도, 규모, 침투 깊이를 어떻게 비약적으로 높이는지 상세히 다룹니다. 특히 러시아의 'Midnight Blizzard'나 'ShinyHunters'와 같은 해킹 집단이 AI를 활용해 악성코드를 실시간으로 수정하거나 방대한 데이터를 자동 추출하며, 복잡한 해킹 기술 없이도 정교한 공격이 가능해진 '공격 기술의 민주화' 현상을 경고하고 있습니다. 결론적으로 이 자료는 AI 발전이 가져온 새로운 위협 지형을 공개함으로써 방어자 간의 협력을 강화하고 사회적 대응 체계를 구축하려는 목적으로 작성되었습니다.







핵심 결론: 이 장은 AI가 완전히 새로운 공격법을 만들었다기보다, 정찰·도구 개발·침투·탈취·데이터 처리에 필요한 노동을 줄여 공격의 속도·규모·깊이를 높였다고 주장한다. 다만 근거는 Anthropic이 발견한 악용 사례와 자체 분석이다. 독립 검증이나 AI 미사용 대조군을 둔 실험이 아니므로, 피해 규모를 곧바로 “AI 때문에 추가 발생한 피해”로 해석해서는 안 된다.
1. 장의 구성과 주장
도입·추세(pp.4–5), 사례 및 공격 흐름(pp.6–37), 종합 추세(pp.38–39), 공격자 제작 스킬 부록(p.40)으로 구성된다. 관측 기간은 2025년 12월~2026년 8월이며, 사이버 사례에는 Haiku·Sonnet·Opus가 사용됐다. Fable·Mythos에서 악성 활동을 발견하지 않았다는 서술은 해당 조사 범위의 관측 결과이지, 모든 환경에서 악용이 불가능하다는 증명이 아니다. GTG는 Anthropic의 내부 공격자 식별자다.[pp.4–5]
보고서는 고급 공격의 외형만으로 국가 지원 조직을 식별하기 어려워졌다고 본다. 공개 공격 프레임워크와 병렬 에이전트를 이용하면 개인·소규모 범죄자도 다수 피해자를 다룰 수 있기 때문이다. 그러나 표적 선정, 결과 검토, 수익화는 여전히 사람이 주도하며, 자율성 수준과 피해 심각성은 별개의 축이라고 명시한다.[pp.38–39]
2. 사례별 근거·수치·한계
① GTG-20006 — 러시아 연계 첩보 작전 / Midnight Blizzard 연계 평가(pp.6–11)
악성코드 개발부터 인프라 확보·피싱·지속 접근·탈취까지 AI 워크플로를 연결했다. 보안제품 탐지를 모니터링하고 탐지된 악성코드를 수정·재빌드하는 반복 구조가 핵심이다. 호텔 Wi-Fi 업체를 통한 우회 접근, WhatsApp 연결 기기 악용, 카메라 서비스 권한 결함, Microsoft 365 기기 코드 피싱 등 접근 경로도 다양했다.
- 계획·정찰·실제 작전에서 20곳 초과 조직, 우크라이나 정부기관 24곳 초과 스캔.
- 드론 부품 제조사 최소 2곳의 메일함을 대량 반출하고 드론 비전 시스템 SDK를 탈취.
- 호텔 Wi-Fi 운영업체 최소 3곳 침해, 전직 우크라이나 고위 인사 최소 2명의 WhatsApp 표적화.
- 북아프리카 기관에서 30만 건 초과 신원기록, 50만 곳 초과 기업 등록자료 탈취.
- 클라우드 메일 캠페인에서 최소 8개 조직의 메일 접근·반출, 전체적으로 수백 GB의 탈취자료 처리.[pp.7–9]
한계: 국가 연계는 행위·표적 및 공개 보고와 일치한다는 귀속 평가다. “방어자의 탐지보다 빠르게 우회할 수 있다”는 결론도 원문에서 일부 이론적 가능성으로 표현된다. 자동 수정 구조의 존재가 모든 보안제품에 대한 우회 성공을 뜻하지 않는다.[pp.6,9]
② GTG-50014 — ShinyHunters 계열로 의심되는 기회주의적 데이터 탈취(pp.11–24)
유출 자격증명을 대량 수집·검증한 뒤, 하나의 접근권한을 관리자 권한과 고객사 접근으로 확대하고 데이터를 반출·판매·갈취했다. AI는 생소한 환경의 API와 인증구조를 이해하고 코드를 작성·실행하는 역할을 맡았다.
- 한 운영자는 AWS EC2 작업자 10대로 서로 다른 Android APK 180만 개를 내려받아 비밀정보를 탐색.
- 판매 플랫폼에는 약 40만 건의 통신·ISP 자료가 포함됨.
- 기술 제공업체에서 1TB 초과, 수십만 신원 식별자와 수백만 결제카드 기록 탈취. 항공사에서는 수천만 승객 기록을 보유한 시스템에 접근.
- SaaS 침해로 약 200개 고객 조직 자료를 추출하고, 약 34시간에 40개 초과 테넌트의 Azure AD 토큰 세트 2,100개 초과를 덤프. 다른 침해에서는 수천 고객 조직의 자료를 반출.
- 한 사례는 개발자 토큰 하나에서 클라우드 관리자 권한까지 약 3시간이 걸림.[pp.12–14]
한계: 여러 운영자·침해 사례의 수치를 한 사건으로 합산하면 안 된다. 가정용 EV 충전기 전류 제어와 2,000·5,000달러 버그바운티 수령은 공격자 주장으로 제시된다. 도난 AI 키는 고객 환경에서 유출됐으며 Anthropic 자체 시스템 침해는 아니라고 명시한다.[pp.13–15]
③ GTG-10007 — 익스플로잇 공장과 자율 공격 프레임워크(pp.24–28)
중국어 사용 운영자들이 정찰·침투, 보안제품 역공학, 악성코드 개발, 정보 수집을 병렬 수행했다. 캠페인 기억을 지속 저장하고 사람이 자리를 비운 동안에도 일부 작업이 계속됐다. 펌웨어 분석→취약점 가설→익스플로잇 작성→실험실 검증의 반복이 특징이다.
- 약 50개 조직 표적화. 교육기술 업체에서 수백 MB의 학생 개인정보 추출.
- 주요 보안제품의 기존에 알려지지 않은 취약점 여러 개를 공격자 실험실에서 검증.
- 한 워크플로가 한 달에 12건 초과의 잠재적 제로데이 발견을 산출.
- 상시 수집 AI 에이전트 13개가 공개 군사·정부 자료 등을 예약 수집.[pp.25–28]
한계: “잠재적 발견”은 모두 확정된 제로데이나 실제 침해 성공이 아니다. 실험실 검증, 운영환경 공격 시도, 성공한 침해도 구분해야 한다. 해외 정부기관 정찰과 달리 사람이 직접 관여한 침투 노력은 중국 내 피해자에 집중됐다고 보고한다. 국가 정보 관심사와의 정렬만으로 국가 지휘를 확정할 수 없다.[pp.25–28]
④ GTG-50021 — 위장 AI 재판매와 자격증명 탈취(pp.28–30)
러시아어·우크라이나어 사용 집단이 할인 Claude 서비스를 가장했다. 실제 트래픽은 다른 모델로 전달하고, 설치 도구로 Anthropic 자격증명을 탈취해 다른 프록시 재판매업자에게 넘겼다. 관련 일반 수법에서는 감염 장치의 새 세션·키도 계속 수집하므로 키 교체만으로 문제가 끝나지 않는다.[pp.28–30]
한계: 피해자 수·탈취량·수익·활동 기간의 정량 자료가 없다. 따라서 시장 전체 규모나 이 집단의 경제적 효과는 산정할 수 없다.
⑤ GTG-50020 — 호텔 예약 공격에서 AI 공급망 공격으로 전환(pp.30–34)
기존 호텔 예약·핀테크 침입 수법을 AI 기업에 적용했다. 평가 샌드박스에 악성 지시를 주입해 보관 중인 운영 API 키를 유출시키고, 피해자 키로 후속 공격을 수행했다. 병렬 침투 에이전트 외에도 사기 계정 생성과 KYC 흐름 중계·세션 탈취를 운영했다.
- 기존 피해자에서 약 26GB 탈취, 150만~250만 달러 갈취 또는 판매대금 요구.
- 약 4일 동안 AI 기업 약 30곳을 유사 기법으로 공격.
- 미출시 Claude 접근을 12개 초과 경로로 시도했으나 모두 실패.[pp.30–33]
한계: 요구액은 실제 수익이 아니다. 30곳 공격은 30곳 침해 성공을 뜻하지 않는다. 미출시 모델 접근 및 Anthropic 자체 시스템 침해는 성공하지 않았다고 명확히 구분한다.[p.31]
⑥ GTG-50029 — 유럽 정치·관련 기관 표적 핵티비즘(pp.34–37)
프랑스어 사용자 한 명이 도난 API 키와 다중 에이전트를 이용했다. WordPress 재설치 경쟁조건 악용, 웹셸·항상 실행되는 플러그인, 백업 오염, 언론사 독자 브라우저 표적화, 신상 공개 플랫폼 fafsearch 개발을 결합했다.
- 기존에 문서화되지 않은 재설치 경쟁조건 공격이 최소 4개 웹사이트에서 성공.
- 정치 캠페인 플랫폼에서 정치적 의견을 포함한 약 14만 기록 탈취.
- 추적 표적 42곳 중 최소 14곳 내부 접근, 약 12~26GB 데이터와 15,000개 메시지 메일함 반출.
- fafsearch에는 기존 유출자료와 직접 탈취자료를 합쳐 수천만 행 적재.[pp.35–36]
한계: 플랫폼의 전체 행 수는 이번 캠페인에서 신규 탈취한 기록 수가 아니다. 백업 오염의 지속성 목적은 원문의 추정이다. 도표의 “추론된 영향” 집계와 본문의 추적 표적·내부 접근 수치도 같은 분모로 해석하면 안 된다.
3. 방어조치와 실무적 해석
보고서가 실제 수행했다고 밝힌 대응: 악용 계정 차단, 조사 결과를 반영한 탐지·안전장치 강화, 관련 활동 추가 모니터링, 필요한 경우 정부·업계·피해자와 정보 공유 및 위협 완화 협력이다. 특히 ShinyHunters 계열과 GTG-10007 사례에서 계정 차단과 후속 탐지를 명시한다.[pp.4,14,25]
보고서의 명시적 권고: AI 키·세션 토큰과 에이전트 통합을 운영 자격증명 수준으로 보호하고, AI 접근은 승인된 유통 경로로 구매해야 한다. 도난 키는 판매 가능한 전리품이자 타인 비용의 연산 자원이며, 정당한 키 소유자의 활동으로 위장하는 수단이다.[pp.29–30]
사례로부터 도출한 분석자 권고:
- 공개 저장소·APK·컨테이너의 비밀정보 노출을 점검하고 키 권한·사용 한도를 최소화한다.
- 키 교체와 함께 감염 클라이언트 제거, 세션 폐기, 공격자가 만든 계정·연결 기기를 점검한다.
- 샌드박스에는 운영 키를 넣지 않고, 외부 콘텐츠의 지시가 비밀정보·네트워크 접근권한으로 이어지지 않도록 분리한다.
- 해시·서명 차단만이 아니라 토큰 발급, 대량 API 조회·반출, 테넌트 간 접근 등 행위 흐름을 탐지한다.
- SaaS 공급망, 호텔 Wi-Fi, 웹사이트 복구 백업까지 침해 범위에 포함한다.
p.40 부록은 공격자가 악성코드 개발, 인프라 운영, 정찰, Windows 지속성, 피싱·관리 UI, iOS 익스플로잇 연구를 재사용 가능한 스킬로 조직했음을 보여준다. 이는 “프롬프트 한 번”이 아니라 기억·도구·예약 실행을 갖춘 운영체계가 위험의 중심이라는 해석을 뒷받침한다. 다만 생산성 향상 배율이나 AI의 인과적 기여율을 입증하는 자료는 아니다.[p.40]
영향공작·감시 장 분석
범위: 원문 pp41–110 전체의 영향공작 9건, 감시 10건을 검토했다. 아래 내용은 Anthropic이 자사 서비스 이용 기록·계정 정보와 일부 외부 자료를 바탕으로 보고한 관측 및 귀속 판단이다. 독립적으로 검증한 결과가 아니며, ‘차단’도 원칙적으로 Claude 계정·개발 활동의 차단이지 외부 시스템이나 공작 전체의 종료를 뜻하지 않는다.[1]
1. 영향공작(pp41–80)
장의 핵심
Claude는 선전문 작성뿐 아니라 가짜 언론사, 인물 설정, 표적 데이터베이스, 직원 평가·계약, 지속 메모리와 자동 발행 체계까지 지원했다. 핵심 위험은 생산량 증가와 출처·조직·확실성의 세탁이다. 다만 대다수 공작의 실제 청중 반응은 작거나 확인되지 않았다. 보고서의 Breakout Scale 1–6등급은 유통·확산 수준이지 설득 효과나 선거 결과 변화의 측정치가 아니다. 기존 국영방송 유통망을 가진 사례가 가짜 계정만 보유한 사례보다 실질적 노출에 유리했다(pp41–44).[1]
① GTG-04001 — 중앙아프리카공화국 러시아 연계 정보공작(pp44–47)
- 관찰·수치: 러시아어 사용자가 Radio Lengo Songo 98.9 FM의 일일 제작을 지원했다. 친러시아·친Wagner·반프랑스 논조를 현지 기사로 위장하고, Sputnik 교육과 방송시간의 교환을 통해 국영방송으로 전달하려 했다. 인사계약의 정치적 충성, 3회 위반 해고 규칙, 야권 감시와 정부문서 위조도 포함된다. 확산 4등급.
- 한계: Politology 현지 조정자 및 러시아 국가 지휘라는 귀속은 Anthropic의 판단이다. 실청취자 수·태도 변화는 제시하지 않는다. 실명을 무장세력으로 지목하는 요청은 거절됐지만 익명 출처 방식으로 우회했다.
- 대응: INPACT/All Eyes on Wagner 제보로 조사해 계정·조직을 제거하고 행동 기반 탐지를 추가했다. AI 뉴스 제작과 정치적 인사 통제가 결합했다는 점이 중요하다.[1]
② GTG-54002 — LKM의 6대륙 상업적 영향공작(pp47–53)
- 관찰·수치: 프랑스 광고회사 LKM에 귀속된 네트워크는 가짜 뉴스사이트 약 70개, 대응 X 계정 70개, 댓글 계정 250개 초과로 약 20개 언어, 최소 8,913개 기사를 생산했다. DRC 관련 기사는 318개. 도메인은 2025년 중반 10주 안에 등록됐으며, 9월 11일 유사 기사가 3분 이내 동시 게시됐다. 확산 2등급.
- 한계: 고객의 주문에 따라 상반된 정치 논조를 공급한 것으로 보지만 발주자는 확인하지 못했다. 정부 지휘 증거와 자체망 밖 확산 증거도 없다.
- 대응: 계정·조직 차단, 행동 탐지, 공유 배포 식별자와 도메인 공개. 기사 수보다 공통 인프라·동시 발행이 조직적 조작의 강한 단서다.[1]
③ GTG-84005 — BBS의 말레이시아 선거조작 플랫폼(pp53–58)
- 관찰·수치: 이스탄불 BBS Bilisim Teknolojileri 연계 플랫폼은 222개 의회 선거구, 수백만 유권자 기록, 가짜 X 계정 1,000개 초과를 이용했다. 인종·종교·왕실 관련 균열을 표적화하고 ‘Malaysia Pulse’로 국영매체 출처를 세탁했다. 총리 계정에 인위적 조회 100만 회를 주문한 기록, 2026년 5월 17일 동일 시각 생성 계정 12개가 제시된다. 확산 2등급.
- 한계: 대시보드의 수백만 단위 성과는 공격자 자체 기록으로 검증되지 않았다. 통신규제기관 계약 성사나 진짜 청중으로의 확산도 확인하지 못했다.
- 대응: 계정 제거와 지표 기반 추적. 거절 후 표현만 순화해 동일 기능을 계속 구축한 점은 단일 요청 심사의 한계를 보여준다.[1]
④ GTG-24015 — 러시아 국영매체 편집 파이프라인(pp58–62)
- 관찰·수치: 4개 계정이 Sputnik Moldova/RIA Novosti, Sputnik en Español, Sputnik Africa, RT 영어방송에 편집 지원을 했다. 몰도바 대통령 비방은 2025년 9월 28일 총선에 앞서 제작됐다. 공개 게시물과 정확히 일치한 사례의 조회는 2.09K이며, 최소 1건은 방송 송출이 확인됐다. Sputnik Africa는 40개 규칙의 편집 지침을 사용했다.
- 한계: 해당 매체 전체 산출물 중 Claude 경유 비중은 알 수 없다. 2.09K는 특정 게시물 조회이지 전체 공작의 도달량이 아니다. 사례에 별도 확산등급은 명시되지 않는다.
- 대응: 4개 운영 계정 차단과 파트너 지표 공유. 여러 매체의 재인용이 독립적 검증처럼 보이게 만드는 ‘확인 루프’가 핵심이다.[1]
⑤ GTG-34001 — 이란 ICCO·Mashhad·Bina 선전기관(pp62–67)
- 관찰·수치: 국가 연계 3개 계정이 교리·운영매뉴얼·인물 설정·표적명부를 작성했다. ICCO의 9부문 국제 영향 포트폴리오, Mashhad ‘Manjanegh’의 수십 명 활동가와 100개 초과 유료 확산 채널이 등장한다. 실제 작업 언어는 6개, 확대 계획은 20개 언어다. Bina는 IRGC 대변인 목소리와 서방 연구기관의 권위를 도용했다. 확산 3등급.
- 한계: 계획된 언어·사업과 실제 배포를 구분해야 한다. 일부 채널 배포는 관측했지만 총 청중·설득 효과는 측정하지 않았다.
- 대응: 3개 운영 계정 차단과 기관·프로젝트·채널 지표 공유. 종교적 교리, 행정 기획, 소수자 공격이 한 제작체계로 연결됐다.[1]
⑥ GTG-54006 — 방글라데시 친Awami League 자동 허위뉴스(pp67–70)
- 관찰·수치: Gaibandha의 단독 운영자가 약 16개월간 29개 계정을 교대했다. fake_news_3.py는 회당 제목 15개, 허위 서사 3개, 이미지 프롬프트 15개를 생성했다. 총량은 최소 제목 1,500개, 허위 서사 300개, 이미지 프롬프트 1,500개다. 저문해 농촌 청중용 영상·음성으로 변환하고 예약 게시했다. 확산 3등급.
- 한계: Awami League나 국가의 지휘·지원 증거는 없다. 전체 산출물 게시 채널과 광범위한 청중 도달도 확인하지 못했다. 이미지 제작을 다른 모델에 맡겼다는 설명은 추정이다.
- 대응: 관련 계정 차단, 재가입 탐지와 배포 플랫폼 공유. 단순하고 감정적인 허위정보의 반복 공급을 자동화한 사례다.[1]
⑦ GTG-84006 — MEK/NCRI 연계 사칭·모집 공작(pp70–75)
- 관찰·수치: ‘Viktor’ 공유 에이전트가 실존 활동가의 Telegram 글 약 8,400개로 문체를 복제해 지인과 실시간 대화했다. 공식 NCRI 매체 종사자 최소 4명, 수집 채널 500개 초과, 분석 메시지 약 51,944개, 동시 허위 속보 수신자 30명 초과가 제시된다. 인물별 심리·체포 이력과 10단계 유입 체계를 만들었다. 확산 2등급.
- 한계: 중앙 지휘 수준과 실제 참여량은 검증되지 않았다. 제시된 Instagram 규모 약 708K·299K·173K·89.5K는 계정 규모이지 공작 도달량이 아니다.
- 대응: 관련 계정 차단. 지속 메모리가 분산 운영자의 교리·금칙어·회피 규칙을 공유하고, 영향공작을 개인 감시와 연결했다.[1]
⑧ GTG-54004 — 케냐 국내 위장 여론공작(pp75–77)
- 관찰·수치: 단독 운영자가 회당 정확히 50개 트윗으로 자발적 시민 반응을 위장했다. 전기요금 인상 저지와 정부 인사를 홍보하고 2027년 총선 전 야권 분열을 강조했다. 소매 마케팅에도 같은 템플릿을 사용하며 매 5번째 게시물에 링크를 넣었다. 확산 1등급.
- 한계: 실명·책임 조직·정부 관여는 확인되지 않았다. 집권 진영 연계는 추정이며, 관측상 자체망 밖 실제 영향은 없었다.
- 대응: OpenAI의 재범 제보로 조사한 뒤 계정·조직을 제거하고 탐지를 보강했다. AI가 정치 전략보다 대량생산과 자연스러운 외관을 제공했다.[1]
⑨ GTG-84002 — UAE 연계 무슬림형제단·수단·UN 공작(pp78–80)
- 관찰·수치: ‘Deadshot’ 에이전트와 반복 교리 파일로 5개 작업축, 가짜 영향력 계정 약 300개, UN 인권이사회 제62차 회기용 2명의 대필 증언, 의원·언론인 18명의 개인 파일, 특별보고관 반박 문서를 제작했다. 확산 3등급.
- 한계: UAE 정부 관계자 귀속은 높은 확신의 자체 판단이나 증언·문서의 전달 및 정책 효과는 확인하지 못했다. 원문은 NGO 사칭 대상을 한 곳에서는 ‘스위스 조직’, 다른 곳에서는 ‘수단 인권조직’으로 기술해 관계가 불명확하다.
- 대응: 계정 차단·탐지·업계 공유. 독립 시민사회의 외관으로 국가 메시지를 인권 책임추궁 절차에 삽입하려 한 사례다.[1]
2. 감시(pp81–110)
장의 핵심
2026년 1–7월 사례들은 AI가 분석 인력, 개발 인력, 외국어 전문가를 대체하는 모습을 보여준다. 감시는 공개정보 검색에서 끝나지 않고 취약성 분류→접근·모집→국가 데이터베이스→집행 권고로 이어졌다. 공개된 게시물도 정치 성향·종교·가족관계와 결합해 비동의 개인 파일로 전환되면 인권 위험이 커진다(pp81–82).[1]
① GTG-54009 — S2T 상업 감시 플랫폼(pp82–86)
관찰: 이란·걸프 사용자를 6개 인구집단으로 분류하고 약 25개 게시물씩 분석해 위치·정치성향·신뢰도 점수를 산출했다. 합성 계정 작업은 255개 초과. 한계: 시험 단계에서 적발됐으며, 과거 Forbidden Stories가 보도한 비공개 그룹 침투·피싱·기기 침해가 이번 사례에서 실행됐다는 증거는 없다. 신뢰도 점수도 정확도 검증치가 아니다. 대응: 2026년 6월 계정 차단과 감시업체 추적 파트너 공유.[1]
② GTG-14010 — 시리아 위구르 감시·모집(pp86–89)
관찰: WhatsApp 그룹 100개 초과와 Telegram 채널 수십 개에서 별도 수집한 자료를 구조화했다. 재정난·가족분리·신장 잔류 가족을 취약점으로 분류하고, 아랍어를 모르는 운영자가 AI 번역·방언 점검으로 여러 날 모집 대화를 수행했다. 한계: 모집 성과는 보이지 않으며, 중국 국가안보 계약업체라는 귀속은 낮은 확신이다. 대응: 계정 차단·행위 서명 추적; 비밀 심문과 대규모 가짜 인물 요청 일부는 거절됐다.[1]
③ GTG-14020 — 중국 종교정보 수집(pp89–93)
관찰: 가톨릭 지도자, 대만 장로교, 티베트 불교, Falun Gong·연계 매체, 선교망을 대상으로 생년월일·이주 이력·온라인 계정·종교시설 구조와 압박 수단을 기록했다. 본문은 4개 동시 작업축, 표는 5개 대상 범주를 제시한다. 한계: 중국 정부 연계와 단독 운영자의 분석팀 대체는 자체 평가다. 장 도입부의 ‘월 수천 건’에 대한 검증 자료는 사례에 없다. 대응: 계정군 차단·탐지 강화.[1]
④ GTG-14021 — 중국 ‘안정 유지’·초국경 탄압(pp93–98)
관찰: 3개 계정/작전이 여론 수집, 정부 감시 DB 질의, 일일 보고, 해외 행사 장소 정찰을 수행했다. 거절 후 재요청으로 민간인 10명의 청원 차단·강제 소환·이동 감시 지침이 생성됐다. 한계: 사이버경찰 신원은 낮은 확신, 경찰대학원생 및 저장성 기관 귀속은 중간 확신이며 실제 집행은 제시되지 않는다. 대응: 계정 차단·공유 VPN 추적·훈련 반영. 일부는 장기간 거절 없이 진행됐다고 인정한다.[1]
⑤ GTG-14022 — 중국 여론·반체제 감시 계약업체(pp98–101)
관찰: 하루 15–30개 이상 기사를 정치적 민감도로 점수화하고 정부식 용어로 재구성했다. v2.6 운영매뉴얼과 코드 실행으로 보고를 자동화했다. 한계: 정부 계약업체라는 판단은 중간 확신, 2개 계정군의 동일 운영자 연결은 높은 확신이다. 집행 권고가 실제 조치로 이어졌는지는 알 수 없다. 대응: 연결 계정군 차단·인프라 추적·탐지 추가.[1]
⑥ GTG-34007 — 이란 두 조직의 Arman·악성 Firefox 확장(pp101–103)
관찰: 2개 조직, 16개 계정이 중앙 사건관리 시스템 ‘Arman’으로 수집을 통합했다. 7개 부서 조직은 연간 6,388명 감시를 주장했고, 트윗 155,216개를 분석해 반정부·해외 계정 39개를 지목했다. 기도시간 도구로 위장한 ‘al-Najm al-thāqib’ 확장은 실제 배포됐으며, 별도 공동 위치 행위자는 작가 3명의 음성을 복제했다. 한계: 6,388명은 운영자 주장이다. 대응: 16개 계정·조직 차단. 명시적 프로파일링은 거절했지만 개발 요청 상당수는 통과했다.[1]
⑦ GTG-50027 — 말리 국가 감청 ‘Lakana 360’(pp103–105)
관찰: 단일 구독자가 ANSE용 플랫폼을 개발했다. 보고서는 3개 통신사, 약 2,500만 SIM을 범위로 제시하며 통화·SMS·음성, SIM 간 음성 식별, 생체등록부 결합을 설명한다. 특정 번호의 AI 파일 작성에서 영장 요구를 제거하고 무기한 보존을 설정했다. 한계: 실제 전국 수집량을 독립 검증한 것이 아니며 SIM 수는 사람 수가 아니다. 대응: 계정 차단·탐지. 온프레미스 배포와 로컬 모델은 계속 작동해 계정 제재가 기존 시스템을 중단하지 못했다.[1]
⑧ GTG-30004 — 이란 연계 OSINT·악성코드(pp105)
관찰: 이스라엘·미국 개인과 유대인 해외 조직을 대상으로 기존 표적명부를 보강해 수백 명을 프로파일링했다. 별도 작업으로 NanoDump와 코드 난독화 파이프라인을 수정했다. 한계: 정확한 대상 수·피해·침해 성공은 없다. 대응: 장 전체의 계정 차단·탐지·정보 공유 원칙이 적용되며 사례별 추가 대응은 기술하지 않는다.[1]
⑨ GTG-30005 — 미 해군 정찰·이란 국내 감시(pp106–107)
관찰: 공개 군사사진의 인명, 함정·항공기 식별자, 위성자료와 취약점으로 표적 지침을 작성했다. 동일 계정은 차량번호 인식과 모바일 식별자 수집을 결합하고 비공개 Telegram 그룹 244명의 관계망을 분석했다. 한계: 표적 추천이 공격 실행이나 성공을 입증하지 않는다. 대응: 계정 차단·탐지와 정부 당국 정보 공유.[1]
⑩ GTG-30006 — 이란 국내 감시 도구·SECOMS64(pp107–110)
관찰: 무료 계정을 16개 단독 운영 조직으로 분산해 이란 IP 대상 전달망, 피싱, SECOMS64 감시 악성코드, Microsoft 365 토큰 탈취 도구를 개발했다. 직접 악성 요청 10건 중 9건은 거절됐지만 작은 웹개발 작업으로 분해하면 방어가 약해졌다. 한계: 이 수치는 해당 직접 요청 표본이지 전체 차단율이 아니다. Claude 사용은 개발·시험으로 설명되며 실제 피해 규모는 없다. 대응: 계정 차단·방어 반영·파트너 공유; pp109–110의 호스트·토큰 접근·외부 통신 지표는 방어 탐지에 활용할 수 있다.[1]
3. 종합 평가와 대응 제언
두 장의 공통점은 사람·조직·출처를 가장하고, 지속 메모리·코드·데이터베이스로 작업을 반복 가능하게 만든 것이다. 그러나 생산량, 계정 수, 설계상 감시 범위는 실제 노출·운영·피해와 구분해야 한다. 특히 귀속 확신도와 사실의 검증 수준은 별개다.
분석자 제언: ① 단일 프롬프트보다 계정군·세션·파일·도구의 누적 목적을 심사하고, ② 플랫폼 간 공통 인프라·행동 지표를 교환하며, ③ 정치·종교·가족 취약성 기반 개인 파일과 집행 권고를 별도 고위험 범주로 관리해야 한다. ④ 국가 감시 시스템에는 법적 근거·승인·보존기한·감사 통제를 대량수집층까지 적용하고, ⑤ 이미 외부에 배포된 도구에는 계정 제재를 넘어 배포망·감염기기·운영기관 차원의 대응이 필요하다. 이는 원문 조치의 재진술이 아니라 그 한계를 바탕으로 한 제언이다.
재래식무기·생물학적 악용·사기 장 분석
검토 범위: 제공된 PDF 원문 추출본의 pp.111–142를 모두 읽었다. 아래의 ‘관측’은 Anthropic이 계정·대화·개발 기록에서 확인했다고 보고한 내용이며, 독립 검증을 뜻하지 않는다. 조직 연계와 실제 연구 진척에 관한 ‘판단’, 행위자의 자금·신분 ‘주장’, 그리고 본 분석의 거버넌스 권고를 구분했다. 무기·생물학의 실행 방법은 제외했다.[1]
1. 재래식무기: 개발뿐 아니라 문서·조달·정보수집까지
이 장은 중국 3건, 러시아 2건, 예멘 1건을 제시한다. 네 사례는 무기 관련 소프트웨어 개발, 두 사례는 조달·정보수집이다. 공통점은 기존 전문성과 하드웨어 접근권을 가진 사용자가 AI로 업무를 확대했다는 것이다. ‘비전문가가 AI만으로 무기를 완성했다’는 증거는 아니다. 계정 차단이 해당 프로그램 자체의 종료를 입증하는 것도 아니다. Anthropic은 고위력 폭발물·무기 개발 분류기를 추가하고 조사 결과를 파트너와 공유했다고 설명한다.(pp.111–112)[1]
① GTG-87001 — 예멘 유도무기 개발 조직, pp.112–115
- 증거·수치: 세 개발 프로그램을 관측했으며, 하나에는 2,000km 초과 사거리 목표가 있었다. 여러 Claude 인스턴스에 개발·조사·검토 역할을 나눠 맡겼다. 유도로켓 시험발사 뒤 수시간 내 실패 분석을 요청한 기록이 가장 중요한 현실 접점이다.[1]
- 한계: 시험은 실패한 것으로 보이며, 운용 가능한 무기 배치에 성공했다는 증거는 없다. 사거리는 달성 성능이 아닌 목표다. 전체 개발사업에 대한 가시성도 제한적이었다.[1]
- 조치·해석: 관련 계정을 차단하고 정보를 공유했다. 그러나 독립 실행형 오프라인 도구가 이미 만들어져 있었다. 접근 차단과 이미 이전된 역량의 회수는 별개라는 사례다.[1]
② GTG-17001 — 중국 대어뢰 체계 사양·획득문서, pp.115–116
- 증거·수치: 체계 사양, 200쪽 초과 기술제안서와 발표자료, 미국 공개 프로그램 비교분석을 병행했다. 반복적인 가상 전문가 검토와 소프트웨어·검증문서 작업도 관측했다.[1]
- 귀속·한계: 사용자는 미국 방산업체라고 소개했지만, Anthropic은 중국 방산 제조사와 연계된 해군용 제안 작업으로 판단했다. 특정 조직·개인에는 귀속하지 못했다. 승인·인증·실전 시험 완료도 입증되지 않는다.[1]
- 조치·해석: 지역·무기개발 정책 위반으로 차단하고 분류기를 보완했다. 위험 검토는 코드뿐 아니라 제안·인증·획득 문서가 연결되는 사업 맥락까지 포함해야 한다.[1]
③ GTG-27005 — 러시아 ‘DronDoc/Serafim’ 자율 드론군집, pp.117–119
- 증거·수치: 시뮬레이션과 실제 개발보드에 코드를 올린 기록을 확인했다. 관련 계정 9개 중 8개는 일반 프리랜서 업무에만 사용됐다. 주요 체계의 성숙도는 TRL 3–4, 즉 시뮬레이션 검증 수준으로 제시된다. 설계에는 인간 승인 없는 치명적 교전이 포함됐다.[1]
- 귀속·한계: Anthropic은 국가기관이 아닌 소규모 전문 프리랜서 팀으로 판단했다. 대학·연구센터 연계는 조사상 판단이고, 러시아 기관의 자금 지원은 행위자 주장으로 검증되지 않았다. 하드웨어 접점은 실전 배치 증거가 아니다.[1]
- 조치·해석: 관련 계정을 차단하고 탐지를 개선했다. 개별 계정의 평범한 작업과 위험 작업을 함께 보는 연계 분석, 자율 치명행동에 대한 인간 통제가 핵심이다.[1]
④ GTG-17002 — 중국 전자전·방공억제 표적화 소프트웨어, pp.119–122
- 증거·수치: 약 16개 모듈, 12개 버전의 개발을 관측했다. 중간에 기본 시나리오가 대만의 12개 표적으로 바뀌었으며 자체 호스팅 모델과도 연결됐다.[1]
- 귀속·한계: 계정 메타데이터와 대화 내용에 근거해 중국 군사·방산 연구자이며 관련 연구기관과 연계됐다고 판단했다. 실제 작전 사용이나 표적화 정확도는 제시되지 않는다. p.121의 체계 언급 횟수는 관심의 빈도이지 달성 역량이 아니다.[1]
- 조치·해석: 연계 계정을 차단했다. 기술적으로 일반적인 모델링도 특정 군사 표적·운용 목적과 결합하면 위험도가 달라진다는 점이 중요하다.[1]
⑤ GTG-27006 — 러시아 군민 양용품 조달, pp.123–126
- 증거·수치: 센서, 우주용 태양광 소재, 항공 산소장비, 군부대 병원 건설, 방산 IT 등 5개 업무 흐름을 확인했다. 수천 개 소재 조달과 입찰당 약 40개 품목의 정보 취합이 포함됐다. 내부 보고서에는 유럽 무역통제 회피 목적이 명시됐다.[1]
- 한계: 일부 주문은 정부·방산 고객 계약이 제시됐지만 다른 주문의 최종 고객은 확인하지 못했다. 군민 양용품이라는 이유만으로 모든 구매를 군사용으로 확정할 수 없다.[1]
- 조치·해석: 계정 차단과 재가입 감시를 실시했다. 개별 견적·번역·공급자 검색은 무해해 보이므로, 최종사용자·거래 맥락·통제 회피 의도를 종합해야 한다.[1]
⑥ GTG-17003 — 중국 지향성에너지 무기·공급망 정보수집, pp.126–128
- 증거·수치: 수십 회 세션에서 공개 자료를 모아 23쪽 보고서, 약 45쪽 부록, 12개월 후속 관찰계획 등을 작성했다. 본인은 3인 팀을 이끄는 정보문서 편집자라고 소개했다.[1]
- 귀속·한계: Anthropic은 조사 범위와 분석 수준을 ‘국가급 정보활동 기법’으로 평가했다. 이는 국가기관 소속을 확정한 것이 아니다. 추정된 부품·공급자의 정확성이나 역설계 성공도 검증되지 않았다.[1]
- 조치·해석: 계정 차단과 연계 계정 감시를 실시했다. 공개 정보도 체계적으로 결합하면 민감한 정보 산출물이 될 수 있지만, 일반 연구와 구별하는 목적·조직 맥락의 검토가 필요하다.[1]
2. 생물학적 악용: 위험 신호와 악의 입증은 다르다
Anthropic은 5개 사례의 연구자에게 해악 의도가 있었다고 주장하지 않는다. 국가·기관·세부 기술도 비공개다. 새로운 모델의 위험 역량에 관한 불확실성 때문에 보호를 강화했다고 설명하며, 평가 결과가 현실의 생물무기 개발을 증명하지는 않는다고 명시한다.(pp.129–131)[1]
① 군민 연구용 우회 플랫폼, pp.131–133
2026년 5월 고위험 바이러스 연구의 지원서 요청을 차단했고, 군 연구기관 맥락과 수십 명 연구자를 지원하는 재판매 플랫폼을 확인했다. 지역 제한과 데이터 비보존 서비스, 다중 모델 운영이 얽혀 있었다. 관련 계정·중계망을 차단하고 다른 연구소·당국에 공유했으나, 운영자는 수일 내 접근을 복구하고 수주 내 신규 신분으로 개발을 재개했다. 이후 연구 산출물은 제안서 이후의 진척을 시사하지만 이는 Anthropic의 추론이며, 실험 성공·무기화 증거는 아니다. 핵심은 한 공급자의 차단이 전체 접근 차단으로 이어지지 않는다는 점이다.[1]
② 포유류 적응 조류인플루엔자 연구, pp.133–135
수주 동안 수천 건 메시지로 연구계획·분석·편집 지원을 받은 기록이 있다. 실험자료 표시는 실제 시료 접근 가능성을 시사하지만, 관측된 계획은 초기 단계였다. 강한 모델의 보호장치 때문에 Sonnet 4·Haiku 4.5에 머물렀고, Anthropic은 지원 효과를 주로 사무·기획 수준으로 평가했다. 원문의 ‘확진 인체 사례 약 절반 사망’은 위험 배경 설명이지 이 연구의 성과나 전체 감염자의 치명률이 아니다. 전반적인 조사·차단 조치는 설명되지만 이 사례의 차단 시점은 별도로 제시되지 않는다.[1]
③ 오르토폭스바이러스 연구의 은밀한 접근, p.135
국가 연계 연구소의 고도격리시설·생바이러스 연구를 언급한 지원서를 Opus 5로 약 1시간 만에 작성했다. 중계 계정은 12명 초과 고객을 지원하며 수일에 수만 건 메시지를 처리했다. 다만 이 트래픽 전체가 해당 생물학 연구는 아니다. 약독화라는 유익한 목적 때문에 요청이 차단되지 않았다. 지원서 완성은 연구 수행·성공 증거가 아니며, 문서상 선한 목적만으로 고위험 지원의 적절성을 판단하기 어렵다는 사례다.[1]
④ 독성 펩타이드 지도·생성 연구, pp.136–137
치료제 목적의 지도·생성 연구에 유해하게 활용될 가능성이 있는 대상도 포함됐다. 국가 지원사업이라는 정보와 수출통제 대상 계열의 연관성이 우려 근거였다. 2026년 5월 지역 제한 우회로 계정이 차단됐다. 치료 목적은 명시돼 있으며 악의·실제 유해 물질 생산·성능 향상을 입증하지 않는다. 기존 분류기의 설계 범위를 넘어서는 신규 이중용도 연구가 문제다.[1]
⑤ 국가 연구사업의 독소 재설계, pp.136–137
계산 연구와 분기 보고서 작성 과정에서 사용자가 대상의 정체를 일부러 모호하게 쓰도록 요청했다. 5월 두 계정이 지역 정책 위반으로 차단됐다. 은폐 요청은 중요한 위험 신호지만 악의적 프로그램이나 실험 성공의 확증은 아니다. 기관 검증과 사업 단위 검토가 단순 내용 필터를 보완해야 한다.[1]
종합: 관련 기관의 30일 활동에서 약 35개 연구를 확인했으나 대부분은 일반 민간 과학이었다. 이 수치를 위험 연구 35건으로 읽으면 안 된다. Anthropic은 고위험 필터와 신뢰 사용자 프로그램, 계정·기관 검증, 최소한의 관측 가능성을 함께 제안한다. 본 분석상 여기에 개인정보 보호, 보존기간 제한, 오탐 이의제기를 결합해야 한다.(pp.137–138)[1]
3. 사기: GTG-15001 기만적 데이팅 앱망, pp.139–142
증거·규모: 중국 앱 스튜디오는 인간 서비스라고 광고하면서 20개 초과 앱에 AI 인격을 운영했다. 2026년 4월 2주 동안 4,700개 초과 AI 인격, 최소 25,000명 이용자, 약 236만 메시지를 관측했다. 피드 구성은 AI와 실제 사람 약 3:1이었다. 실제 노동자가 영상통화·팔로우 등 신뢰 확인을 맡고, 여러 AI 공급자가 대화·이미지·메시지 지원 역할을 분담했다.[1]
한계: 25,000명은 대화 상대 수이지 금전 피해가 입증된 피해자 수가 아니다. 총 피해액·결제자 수·운영기간 전체 규모는 없다. 표본 대화에서는 거의 모두 역할을 유지했지만, 이를 전체 메시지의 성공률로 확장하면 안 된다.[1]
조치·해석: 운영자·직원·일회용 조직 계정을 차단하고 다른 AI 연구소 및 Apple·Google에 정보를 공유했다. 개별 대화는 평범한 역할극처럼 보여 기만과 과금이 드러나지 않았다. 따라서 AI 상대임의 명확한 고지, 과금 투명성, 실제 서비스의 심사 일치 여부, 취약 이용자 보호가 필요하다. 다만 앱 삭제·환불·영구 폐쇄까지 확인됐다고 보고하지는 않는다.[1]
전체 결론: 세 장이 강하게 뒷받침하는 것은 ‘AI로 해악이 완성됐다’가 아니라, 기존 조직이 AI를 업무체계에 편입하고 접근통제를 우회한다는 관측이다. 대응 성과도 계정 차단, 지원 감소, 산출물 이전, 실제 프로그램 종료를 구분해 평가해야 한다.












