반응형

ttps://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

2026.7.17
[How Far Behind the Frontier are Leading Open Weight Models on Cyber?]

이 보고서는 인공지능 안전 연구소(AISI)가 실시한 조사를 바탕으로, 오픈 웨이트(open weight) 모델과 폐쇄형 최첨단 모델 사이의 사이버 보안 능력 격차가 점차 좁혀지고 있다는 사실을 명확히 보여줍니다. 연구 결과에 따르면 최신 오픈 모델인 GLM-5.2 등은 이전의 6~10개월 수준이었던 격차를 4~7개월 수준으로 단축하며 선두 모델을 빠르게 추격하고 있습니다. 이러한 기술적 근접성은 오픈 모델이 제공하는 혁신과 협업의 이점에도 불구하고, 안전장치 무력화 및 영구적인 오용 위험이라는 심각한 보안 과제를 동시에 던져줍니다. 결국 이 텍스트는 사이버 방어자들이 최첨단 인공지능 능력이 보편화되기 전까지 대비책을 마련할 수 있는 준비 시간이 줄어들고 있음을 경고하며 선제적인 대응을 촉구하고 있습니다.

 

 

 

배경 및 개요

AISI는 2023년부터 프론티어 AI 모델의 사이버 역량을 추적해왔으며, 지금까지 가장 역량이 뛰어난 모델은 일관되게 비공개 가중치(closed weight) 모델이었고, 오픈 가중치(open weight) 모델은 항상 뒤처져 있었다는 것을 확인했습니다.

오픈 가중치 모델의 장점: 비공개로 호스팅 가능해 데이터가 제공사로 돌아가지 않고, 특정 작업에 맞게 조정 가능하며, 컴퓨팅 비용만으로 운영 가능하고, 제공사가 임의로 변경·폐기할 수 없는 안정적인 기반을 제공하며, 개방형 협업·혁신과 일부 안전 연구를 가능하게 한다는 이점이 있습니다.

위험 요소: 반면 이런 개방성 때문에 오용 탐지·차단, 취약점 대응, 사용자 접근 통제, 모델 회수 등 비공개 모델 개발사가 쓸 수 있는 안전장치 대부분을 적용할 수 없고, 한 번 공개되면 이런 옵션은 영구히 사라져 안전장치가 제거되거나 사본이 무단 배포·실행될 수 있다는 점에서 지속적이고 되돌릴 수 없는 오용 위험을 만듭니다.

격차가 중요한 이유: 이 격차는 방어자들이 최신 비공개 모델의 역량을 보고 대비할 수 있는 '준비 시간'을 제공하기 때문입니다. 2026년 4월 Mythos Preview와 GPT-5.5 두 비공개 모델이 AISI가 관측한 것 중 가장 큰 폭의 사이버 역량 도약을 보여주며 국제적 경고를 촉발했습니다.

핵심 결론: 2026년 6월 출시된 GLM-5.2가 테스트 시점 기준 가장 사이버 역량이 뛰어난 오픈 가중치 모델이었으며, 협의의 사이버 과제에서는 Opus 4.6과, 장기 사이버 레인지에서는 Opus 4.5와 유사한 성능을 보여 프론티어보다 4~7개월 뒤처진 것으로 나타났다. 이는 2025년 대부분 기간 측정된 6~10개월 격차보다 좁혀진 것입니다.

결과: 오픈 웨이트 AI의 현재 사이버 격차

협의의 사이버 과제는 4단계 난이도에 걸쳐 특정 사이버 기술을 평가하고, 사이버 레인지는 시뮬레이션 네트워크에서 장기·다단계 사이버 공격을 자율적으로 계획·수행하는 능력을 평가합니다. 테스트 대상은 출시 시점 오픈 가중치 사이버 역량을 선도할 후보였던 GLM-5.2와 DeepSeek V4-Pro였으며, Kimi K3는 가중치가 공개되는 대로(7월 말 예정) 같은 방식으로 테스트할 예정이라고 밝혔습니다.

협의의 사이버 과제 (Narrow cyber tasks)

이 과제는 '기술적 비전문가' 수준부터 '전문가' 수준까지 난이도를 나누며 취약점 연구·공격, 리버스 엔지니어링, 웹 공격, 암호학 등 여러 영역을 다룹니다. GLM-5.2는 4개월 전 출시된 Opus 4.6, GPT-5.3-Codex와 전 난이도에서 비슷한 성능을 보였고, DeepSeek V4-Pro는 5개월 전 출시된 Opus 4.5와 유사했습니다. 단, 이 결과가 최근 Mythos Preview·GPT-5.5가 보인 급격한 도약을 향후 오픈 모델도 재현할 것이라 예측하는 것은 아닙니다.

사이버 레인지 (Cyber ranges)

사이버 레인지는 초기 네트워크 접근 지점부터 시작하는 순차적 공격 체인으로 구성된 전문가 제작 시뮬레이션 환경이며, 실제 방어 환경에 있는 능동적 방어자나 경보 페널티는 없습니다. 대표 레인지인 "The Last Ones"는 4개 서브넷, 약 20개 호스트로 구성된 32단계 기업 네트워크 공격이며 인간 전문가 기준 약 20시간이 소요될 것으로 추정됩니다.

이 레인지에서 GLM-5.2는 7개월 전 출시된 Opus 4.5 수준까지 도달했고, DeepSeek V4-Pro는 서브프론티어 모델인 Sonnet 4.5(7개월 전 출시)에도 못 미쳤습니다. 이 격차는 협의 과제보다 크지만, 레인지 수가 적어 근거로서는 상대적으로 약하다고 AISI는 평가했습니다.

현실적 제약 (Real-world constraints)

안전장치: 오픈 가중치 배포는 모니터링·분류기·사용자 차단 같은 배포 단계의 안전 조치를 적용할 수 없게 만들며, 남아있는 거부 훈련조차 가중치 접근 시 쉽게 되돌릴 수 있습니다. 실제 테스트에서 안전장치가 실질적 방해가 되지 않았고, DeepSeek V4-Pro가 리버스 엔지니어링 일부 과제를 거부했지만 몇 차례 재시도로 우회되었습니다.

비용 대비 성능: 1억 토큰짜리 사이버 레인지 실행 비용은 Opus 4.5/4.6이 약 85달러인 반면 GLM-5.2는 약 46달러, DeepSeek V4-Pro는 단 1.19달러였습니다. 100% 성공률로 해결된 과제 기준 1건당 비용은 Opus 4.6 15.17달러 대 GLM-5.2 6.12달러, Opus 4.5 12.50달러 대 DeepSeek V4-Pro 0.28달러였습니다.

테스트의 한계: 별도의 엘리시테이션이나 최적화를 시도하지 않았기에 오픈 모델의 최대 역량을 다소 과소평가했을 가능성이 있으며, 이 글은 사이버 역량만 다루므로 다른 역량에 대한 추론은 불가합니다.

 

결론

최근 오픈 가중치 모델은 프론티어 비공개 모델보다 사이버 역량이 4~7개월 뒤처지며, 이는 2025년 대부분 기간의 6~10개월보다 좁혀진 격차입니다. 이는 오늘날의 프론티어 사이버 역량이 동일한 안전장치 없이 접근 가능해지기 전, 방어자들이 대비할 수 있는 시간이 짧아졌음을 의미합니다. 완벽한 해법은 없지만, 모델 학습·안전장치·감사·접근 통제 등 여러 전략을 병행하면 위험을 유의미하게 줄일 수 있으며, AISI는 Kimi K3를 포함한 선도 오픈 모델을 계속 평가할 계획입니다. 


[보완 내용]

① Kimi K3 후속 평가 결과 (본문 게시 이후 실제로 나온 업데이트)

본문은 "Kimi K3는 가중치 공개 후 테스트 예정"이라고만 언급했는데, 실제로 그 사이에 진전이 있었습니다. 2026년 7월 23일 UK AISI와 미국 CAISI(NIST 산하)가 Kimi K3의 사이버 공격 역량을 측정한 공동 평가 결과를 발표했습니다. Kimi K3는 ExploitBench 기준 종합 사이버 역량 점수 32.2%를 기록해, 익명 처리된 미국 상위 모델 평균 76.2%에 크게 못 미쳤습니다. "The Last Ones" 32단계 공격 시나리오에서는 평균 17단계까지 도달해 최상위 모델(28.5단계)에 못 미쳤지만, 오픈 가중치 모델 중 최고였던 GLM-5.2는 앞질렀습니다. 다만 10회 시도 중 1회는 100M 토큰 한도 내에서 이 레인지를 완전히 성공시켜, 초기 접근 권한이 주어지면 방어가 약한 소규모 기업 시스템을 자율적으로 공격할 능력이 있음을 보여줬습니다. 안전 측면에서는 Kimi K3의 가드레일이 공격 코드 개발이나 공격 시도 자체를 막지는 못한 것으로 보고되어, 본문이 지적한 "오픈 모델은 안전장치가 쉽게 무력화된다"는 우려를 그대로 재확인한 셈입니다.

② 방법론에 대한 커뮤니티 비판 (참고용)
일부 실무자들은 AISI의 사이버 평가가 토큰을 많이 소모하는 특이한 모델의 역량을 과소평가하는 경향이 있으며, GLM-5.2 때도 100M 토큰 한도에 도달해 점수가 포화되기 전에 평가가 끝났을 가능성을 지적했습니다. 이는 공식 검증된 내용은 아니지만, 본문의 "설정상 최대 역량을 과소평가했을 수 있다"는 한계 인정과 같은 맥락이라 함께 참고할 만합니다.

 

728x90
반응형
Posted by Mr. Slumber
,