https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
https://github.com/SemiAnalysisAI/InferenceX
2026.8.24
[AgentX - InferenceXv3: Does CUDA Moat Hold up in Agentic Inferencing?]
이 보고서는 2025년 'Claude Code' 출시 이후 급격히 증가한 에이전트 중심의 추론 워크로드를 효과적으로 측정하기 위한 새로운 오픈 소스 벤치마크인 AgentX 1.0을 소개합니다. 기존의 단순한 일회성 응답 측정 방식에서 벗어나, 100만 토큰에 달하는 긴 문맥 유지, 멀티턴 대화, 그리고 빈번한 KV 캐시 재사용과 같은 실제 운영 환경의 복잡한 시스템 문제를 해결하는 데 초점을 맞추고 있습니다. 본문은 NVIDIA와 AMD의 최신 하드웨어 성능을 상세히 비교 분석하며, 특히 에이전트 워크로드에서는 단순한 칩의 연산력을 넘어 분산 시스템의 효율적인 스케줄링과 메모리 계층 간의 데이터 전송 최적화가 필수적임을 강조합니다. 결과적으로 이 프로젝트는 수많은 오픈 소스 기여와 협업을 통해 AI 하드웨어 및 소프트웨어 성능 측정의 새로운 표준을 제시하고 업계 전반의 최적화를 가속화하는 것을 목적으로 합니다.
AgentX는 기존의 8k 입력 토큰과 1k 출력 토큰으로 구성된 단일 턴 트래픽 대신 에이전트 코딩 트래픽을 사용하여 벤치마크 시나리오를 개선합니다.
전체 매트릭스는 MI355X, GB300 NVL72, GB200 NVL72, B300, B200, MI325, MI300X, H200 및 RTX Pro 서버를 포함한 1,000개 이상의 칩에 걸쳐 지속적으로 작동하는 약 2MW의 컴퓨팅 성능으로 구동됩니다.

1단계 — 발표 배경과 목적
문서는 Claude Code 등장(2025년 11월) 이후 에이전틱(장기 대화·툴콜) 트래픽이 프로덕션 추론 트래픽의 주류가 되었다는 문제의식에서 출발합니다. 기존 InferenceX 벤치마크가 써온 "고정 시퀀스 길이"(8k1k, 1k1k 등) 방식은 실제 워크로드—멀티턴, 긴 컨텍스트, 높은 프리픽스 재사용, 서브에이전트 버스트, KV캐시 오프로드—를 반영하지 못한다고 지적하며, 이를 보완하기 위해 AgentX라는 새 시나리오를 추가했다고 설명합니다.
2단계 — 에이전틱 워크로드의 4가지 특성
문서는 에이전틱 워크로드를 다음 4가지로 정의합니다.
- 멀티턴: 챗봇 대비 수십~수백 회의 사용자-어시스턴트 상호작용
- 긴 컨텍스트: 시스템 프롬프트·툴 정의·누적 대화로 컨텍스트가 빠르게 증가
- 높은 프리픽스 재사용: 턴이 진행될수록 캐시된 입력 비율이 1에 수렴
- 서브에이전트 버스트: 짧게 생성되는 하위 에이전트들이 불규칙한 KV캐시 패턴을 유발
3단계 — 테스트 인프라 규모
전체 매트릭스는 약 2메가와트 규모로 지속 가동되는 1,000개 이상의 칩에서 실행되며, MI355X·GB300 NVL72·GB200 NVL72·B300·B200·MI325·MI300X·H200·RTX Pro 서버 등 폭넓은 SKU를 포함합니다. Rubin은 "이달 중"(2026년 8월), TPU와 MI455X UALoE72는 "연내" 합류 예정이라고 명시합니다. ServeTheHome
4단계 — 데이터셋 구축 및 익명화 방법론
- Claude Code / Codex 트래픽을 가로채는 프록시를 자체 구축, 누적 8,000개 이상의 세션, 340만 건의 요청, 6,100억 토큰, 총 300만 달러 상당의 스펜드를 수집했으며 이 중 393개 세션 서브셋을 AgentX v1.0으로 공개
- 개인정보 보호를 위해 요청 콘텐츠를 64토큰 블록 단위로 토큰화한 뒤 세션 단위 체이닝 해시로 치환 → 프리픽스 매칭 패턴은 보존하되 원문 내용은 제거
- 리플레이는 Nvidia의 AIPerf 포크를 사용, DAG(방향성 비순환 그래프) 구조로 메인 에이전트/서브에이전트/보조(auxiliary) 요청 간 선후 관계를 재현
- ISL(입력 길이) 중앙값 142k 토큰, OSL(출력 길이) 중앙값 444 토큰, 턴 간 지연(툴 사용 시간) 중앙값 3.84초
5단계 — 모델별 성능 결과 하이라이트
문서가 다루는 5개 모델(DeepSeek V4 Pro, Kimi K3, MiniMax M3, Qwen3.5, GLM 5.3)에 대해 Nvidia와 AMD를 비교합니다. 대표적으로 B300/B200과 MI355X의 KV캐시 활용 차이를 보면:

















'07.AI > 12. AI 모델' 카테고리의 다른 글
| LLM - 오픈 웨이트(Open Weight) - 폐쇄형(프론티어) 모델과의 격차 (0) | 2026.08.23 |
|---|---|
| LLM 추론 최적화 - 추론 클라우드 (0) | 2026.08.21 |
| LLM 추론 최적화 - Tensordyne, 로그 수학(Logarithmic Math) 기반의 추론 시스템 (0) | 2026.08.20 |
| LLM - Leanstral : Lean 4용 범용 코드 에이전트 모델 시리즈 (0) | 2026.08.17 |
| 시각-추론 모델 - BDH-CQ: 순환 잠재 추론을 이용한 맥락 내 학습 (In-Contect Learning) (0) | 2026.08.17 |


