반응형

https://developer.nvidia.com/blog/co-designing-ai-model-attention-for-fast-interactive-long-context-inference

2026.7.31
[Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference]

이 기술 블로그는 AI 모델의 어텐션 구조를 하드웨어 특성에 맞춰 설계함으로써 추론 속도와 상호작용성을 극대화하는 공동 설계(Co-design) 전략을 제시합니다. 주요 내용은 그룹 크기, 헤드 차원, 시퀀스 길이라는 세 가지 핵심 변수가 연산 위주의 프리필(Prefill) 단계와 메모리 대역폭에 민감한 디코드(Decode) 단계에 각각 어떤 영향을 미치는지 분석합니다. 저자들은 GPU 효율을 높이기 위해 그룹 크기를 키워 디코드 효율을 확보하고, 하드웨어 정렬에 최적화된 128 또는 256의 헤드 차원을 사용할 것을 권장합니다. 최종적으로는 KV 캐시 압축과 하드웨어 구조에 정렬된 병렬화 전략을 통해 긴 문맥을 처리할 때 발생하는 성능 저하를 해결하는 실질적인 가이드를 제공합니다.

 

  • 밀집 어텐션 성능은 그룹 크기(KV 헤드당 쿼리 헤드 수), 헤드 차원 및 시퀀스 길이에 따라 결정되며, 각 요소는 사전 채우기(계산 집약적) 및 디코딩(메모리 집약적) 단계에 서로 다른 영향을 미칩니다. 산술 강도 및 GEMM 형태 분석 결과, 디코딩 효율성은 그룹 크기에 비례하는 반면, 사전 채우기는 시퀀스 길이에 의해 좌우되는 것으로 나타났습니다.

  • NVIDIA 하드웨어에서 최적의 추론 처리량과 GPU 활용률을 얻으려면 디코딩 시 그룹 크기($G$)를 높게 설정하고, GPU 타일 및 메모리 정렬에 맞추기 위해 헤드 차원을 128 또는 256으로 설정하고, 캐시 압축, 희소/슬라이딩 윈도우 어텐션 또는 하이브리드 아키텍처(예: NVIDIA Nemotron 3)를 통해 유효 KV 상태를 최소화하십시오.

  • 병렬 처리 전략은 KV 헤드 수에 따라 결정되어야 합니다. KV 중복을 방지하기 위해 텐서 병렬 처리(TP)는 KV 헤드 수(KH)를 초과해서는 안 되며, KV 헤드 수가 적은 모델은 TensorRT-LLM에 구현된 것처럼 어텐션 데이터 병렬 처리(ADP), KV 병렬 처리(KVP) 또는 하이브리드 접근 방식(Wide EP, Helix Parallelism)을 사용해야 합니다.

 

 

 

728x90
반응형
Posted by Mr. Slumber
,