https://insights.trendforce.com/p/why-csps-are-turning-to-qlc-ssds
2026.9.24
[Why CSPs Are Turning to QLC SSDs for KV Cache Storage]
이 자료는 AI 서비스가 학습에서 추론 중심으로 변화함에 따라 발생하는 메모리 계층 구조의 혁신과 그에 따른 QLC SSD의 도입 배경을 설명합니다. AI 모델의 연산 과정에서 데이터 재계산을 방지하기 위해 사용되는 KV 캐시(KV Cache)의 용량이 급격히 늘어나면서, 고비용의 HBM 대신 이를 효율적으로 보관할 저렴하고 방대한 저장 공간이 필요해졌습니다. 이에 따라 업계는 기존의 TLC SSD와 HDD 조합을 넘어, 로컬 드라이브와 공유 저장소 사이에 SSD POD라는 새로운 계층을 배치하여 대규모 데이터를 처리하는 전략을 취하고 있습니다. 결국 이 텍스트는 에이전트 중심 AI(Agentic AI) 시대에 적합한 데이터 처리 효율성을 확보하기 위해 왜 클라우드 서비스 제공업체들이 QLC 기반 저장 장치로 눈을 돌리고 있는지 그 기술적 필연성을 강조하고 있습니다.
왜 QLC인가
추론의 prefill 단계에서 생성된 KV 캐시는 decode 중 재사용됩니다. 문맥 길이와 동시 요청·에이전트 수가 늘면 필요한 캐시 용량도 커집니다. HBM은 빠르지만 용량과 비용에 제약이 있어, 당장 연산에 쓰지 않는 캐시를 DRAM·로컬 SSD 또는 SSD POD(여러 SSD 랙으로 구성한 별도 계층)로 내려 보관하고 필요할 때 다시 가져오는 설계가 등장했습니다.[1][4][6]
TrendForce가 제시한 기존 SSD POD 조합은 TLC SSD + HDD입니다. 여기에 QLC를 넣는 이유는 높은 저장 밀도와 용량당 비용입니다. 특히 캐시를 한 번 기록한 뒤 여러 번 읽어 재사용하는 패턴이라면 QLC의 쓰기 내구성 약점을 완화할 수 있다는 것이 TrendForce의 논리입니다. 압축 기법으로 저장량과 쓰기 횟수를 줄일 수 있다는 주장도 공개 보고서 초록에 있습니다.[1][5]
기술적으로 주의할 점
QLC에 모든 KV 캐시를 두고 매 토큰마다 읽는다는 뜻은 아닙니다. NVIDIA가 설명하는 계층에서도 활성 생성에 필요한 ‘뜨거운’ KV는 GPU HBM에, 재사용할 문맥은 하위 계층에 둡니다. 따라서 성능의 관건은 SSD의 명목 용량보다 캐시 적중·사전 적재, GPU까지의 전송 지연, 네트워크 대역폭입니다. 하위 계층에서 제때 가져오지 못하면 GPU가 기다리게 됩니다.[6]
또한 “한 번 쓰고 여러 번 읽는다”는 워크로드 가정이지 모든 서비스의 보장된 특성이 아닙니다. 대화·에이전트 세션의 실제 재사용률이 낮거나 캐시 교체·재기록이 잦으면 QLC의 경제성과 내구성 이점이 줄어듭니다. 도입 판단에는 평균치보다 재사용률, 쓰기량과 SSD 수명, 캐시 미스 시 지연, 실제 비용/token을 함께 측정해야 합니다.[5][6]
시장 해석
TrendForce의 2026년 9월 보도자료는 미국 CSP의 기업용 SSD 수요 전망 상향과 QLC 수요 확대를 전하고, 중국에서는 DeepSeek 계열 아키텍처가 KV 캐시 오프로딩용 고용량 QLC SSD 채택을 촉진한다고 설명합니다.[2] 다만 이를 모든 CSP가 QLC SSD POD로 전환했다는 증거로 확대하면 안 됩니다. TrendForce의 별도 공개 자료는 HDD 부족이 QLC 검토를 촉진하지만, 가격·공급능력·소프트웨어 조정과 TCO가 대규모 채택의 제약이라고도 명시합니다.[3]
결론: QLC SSD의 기회는 ‘더 싼 SSD’ 자체보다, 재사용 가능한 KV 캐시를 HBM 밖에서 충분히 빠르고 경제적으로 공급하는 설계에 있습니다. 투자·조달 관점에서는 QLC 출하 전망만 볼 것이 아니라 실제 CSP 구매 확인, 가격 차이, 캐시 재사용률 및 추론 성능 실측을 구분해 봐야 합니다. 유료 본문의 구매 기업·수치·비용 비교는 확인 전까지 단정할 수 없습니다.[1][2][3][5]
Sources
[1] TrendForce, 요청하신 Substack 글—공개 구간
[2] TrendForce, 2026-09-21 기업용 SSD 수요 보도자료
[3] TrendForce, AI 추론·QLC SSD 수요 보고서 공개 소개
[4] TrendForce, 추론 시대 메모리 계층 설명
[5] TrendForce, QLC SSDs Rise 보고서 공개 초록·목차
[6] NVIDIA, CMX 컨텍스트 메모리 저장 계층 기술 설명











'07.AI > 10. AI 반도체' 카테고리의 다른 글
| AI 반도체 - EPOCH AI, 화웨이와 엔비디아의 연간 연산 공급량 격차 (0) | 2026.09.26 |
|---|---|
| AI 반도체 - Semianalysis, 중국 AI 인프라 폭발 (0) | 2026.09.26 |
| AI 반도체 - HBM을 넘어선 3D-DRAM: AI 추론 가속기의 메모리 병목을 풀 수 있을까? (0) | 2026.09.23 |
| AI 반도체 - TrendForce, eSSD 수요가 낸드(NAND) 공급을 재편하다 (0) | 2026.09.22 |
| AI 반도체 - Semianalysis, MoE 모델을 추론 하드웨어에 매핑하기 (0) | 2026.09.22 |


