yozm.tech
피드로 돌아가기
arXiv (cs.AI)HOTAI 재작성

Where Should the KV Cache Live? Placement Policies Across GPU, CPU, and SSD for Long-Lived Sessions

대규모 언어모델(LLM)의 긴 세션 처리 시 GPU 메모리 부족 문제를 해결하기 위해 KV 캐시를 GPU, CPU, SSD 등 여러 계층에 분산 저장하는 연구가 진행되었습니다. 새로운 연구는 캐시 배치 정책보다는 계층별 용량 확장이 동시 세션 수와 비용 절감에 더 큰 영향을 미친다고 밝히며, 특정 워크로드에 맞는 정책이 데이터 이동을 줄일 수 있음을 제시합니다.

5시간 전·2026.09.16·읽기 1·Srikanta Datta Tumkur, Jay Iyer, Mehar Simhadri, Sai Pavan Kumar, Sai Kapil Kumar, Ramesh Nampelly

대규모 언어모델(LLM)이 챗봇, 에이전트 루프, 문서 질의응답 등 긴 대화 세션을 처리할 때, 핵심 병목 중 하나는 키-값(KV) 캐시가 GPU의 고대역폭 메모리(HBM)를 과도하게 소비한다는 점입니다. GPU HBM은 비싸고 용량이 제한적이어서, 많은 시스템들이 이 문제를 해결하기 위해 KV 캐시를 CPU DRAM이나 SSD까지 확장하여 사용하고 있습니다. 하지만 어떤 데이터를 어느 계층에 저장하고, 언제 이동시키거나 삭제할지, 그리고 미리 가져오기(prefetching)가 도움이 되는지에 대한 명확한 답은 없었습니다.

최근 연구는 GPU HBM, CPU DRAM, SSD를 아우르는 이산 이벤트 시뮬레이터를 통해 다양한 KV 캐시 배치 정책의 효과를 분석했습니다. 연구팀은 최근성(recency), 재사용 빈도(reuse frequency), 예측된 재사용(predicted reuse), EWMA(지수 가중 이동 평균) 예측기 등 여러 정책을 챗봇, 에이전트, 문서 질의응답 워크로드에 적용하여 비교했습니다. 흥미롭게도, 캐시 배치 정책 자체보다는 GPU, CPU, SSD의 계층별 용량을 1:8:64 비율로 확장하는 것이 훨씬 더 큰 효과를 보였습니다. 이러한 계층화 전략은 GPU당 동시 세션 수를 73.02배 증가시키고, 세션당 비용을 62.04배 절감하는 결과를 가져왔습니다.

이번 연구는 디코딩(decode) 과정이 배치 크기(batch size) 1에서는 연산(compute) 병목에 걸리기 때문에, 캐시 배치 정책이 전체 처리량(throughput)에 미치는 영향은 미미하다고 지적합니다. 대신 정책은 주로 PCIe 데이터 이동량과 첫 토큰 생성 시간(time to first token)에 영향을 주었습니다. 예를 들어, 챗봇 워크로드에서는 최근성 정책이 재사용 빈도 정책보다 데이터 이동량을 2.30배 줄였지만, 에이전트 및 문서 질의응답에서는 재사용 빈도 정책이 가장 좋은 성능을 보였습니다. 또한, 미리 가져오기(prefetching)는 대역폭 비용을 정당화할 만큼의 이점을 제공하지 못하는 것으로 나타났습니다. 이 연구 결과는 LLM 서비스 제공자들이 KV 캐시 관리에 있어 정책 최적화보다는 메모리 계층 구조의 용량 확장에 우선순위를 두는 것이 더 효과적일 수 있음을 시사합니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
4/10
보통
4점인가

이 연구는 LLM 인프라 최적화의 중요한 부분을 다루지만, 실제 솔루션 구현은 복잡하고 대규모 시스템 지식이 필요하여 1인 창업자가 진입하기에는 난이도가 높습니다.

문제 / 미충족 수요

LLM의 긴 세션 처리 시 GPU 메모리 부족과 KV 캐시 관리의 비효율성으로 인해 동시 세션 수와 비용 효율성이 저해됩니다.

한국 시장
국내 있음국내에서도 LLM 도입이 활발해지면서 GPU 자원 효율화에 대한 니즈가 커지고 있으나, 아직 KV 캐시 최적화 전문 솔루션은 드뭅니다.
수익 모델

B2B SaaS 구독 · 돈 내는 주체: LLM을 활용하여 대규모 서비스를 운영하는 기업, 클라우드 서비스 제공업체

1인 실현 가능성
3/5

이론적 연구를 실제 시스템에 적용하려면 상당한 시스템 프로그래밍 및 최적화 역량이 필요하며, 1인 창업자가 모든 계층을 다루기는 어렵습니다.

진입 지점 (Wedge)

특정 산업(예: 법률, 의료)에 특화된 LLM 에이전트의 KV 캐시 최적화 서비스 제공

이번 주 첫 실험

LLM을 활용하는 국내 기업들을 대상으로 KV 캐시 효율성 관련 페인포인트 설문조사 및 인터뷰 진행

Original source
이 글은 arXiv (cs.AI)의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기