최근 AI 업계에서 중국 연구소의 기술 혁신이 서방 기업들에게 예상치 못한 영향을 미치고 있습니다. 특히 중국 딥시크(DeepSeek) 연구소가 공개한 KV 캐시(Key-Value Cache) 최적화 기술은 대규모 언어모델(LLM)의 추론(inference) 비용을 극적으로 낮추며, 서방의 주요 AI 기업들이 이를 자사 모델에 조용히 도입하는 상황이 벌어졌습니다.
딥시크는 MLA(Multi-Layer Attention) 아키텍처를 통해 KV 캐시를 15배 압축한 데 이어, '압축 희소 어텐션(Compressed Sparse Attention)' 및 '고압축 어텐션(Heavily Compressed Attention)' 기술을 선보였습니다. 최신 DeepSeek-V4.1-Flash 모델에서는 CSA2, 교차 레이어 캐시 재사용, 인과 인코더-디코더 아키텍처, FP4 캐싱 등을 적용하여 KV 캐시 크기를 토큰당 890바이트까지 줄였습니다. 이는 DeepSeek-V1 대비 특정 장문 컨텍스트 사용 사례에서 약 437배의 캐시 공간 절감 효과를 가져왔으며, 장문 컨텍스트 모델 운영의 가장 큰 비용 중 하나인 GPU VRAM(비디오 램) 부담을 크게 덜어줍니다.
이러한 중국발 최적화 기술은 앤스로픽의 클로드 오푸스 5.5(Claude Opus 5.5)와 오픈AI의 GPT-6.1 솔(GPT-6.1 Sol) 등 서방의 최신 모델에 조용히 적용된 것으로 보입니다. 클로드 오푸스 5.5는 이전 버전 대비 캐시 읽기 비용을 60% 절감했고, GPT-6.1 솔은 GPT-5.6 솔 대비 80%의 비용 절감을 달성했습니다. 이는 GPU 접근성 제약 속에서 성능 최적화를 최우선 과제로 삼았던 중국 AI 연구소들의 노력이 결실을 맺었음을 보여주며, 손실을 겪던 서방 AI 기업들에게 일종의 '생명줄'을 던져준 셈입니다. 이로 인해 글로벌 AI 경쟁은 단순한 모델 크기 경쟁을 넘어 효율성 최적화라는 새로운 국면으로 접어들고 있습니다.
