yozm.tech
피드로 돌아가기
news.hada.ioHOTAI 재작성

AMD MI355X에서 Kimi K3를 실행해 B300보다 높은 달러당 성능 달성

AMD의 최신 AI 가속기 MI355X가 2.8조 파라미터(매개변수) 대규모 언어모델(LLM) Kimi K3 추론(inference)에서 엔비디아(NVIDIA) B300 대비 뛰어난 달러당 성능을 입증했습니다. MI355X는 높은 HBM(고대역폭 메모리) 용량과 저렴한 시간당 비용을 바탕으로, 총 처리량은 다소 낮지만 비용 효율성 면에서 우위를 점하며 초대형 모델 서빙의 새로운 대안으로 떠오르고 있습니다.

17시간 전·2026.08.03·읽기 1·neo https://news.hada.io/user/neo

AMD의 MI355X AI 가속기가 2.8조 파라미터(매개변수) 규모의 초대형 언어모델(LLM)인 Kimi K3 추론(inference)에서 엔비디아(NVIDIA) B300 대비 더 높은 달러당 성능을 기록하며 주목받고 있습니다. Wafer.ai의 벤치마크 결과에 따르면, MI355X는 총 처리량(throughput) 면에서는 B300에 뒤처지지만, GPU 시간당 가격이 훨씬 저렴해 비용 효율성 측면에서 우위를 확보했습니다. 이는 고성능 AI 모델을 경제적으로 운영하려는 기업들에게 중요한 시사점을 제공합니다.

구체적으로, 8개의 AMD MI355X GPU로 구성된 단일 노드는 Kimi K3 모델을 실행하여 총 952 토큰/초(tok/s)의 처리량과 단일 스트림(single stream)에서 118 토큰/초를 달성했습니다. 반면, 엔비디아 B300은 총 1,568 토큰/초, 단일 스트림 172 토큰/초로 MI355X보다 약 1.65배 높은 총 처리량을 보였습니다. 그러나 GPU 시간당 가격을 MI355X는 2.50달러, B300은 6.00달러로 적용했을 때, MI355X는 달러당 48 토큰/초를 기록하며 B300의 33 토큰/초를 크게 앞섰습니다. MI355X는 GPU당 288GB의 높은 HBM(고대역폭 메모리) 용량을 갖춰 1.5TB가 넘는 Kimi K3의 가중치(weights)와 100만 토큰 KV 캐시(Key-Value cache)를 단일 노드에 담을 수 있었던 반면, 192GB VRAM을 가진 B200은 두 노드의 TP16(Tensor Parallelism 16) 구성이 필요해 노드 간 통신 비용이 발생했습니다. 또한, 추측 디코딩(speculative decoding)과 AITER MLA 커널 최적화를 통해 단일 스트림 성능을 약 2.2배 향상시키고 첫 토큰 도달 시간(TTFT)을 단축하는 등 소프트웨어 최적화 노력도 병행되었습니다.

이번 결과는 대규모 언어모델 시장에서 엔비디아의 독점적인 지위에 AMD가 도전할 수 있는 중요한 가능성을 보여줍니다. 특히, Kimi K3와 같이 메모리 요구량이 매우 큰 초대형 오픈소스 모델들이 증가하면서, 높은 HBM 용량을 갖춘 MI355X의 장점이 더욱 부각되고 있습니다. 이는 클라우드 서비스 제공업체나 자체 데이터센터를 운영하는 기업들이 AI 인프라를 구축할 때 비용 효율성을 최우선으로 고려하게 될 것임을 의미합니다. 또한, AMD의 ROCm 생태계 지원이 개선되고 소프트웨어 최적화가 지속된다면, 개발자들은 더 많은 선택지를 갖게 될 것이며, 이는 장기적으로 AI 가속기 시장의 경쟁을 심화시켜 전체적인 AI 인프라 비용 절감에 기여할 것으로 예상됩니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
3/10
약한 신호
3점인가

일반적인 하드웨어 성능 비교 뉴스이며, 1인 창업자가 직접 MI355X를 구매하거나 대규모 클라우드 인프라를 구축하기는 어렵습니다.

문제 / 미충족 수요

초대형 언어모델(LLM)의 높은 추론 비용과 메모리 요구사항은 모델 배포의 큰 장벽입니다.

한국 시장
국내 있음한국에서도 LLM 추론 비용 절감에 대한 니즈는 크지만, AMD GPU 인프라 구축 및 최적화 전문가는 아직 소수입니다.
수익 모델

B2B SaaS 구독, API 종량제 · 돈 내는 주체: 대규모 언어모델을 서비스하려는 클라우드 서비스 제공업체, AI 스타트업, 대기업

1인 실현 가능성
2/5

초대형 LLM을 다루는 것은 1인 창업자에게 기술적, 자본적으로 매우 어렵습니다. 하드웨어 접근성도 낮습니다.

진입 지점 (Wedge)

특정 산업 도메인에 특화된 경량화된 오픈소스 LLM을 MI355X와 같은 비용 효율적인 하드웨어에서 서빙하는 솔루션 개발.

이번 주 첫 실험

AMD ROCm 환경에서 소규모 오픈소스 LLM을 구동하고 성능 벤치마크를 수행하여 잠재적 성능 병목 지점을 파악합니다.

Original source
이 글은 news.hada.io의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기