yozm.tech
피드로 돌아가기
Show HNHOTAI 재작성

Show HN: ExpertCache – Run the Full GPT-OSS 120B (63GB) on a 16GB M1 Pro

애플 M1 Pro 칩을 탑재한 16GB 맥북에서 63GB에 달하는 대규모 언어모델(LLM)인 GPT-OSS 120B를 구동하는 데 성공했습니다. ExpertCache라는 실험적인 런타임을 활용해 메모리 제약을 극복했으며, 이는 제한된 하드웨어에서도 대형 AI 모델 실행 가능성을 보여주는 중요한 진전입니다. 비록 속도는 느리지만, 기능적 유용성을 입증했습니다.

5시간 전·2026.08.08·읽기 1·rick_barkley

최근 ExpertCache라는 실험적인 기술을 통해 애플 M1 Pro 칩이 탑재된 16GB 메모리 맥북에서 63GB 크기의 GPT-OSS 120B 대규모 언어모델(LLM)을 성공적으로 실행하는 데 성공했습니다. 이는 일반적으로 훨씬 더 많은 메모리와 컴퓨팅 자원을 요구하는 대형 AI 모델을 개인용 기기에서 구동할 수 있음을 보여주는 중요한 기술적 성과입니다.

ExpertCache는 애플 실리콘(Apple Silicon)에 최적화된 페이지 인식(page-aware) 메탈(Metal) 런타임으로, 전체 전문가 텐서(expert tensor)를 활성 메모리(Metal working set)에 모두 로드하지 않고도 오버사이즈 희소 혼합 전문가(sparse mixture-of-experts, MoE) 체크포인트를 실행할 수 있도록 설계되었습니다. 이 기술은 모델의 일부만 필요할 때 로드하고 사용 후 해제하는 방식으로 메모리 효율성을 극대화합니다. 16GB M1 Pro 시스템에서는 0.75 토큰/초의 느린 속도를 보였지만, 64GB M1 Max 시스템에서는 5.75에서 9.80 토큰/초로 성능이 향상되었으며, 120B 모델의 기능적 유용성을 입증했습니다.

이러한 결과는 제한된 하드웨어 환경에서도 대규모 AI 모델을 활용할 수 있는 새로운 가능성을 제시합니다. 특히, 고가의 GPU 서버 없이도 개인 기기에서 복잡한 AI 작업을 수행할 수 있게 됨으로써, 개발자나 연구자들이 더 쉽게 대형 모델을 실험하고 접근할 수 있는 길이 열릴 수 있습니다. 비록 현재는 연구 단계이며 상업적 활용을 위한 속도는 아니지만, 향후 기술 발전과 최적화를 통해 온디바이스 AI(On-device AI)의 확산에 기여할 잠재력을 가지고 있습니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
4/10
보통
4점인가

기술적 난이도가 높고, 현재 속도 문제로 범용적인 상업화는 어렵지만, 특정 니즈를 가진 틈새 시장을 공략할 가능성은 있습니다.

문제 / 미충족 수요

개인용 기기에서 대규모 AI 모델을 효율적으로 실행하기 위한 메모리 및 성능 제약이 존재합니다.

한국 시장
국내 미진출 — 기회한국에서도 온디바이스 AI에 대한 관심이 높지만, 아직 이처럼 대규모 모델을 개인 기기에서 효율적으로 구동하는 솔루션은 미미합니다.
수익 모델

B2B SaaS 구독, API 종량제 · 돈 내는 주체: 제한된 환경에서 대규모 모델을 활용하려는 기업 연구팀, AI 개발자, 또는 특정 전문 분야의 개인 사용자

1인 실현 가능성
3/5

핵심 기술은 공개되어 있으나, 이를 상업적으로 활용 가능한 수준으로 최적화하고 안정화하는 데는 상당한 기술적 노력이 필요합니다. 1인 창업자가 핵심 런타임을 직접 개발하기보다는 기존 기술을 활용해 특정 니즈를 충족하는 서비스에 집중하는 것이 현실적입니다.

진입 지점 (Wedge)

특정 산업 또는 전문 분야에 특화된 소형화된 MoE 모델을 개인 기기에서 구동할 수 있도록 돕는 최적화된 런타임 및 미세조정(fine-tuning) 서비스 제공

이번 주 첫 실험

ExpertCache와 같은 기술을 활용하여 특정 도메인(예: 법률, 의료)에 특화된 소규모 MoE 모델을 M1/M2 맥북에서 구동하는 PoC(개념 증명)를 만들고 성능을 측정해봅니다.

Original source
이 글은 Show HN의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기