AI가 직접 설계한 오픈소스 AI 가속기인 'openTPU' 프로젝트가 공개되어 주목받고 있습니다. 이 프로젝트는 하드웨어 설계(SystemVerilog)부터 명령어 집합(ISA), 비트 단위 시뮬레이터, 커널 언어 및 컴파일러, 그리고 실제 PCIe 카드를 구동하는 호스트 소프트웨어까지 모든 구성 요소를 하나의 작은 모노레포(monorepo)에 담고 있습니다. 이는 AI 에이전트가 하드웨어 설계를 어디까지 수행하고, 나아가 자신의 추론을 실행할 칩을 만들 수 있는지 탐구하는 실험적인 시도입니다.
openTPU는 명시적인 데이터 이동을 중심으로 설계되어 캐시나 숨겨진 스케줄링 없이 모든 연산과 대기 시간을 실행 추적(execution tracing)으로 확인할 수 있습니다. 실제 FPGA 카드(Inspur YPCB-00338)에서 LFM2.5-230M, Qwen3.5-35B 등 10종의 대규모 언어모델(LLM)을 실행했으며, 시뮬레이터와 토큰 단위로 완벽하게 일치하는 결과를 얻었습니다. 특히, 4비트 가중치(4-bit quantization)를 적용하여 토큰당 전송량을 약 3분의 1로 줄이고 일부 모델의 디코딩 속도를 40~45% 향상시키는 성과를 보였습니다. 또한, 4 GiB 메모리보다 큰 MoE(Mixture-of-Experts) 모델도 호스트 저장소에서 전문가 가중치를 스트리밍하여 성공적으로 실행했습니다.
이 프로젝트는 AI가 하드웨어 설계 영역까지 진출할 수 있음을 보여주는 중요한 이정표입니다. 기존의 복잡하고 불투명했던 AI 가속기 개발 과정을 오픈소스로 공개하고, AI가 직접 설계에 참여함으로써 하드웨어 개발의 새로운 패러다임을 제시할 수 있습니다. 개발자와 연구자들은 openTPU의 모노레포를 통해 파이썬(Python) 행렬 곱셈부터 하드웨어 배선까지 가속기의 전체 동작을 따라가며 학습할 수 있으며, 이는 AI 하드웨어 설계 분야의 교육 및 연구 활성화에도 크게 기여할 것입니다. 궁극적으로는 AI가 스스로 더 효율적인 AI를 위한 하드웨어를 설계하는 자율적인 AI 생태계 구축의 초석이 될 수 있습니다.