AI가 스스로 하드웨어 가속기를 설계한 오픈소스 프로젝트 'OpenTPU'가 공개되어 기술 커뮤니티의 주목을 받고 있습니다. 이 프로젝트는 하드웨어 설계 언어(RTL)부터 명령어 세트(ISA), 시뮬레이터, 컴파일러, 프로파일러까지 AI 에이전트가 직접 개발한 것이 특징입니다. OpenTPU는 AI가 하드웨어 설계의 한계를 어디까지 확장할 수 있는지, 그리고 AI가 자신을 구동할 칩을 직접 만들 수 있는지에 대한 질문에 답하고자 시작되었습니다.
OpenTPU는 Xilinx Kintex-7 FPGA 카드(Inspur YPCB-00338)에서 Qwen3, LFM2.5, Qwen3.5 등 다양한 경량 언어모델(LLM)을 성공적으로 구동하며 그 성능을 입증했습니다. 특히, 4비트 양자화 모델의 경우 LFM2.5-230M에서 초당 85.8토큰(tok/s)의 디코딩 속도를 기록했으며, 이는 DRAM 대역폭의 82%를 활용하는 효율적인 성능입니다. 이 프로젝트는 하드웨어 설계(SystemVerilog), 명령어 세트, 시뮬레이터, 커널 언어 및 컴파일러, 그리고 실제 PCIe 카드를 구동하는 호스트 소프트웨어까지 전체 가속기 스택이 하나의 모노레포(monorepo)에 담겨 있어, AI 가속기의 작동 원리를 처음부터 끝까지 학습하려는 이들에게 훌륭한 자료가 될 수 있습니다.
OpenTPU의 등장은 AI가 단순 소프트웨어 개발을 넘어 하드웨어 설계라는 복잡하고 전문적인 영역까지 진출할 수 있음을 보여주는 중요한 사례입니다. 이는 미래에는 AI가 AI 칩을 직접 설계하고 최적화하는 'AI 기반 하드웨어 자율 설계' 시대가 올 수 있음을 시사합니다. 또한, 오픈소스 형태로 전체 스택이 공개됨으로써, AI 가속기 연구 및 개발에 대한 진입 장벽을 낮추고 관련 기술 발전을 가속화할 것으로 기대됩니다. 이는 특히 비용 효율적인 AI 추론 솔루션을 필요로 하는 스타트업이나 연구 기관에 새로운 가능성을 열어줄 것입니다.