캐터스(Cactus)가 8MB에서 29MB에 불과한 초경량 인공지능 모델 '니들 3(Needle 3)'를 발표하며 온디바이스 AI 시장에 새로운 바람을 불어넣고 있습니다. 이 모델은 모바일, 웨어러블, 로봇, 스마트 홈 기기 등 컴퓨팅 자원이 제한적인 환경에 특화되어 설계되었으며, 일반적인 대화 기능 대신 도구 호출(tool calls)과 구조화된 데이터 추출(structured extraction)에 집중합니다. 이를 통해 딥시크 V4 플래시(DeepSeek V4 Flash)와 같은 훨씬 큰 모델과 비교해도 손색없는 성능을 보여줍니다.
니들 3의 핵심은 '인텔리전스 래더링(Intelligence Laddering)'이라는 독특한 아키텍처에 있습니다. 2개 레이어부터 20개 레이어까지 다양한 깊이의 서브 네트워크를 하나의 모델에 담아, 개발자가 필요한 성능과 크기에 맞춰 최적의 모델을 선택할 수 있도록 합니다. 예를 들어, 4개 레이어 모델은 특정 작업에 대해 딥시크 V4 플래시와 동등한 성능을 낼 수 있습니다. 또한, 텍스트 임베딩(text embedding) 기능도 내장하여 기기 내에서 검색, 매칭, 라우팅 등을 오프라인으로 처리할 수 있습니다. 이 모델은 3600억 개의 독점 구조화된 데이터셋으로 학습되었으며, 라즈베리 파이 5(Raspberry Pi 5)에서 초당 400~4000 토큰의 디코딩 속도를 자랑합니다.
니들 3는 스마트 홈 기기에서 음성 명령으로 조명을 제어하거나, 로봇에게 복잡한 청소 지시를 내리거나, 휴대폰에서 오프라인으로 사진 앨범을 만들고 파일을 검색하는 등 다양한 온디바이스 애플리케이션에 혁신을 가져올 잠재력을 가지고 있습니다. 특히, 모든 처리가 기기 내에서 이루어지므로 개인 정보 보호와 보안 측면에서 큰 이점을 제공하며, 네트워크 연결 없이도 작동한다는 점에서 사용자 경험을 크게 향상시킬 수 있습니다. 이는 클라우드 기반 AI 모델의 한계를 극복하고, 더욱 개인화되고 효율적인 AI 서비스의 확산을 가속화할 것으로 기대됩니다.