카투스 컴퓨트(Cactus Compute)가 모바일, 웨어러블, 로봇, 스마트 홈 기기 및 마이크로컨트롤러 등 저사양 환경에 최적화된 초경량 음성 인식 모델 '휘슬(Whistle)'을 발표했습니다. 단 16.9MB의 파일 크기로, 별도의 의존성 없이 CPU에서 직접 실행되며, 기존 니들(Needle) 모델과 동일한 C++ 엔진을 공유하여 효율성을 극대화했습니다. 이 모델은 기기 내(on-device)에서 7개 언어의 음성을 텍스트로 변환하고, 단어별 타임스탬프 및 음성 임베딩까지 제공합니다.
휘슬은 영어, 독일어, 프랑스어, 스페인어, 이탈리아어, 네덜란드어, 폴란드어 등 7개 언어를 지원하며, 최대 30초 길이의 16kHz 모노 오디오를 한 번에 처리합니다. 언어를 지정하지 않아도 자동으로 감지하는 기능을 갖추고 있습니다. 특히, 첫 토큰 생성까지 단 11.1ms가 소요되며, 초당 1,319 토큰을 디코딩하는 압도적인 속도를 보여줍니다. 이는 오픈AI(OpenAI)의 위스퍼 베이스(Whisper base) 모델(145.3MB, 73.2ms, 266 토큰/초)과 문샤인 타이니 v2(Moonshine tiny v2) 모델(41.9MB, 22.8ms, 262 토큰/초) 대비 월등히 뛰어난 성능입니다. 모든 처리가 사용자 기기 내에서 이루어지기 때문에 개인 정보 유출 우려 없이 안전하게 사용할 수 있다는 점도 큰 장점입니다.
휘슬의 등장은 제한된 자원을 가진 엣지(edge) 기기에서의 음성 인식 기술 활용 가능성을 크게 확장할 것으로 기대됩니다. 기존 대규모 모델들이 클라우드 기반 처리를 요구하거나 높은 하드웨어 사양을 필요로 했던 것과 달리, 휘슬은 스마트폰, 스마트워치, 임베디드 시스템 등 다양한 소형 기기에서 실시간 음성 비서, 음성 명령 제어, 오프라인 받아쓰기 등의 기능을 구현할 수 있게 합니다. 이는 사용자 경험을 향상시키고, 네트워크 연결이 불안정한 환경에서도 안정적인 서비스를 제공할 수 있는 기반을 마련해, 온디바이스 AI(On-device AI) 시대의 중요한 진전으로 평가됩니다.