16.9MB의 놀랍도록 작은 크기를 가진 새로운 온디바이스 음성 인식 모델 '휘슬(Whistle)'이 공개되어 주목받고 있습니다. 이 모델은 별도의 의존성 없이 CPU에서 직접 실행되며, 영어, 독일어, 프랑스어 등 7개 언어의 음성을 기기 내에서 텍스트로 변환할 수 있습니다. 특히 애플 M4 Pro CPU에서 10초 오디오를 처리하는 데 첫 토큰까지 단 11.1ms, 이후 초당 1,319토큰의 빠른 디코딩 속도를 보여주어, 기존 모델 대비 압도적인 성능을 자랑합니다.
휘슬은 전사(transcription) 기능 외에도 각 단어의 시작과 종료 시각, 확률을 제공하는 단어별 타임스탬프, 그리고 전사 없이 음성 특징을 추출하는 음성 임베딩(embedding) 기능을 지원합니다. 16kHz 모노 오디오를 최대 30초까지 한 번에 처리하며, 언어를 지정하지 않아도 자동으로 감지합니다. 모델은 '니들(Needle)'과 동일한 컨테이너 형식, 양자화 방식, C++ CPU 엔진을 사용하여 최적화되었으며, 모바일, 웨어러블, 로봇, 스마트홈, 자동차 등 다양한 엣지 디바이스에 적용될 수 있도록 설계되었습니다. 브라우저에서도 마이크 사용 시 모델을 다운로드하여 오디오가 기기를 벗어나지 않고 처리되는 안전한 방식을 제공합니다.
휘슬의 등장은 엣지 디바이스에서의 음성 인식 기술 활용 가능성을 크게 확장할 것으로 보입니다. 모델 크기가 작아 CPU L3 캐시 안에 상시 로드하여 사용할 수 있어, 저전력 환경에서도 실시간에 가까운 음성 처리가 가능해집니다. 이는 개인 정보 보호가 중요한 온디바이스 AI 애플리케이션 개발에 유리하며, 네트워크 연결 없이도 작동하는 독립적인 음성 비서, 스마트 기기 제어, 음성 메모 앱 등 다양한 서비스에 적용될 수 있습니다. 특히, 기존 대규모 모델들이 가진 리소스 제약을 극복하며 더 많은 기기에서 AI 음성 기술을 활용할 수 있는 길을 열었다는 점에서 의미가 큽니다. 휘슬은 허깅 페이스(Hugging Face)에서 모델 가중치를, 깃허브(GitHub)에서 소스 코드를 공개하여 개발자들이 쉽게 접근하고 활용할 수 있도록 지원하고 있습니다.