yozm.tech
피드로 돌아가기
news.hada.ioHOTAI 재작성

Whistle - 16.9 MB로 구현한 음성 텍스트 변환

새로운 온디바이스 음성 인식 모델 '휘슬(Whistle)'이 공개되었습니다. 단 16.9MB의 초소형 크기로 CPU에서 독립적으로 실행되며, 7개 언어를 지원해 기기 내에서 음성을 텍스트로 변환합니다. 애플 M4 Pro CPU에서 10초 오디오를 11.1ms 만에 처리하는 빠른 속도를 자랑하며, 전사, 단어별 타임스탬프, 음성 임베딩 기능을 제공합니다.

5시간 전·2026.10.08·읽기 1분·neo https://news.hada.io/user/neo

16.9MB의 놀랍도록 작은 크기를 가진 새로운 온디바이스 음성 인식 모델 '휘슬(Whistle)'이 공개되어 주목받고 있습니다. 이 모델은 별도의 의존성 없이 CPU에서 직접 실행되며, 영어, 독일어, 프랑스어 등 7개 언어의 음성을 기기 내에서 텍스트로 변환할 수 있습니다. 특히 애플 M4 Pro CPU에서 10초 오디오를 처리하는 데 첫 토큰까지 단 11.1ms, 이후 초당 1,319토큰의 빠른 디코딩 속도를 보여주어, 기존 모델 대비 압도적인 성능을 자랑합니다.

휘슬은 전사(transcription) 기능 외에도 각 단어의 시작과 종료 시각, 확률을 제공하는 단어별 타임스탬프, 그리고 전사 없이 음성 특징을 추출하는 음성 임베딩(embedding) 기능을 지원합니다. 16kHz 모노 오디오를 최대 30초까지 한 번에 처리하며, 언어를 지정하지 않아도 자동으로 감지합니다. 모델은 '니들(Needle)'과 동일한 컨테이너 형식, 양자화 방식, C++ CPU 엔진을 사용하여 최적화되었으며, 모바일, 웨어러블, 로봇, 스마트홈, 자동차 등 다양한 엣지 디바이스에 적용될 수 있도록 설계되었습니다. 브라우저에서도 마이크 사용 시 모델을 다운로드하여 오디오가 기기를 벗어나지 않고 처리되는 안전한 방식을 제공합니다.

휘슬의 등장은 엣지 디바이스에서의 음성 인식 기술 활용 가능성을 크게 확장할 것으로 보입니다. 모델 크기가 작아 CPU L3 캐시 안에 상시 로드하여 사용할 수 있어, 저전력 환경에서도 실시간에 가까운 음성 처리가 가능해집니다. 이는 개인 정보 보호가 중요한 온디바이스 AI 애플리케이션 개발에 유리하며, 네트워크 연결 없이도 작동하는 독립적인 음성 비서, 스마트 기기 제어, 음성 메모 앱 등 다양한 서비스에 적용될 수 있습니다. 특히, 기존 대규모 모델들이 가진 리소스 제약을 극복하며 더 많은 기기에서 AI 음성 기술을 활용할 수 있는 길을 열었다는 점에서 의미가 큽니다. 휘슬은 허깅 페이스(Hugging Face)에서 모델 가중치를, 깃허브(GitHub)에서 소스 코드를 공개하여 개발자들이 쉽게 접근하고 활용할 수 있도록 지원하고 있습니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
6/10
보통
왜 6점인가

기존 온디바이스 ASR의 한계(크기, 속도)를 크게 개선한 오픈소스 모델로, 특정 도메인에 특화된 솔루션을 만들 기회가 있습니다.

문제 / 미충족 수요

엣지 디바이스에서 빠르고 가볍게 동작하는 고성능 온디바이스 음성 인식(ASR) 솔루션에 대한 수요가 높습니다.

한국 시장
국내 있음한국어 지원은 아직 없지만, 온디바이스 ASR에 대한 수요는 존재합니다. 기존 대기업 솔루션 외에 틈새시장을 노릴 수 있습니다.
수익 모델

B2B SaaS 구독, API 종량제, 임베디드 솔루션 라이선스 · 돈 내는 주체: 스마트 기기 제조사, 임베디드 시스템 개발사, 특정 산업(물류, 의료, 건설 등)에서 음성 기록 및 제어 솔루션이 필요한 기업

1인 실현 가능성
3/5

기반 모델은 오픈소스지만, 특정 도메인에 최적화된 고품질 솔루션을 만들려면 데이터 수집, 미세조정, 임베딩 기술 역량이 필요합니다.

진입 지점 (Wedge)

특정 산업(예: 물류, 의료 현장)의 엣지 디바이스를 위한 초경량, 저지연, 오프라인 음성 인식 솔루션 개발 및 맞춤형 미세조정(fine-tuning) 서비스 제공.

이번 주 첫 실험

휘슬 모델을 활용하여 특정 산업군(예: 건설 현장 안전 수칙 기록)의 음성 데이터를 수집하고, 해당 도메인에 특화된 전사 정확도 개선 가능성을 검증하는 PoC(개념 증명)를 진행합니다.

Original source
이 글은 news.hada.io의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기