최근 전용 GPU 없이 15GB 미만의 RAM만으로도 구동되는 오프라인 음성 비서가 등장해 주목받고 있습니다. 이 비서는 대부분의 음성 비서와 달리 사용자가 말하는 도중에도 즉각적으로 개입하여 대화 흐름을 바꿀 수 있는 '바지인(barge-in)' 기능을 핵심으로 내세웁니다. 모든 처리가 로컬에서 이루어지기 때문에 클라우드 연결이나 계정 생성 없이도 빠르고 개인 정보가 보호되는 AI 비서 경험을 제공합니다.
이 오프라인 음성 비서의 가장 큰 특징은 '바지인' 기능의 정교함입니다. 짧은 중얼거림은 재생을 일시 중지하여 사용자가 말을 마칠 수 있게 하고, 명확한 개입은 비서의 답변을 즉시 중단시킵니다. 대화 종료 시점 판단도 단순히 타이머에 의존하지 않고, 실시간 음성 감지기, 일시 정지 임계값, 그리고 지난 몇 초간의 발화를 분석하는 분류기가 종합적으로 판단합니다. 만약 이들이 서로 다른 의견을 보이면, 네 개의 토큰으로 구성된 '판단 프롬프트(judge prompt)'가 '듣기(LISTEN)' 또는 '응답(REPLY)' 중 하나를 선택하여 최종 결정을 내립니다. 또한, 모델과 사용자 기기 사이에 '도구 게이트(tool gate)'를 두어 사용자가 명시적으로 요청하지 않은 도구 호출은 차단하고 설명해주는 방식으로 오작동을 방지합니다.
이 시스템은 두 가지 '두뇌'를 활용하여 대화를 처리합니다. 하나는 로컬에서 서비스되는 모델을 통해 표준 채팅 API로 스트리밍하고, 다른 하나는 코딩 에이전트 CLI(명령줄 인터페이스)를 서브 프로세스로 실행하여 해당 도구와 스킬, 세션별 메모리를 상속받습니다. 사용자는 런타임에 체크박스 하나로 이 두 가지 모드를 전환할 수 있습니다. 대화 기록은 중단에 안전하게 관리되어, 대화가 끊겼을 때 불완전한 도구 교환은 삭제되고, 스킬이 매 턴마다 다시 읽히는 것을 방지합니다. 또한, 모델은 사용자의 언어를 미러링하여 이탈리아어로 말하면 이탈리아어로, 영어로 말하면 영어로 응답하며, 대화 도중 언어를 바꿔도 이를 따라갑니다. 이 모든 기능은 전용 GPU 없이 15GB 미만의 RAM 환경에서 작동하여, 저사양 PC에서도 고성능 AI 비서의 이점을 누릴 수 있게 합니다.
