클라우드 서비스에 민감한 정보를 보내지 않고도 음성 받아쓰기(dictation)와 음성-텍스트 변환(STT)을 할 수 있는 오픈소스 도구 'YazSes'가 리눅스(Linux), macOS, 윈도우(Windows)용으로 출시되었습니다. 이 도구는 사용자의 음성 데이터가 외부 서버로 전송되지 않고 개인 컴퓨터 내에서 모든 처리가 이루어지도록 설계되어, 정보 보안이 중요한 환경이나 인터넷 연결이 어려운 상황에서도 유용하게 활용될 수 있습니다.
YazSes는 'faster-whisper' 기술을 기반으로 개발되었으며, 세 가지 주요 기능을 제공합니다. 첫째, '받아쓰기(Dictate)' 기능은 특정 키를 누른 채 말하면 현재 활성화된 애플리케이션에 텍스트가 바로 입력됩니다. 음성 명령이나 매크로(macro)도 지원하여 사용 편의성을 높였습니다. 둘째, '파일 변환(Transcribe a file)' 기능은 오디오 또는 비디오 파일을 텍스트로 변환해주며, 화자 분리(speaker diarization) 기능으로 누가 말했는지도 구분할 수 있습니다. 셋째, '회의 캡처(Capture a meeting)' 기능은 회의 전체를 녹음하고 화자별로 구분된 회의록을 생성하며, 로컬 대규모 언어모델(LLM)을 활용해 요약, 결정 사항, 실행 항목 등의 회의록 초안까지 작성할 수 있습니다. 이 모든 과정은 사용자의 CPU에서 오프라인으로 진행되며, API 키나 구독료가 필요 없습니다.
YazSes의 등장은 민감한 정보 유출에 대한 우려 없이 음성 기술을 활용하고자 하는 사용자들에게 중요한 의미를 가집니다. 특히 의료, 법률, 금융 등 기밀 유지가 필수적인 분야에서 클라우드 기반 서비스의 대안이 될 수 있습니다. 또한, 구독 모델에 대한 부담 없이 무료로 고품질의 음성-텍스트 변환 기능을 사용할 수 있다는 점에서 개인 사용자나 소규모 팀에게도 매력적인 선택지가 될 것입니다. 모든 기능이 오프라인에서 작동하므로, 인터넷 연결이 불안정하거나 에어갭(air-gapped) 환경에서도 생산성을 유지할 수 있다는 장점도 큽니다.