알리바바(Alibaba)가 텍스트, 이미지, 오디오, 비디오 등 모든 형태의 데이터를 이해하고 처리하는 새로운 멀티모달(multimodal) AI 모델인 큐웬 3.8 옴니 플래시(Qwen 3.8 Omni Flash)를 공개했습니다. 이 모델은 콘텐츠 이해부터 작업 계획, 도구 호출, 결과물 제작까지 전 과정을 수행하는 네이티브 옴니모달 기능을 제공하며, 100만 토큰에 달하는 방대한 컨텍스트(context)를 지원하는 것이 특징입니다.
큐웬 3.8 옴니 플래시는 이전 모델인 큐웬 3.5 옴니 플러스(Qwen 3.5 Omni Plus)에 비해 29개 평가 항목에서 평균 점수가 25% 이상 상승하는 등 성능이 크게 개선되었습니다. 특히 API 사용 비용 면에서 혁신적인 변화를 가져왔는데, 시간당 오디오 입력 API 가격은 98% 이상, 시청각 입력 가격은 93% 이상 인하되어 개발자들의 접근성을 높였습니다. 또한, 장시간 영상에서 질문에 필요한 구간을 스스로 찾아 검증하는 에이전트(agent) 방식의 이해를 지원하며, 옴니비디오벤치(OmniVideoBench)에서 정확도를 높이고 질의당 토큰 사용량을 약 45.7% 줄여 효율성을 극대화했습니다. 영상 제작, 단편 드라마 번역 및 더빙, 장편 영화 해설, 회의 후속 작업 등 다양한 시청각 중심의 에이전트 작업을 지원하며, 실시간 시청각 스트림을 처리하는 큐웬 3.8 옴니 플래시 리얼타임(Qwen 3.8 Omni Flash-Realtime) 모델도 함께 선보였습니다.
이러한 발전은 AI가 단순한 정보 처리 도구를 넘어 복잡한 현실 세계의 문제를 해결하는 데 한 발 더 다가섰음을 의미합니다. 특히 저렴해진 API 비용과 향상된 성능은 개발자들이 멀티모달 AI를 활용한 혁신적인 애플리케이션을 만들 수 있는 기회를 확대할 것입니다. 장시간 영상 콘텐츠를 효율적으로 분석하고 요약하며, 실시간으로 다양한 미디어와 상호작용하는 능력은 교육, 미디어 제작, 고객 서비스 등 여러 산업 분야에 걸쳐 새로운 비즈니스 모델과 사용자 경험을 창출할 잠재력을 가지고 있습니다. 큐웬 3.8 옴니 플래시는 범용 멀티모달 모델이 소형 모델의 연구와 반복 실험을 주도하여 특정 업무에 최적화된 모델을 빠르게 개발할 수 있는 가능성도 보여주며, AI 개발 생태계 전반에 긍정적인 영향을 미칠 것으로 기대됩니다.