미니맥스(MiniMax)가 차세대 오픈 소스 비디오 모델인 H3를 전격 공개하며, 출시 당일부터 코지UI(ComfyUI)에서 완벽하게 지원됩니다. H3는 텍스트, 이미지, 기존 비디오, 오디오 등 다양한 형태의 입력을 받아 최대 2K 해상도와 15초 길이의 스테레오 사운드 비디오 클립을 생성하는 강력한 옴니모달(omni-modal) 모델입니다. 이는 미니맥스의 세 번째 비디오 모델이자, 처음으로 오픈 소스로 공개된 버전으로, 엔비디아(NVIDIA) 지포스 RTX 3060 그래픽카드에서도 로컬 구동이 가능하도록 최적화되었습니다.
H3의 핵심 기능으로는 텍스트-투-비디오, 이미지-투-비디오, 그리고 첫 프레임과 마지막 프레임을 지정하여 중간을 채우는 기능 등이 있습니다. 특히, 레퍼런스(reference) 이미지, 비디오, 오디오를 제공하여 특정 피사체, 움직임, 또는 목소리를 비디오 전체에 일관되게 적용할 수 있는 점이 돋보입니다. 또한, 오디오가 비디오와 동시에 생성되는 '네이티브 스테레오 오디오' 기능을 통해 후처리 없이 고품질 스테레오 사운드를 제공하며, 여러 모달리티(modality)를 동시에 이해하고 처리하는 '다중 모달 컨텍스트 이해' 능력으로 복잡한 창작 작업을 하나의 모델로 통합할 수 있습니다.
이러한 H3의 출시는 비디오 생성 AI 분야에 큰 파급력을 가져올 것으로 예상됩니다. 오픈 소스 정책은 개발자와 크리에이터들이 모델을 자유롭게 활용하고 개선할 수 있는 기회를 제공하며, 로컬 환경에서의 구동 가능성은 고성능 클라우드 서비스에 대한 의존도를 낮춰 접근성을 크게 향상시킵니다. 특히, 다중 모달 입력 처리와 내장형 스테레오 오디오 기능은 기존 비디오 생성 모델의 한계를 뛰어넘어 더욱 현실적이고 몰입감 있는 콘텐츠 제작을 가능하게 할 것입니다. 이는 개인 창작자부터 소규모 스튜디오에 이르기까지 비디오 콘텐츠 제작의 문턱을 낮추고 새로운 창의적 가능성을 열어줄 중요한 진전으로 평가됩니다.
