FLUX 3가 이미지, 비디오, 오디오를 하나의 아키텍처에서 함께 학습하는 새로운 멀티모달 기반 모델을 공개하며 AI 분야에 큰 반향을 일으키고 있습니다. 이 모델은 각 양식을 분리된 요소가 아닌, 동일한 현실을 서로 다른 센서로 관측한 결과로 취급하여 상호 제약을 통해 학습합니다. 이를 통해 이미지의 공간 구조, 비디오의 시간적 역학, 오디오의 사건·소리 관계를 유기적으로 연결하여 현실 세계를 더 깊이 이해하고 예측하며 행동하는 시각 지능을 구현하려는 목표를 가지고 있습니다.
FLUX 3는 ‘Self-Flow’라는 통합 아키텍처를 기반으로 비디오, 이미지, 오디오를 동시에 학습하며 연산량과 데이터 자원을 확장했습니다. 특히 비디오 생성 능력에서 두각을 나타내는데, 최대 20초 길이의 비디오와 네이티브 오디오를 한 번에 생성할 수 있습니다. 초기 평가에서 Grok Imagine Video보다 최대 69%, Runway Gen-4.5보다 77%, Luma Ray 3.2보다 93% 더 선호되는 결과를 보이며 기존 모델들을 압도했습니다. 사람 표정 포착, 물리적 사건과 소리 연결, 다국어 처리 등에서 강점을 보이며, 여러 클립을 결합해 수분 길이의 시퀀스를 만들 수도 있습니다. 현재 FLUX 3 Video는 얼리 액세스(Early Access)로 제공 중이며, 향후 이미지 합성 및 편집을 위한 FLUX 3 Image, 로봇 행동 예측을 위한 FLUX-mimic, 그리고 오픈 가중치 기반의 FLUX 3 Dev 버전이 순차적으로 출시될 예정입니다.
이러한 멀티모달 통합 접근법은 콘텐츠 제작과 물리 AI 분야에 혁신적인 변화를 가져올 잠재력을 가지고 있습니다. 특히 로봇 행동 모델에 사전 학습된 비디오 백본을 활용하여 제한된 데이터만으로도 전문 행동 모델을 미세조정할 수 있다는 점은 로봇 공학 분야에 새로운 가능성을 제시합니다. 궁극적으로 FLUX 3는 지각, 행동, 언어 예측을 하나의 통합 모델에 결합하여 대화형 이미지·비디오 편집, 시뮬레이션, 컴퓨터 사용, 물리 AI 등 다양한 분야에서 활용될 것으로 기대됩니다. 이는 AI가 현실 세계를 이해하고 상호작용하는 방식에 있어 중요한 진전을 의미하며, 미래 AI 기술의 방향성을 제시하는 이정표가 될 수 있습니다.