yozm.tech
피드로 돌아가기
Show HNHOTAI 재작성

블랙 포레스트 랩스, 멀티모달 AI 모델 '플럭스 3' 공개

블랙 포레스트 랩스(Black Forest Labs, BFL)가 이미지, 비디오, 오디오를 통합 처리하는 멀티모달 AI 모델 '플럭스 3(Flux 3)'를 발표했습니다. 이 모델은 텍스트, 이미지, 비디오 등 다양한 형태의 입력으로 최대 20초 길이의 비디오와 이미지를 생성하며, 실제 세계의 시각적 지능을 모방하여 행동 예측까지 가능하게 합니다. 특히 비디오 생성에서 경쟁 모델 대비 우수한 성능을 보여주며, 물리적 AI 분야로의 확장 가능성을 제시합니다.

5시간 전·2026.07.24·읽기 2·akseli_ukkonen

블랙 포레스트 랩스(Black Forest Labs, BFL)가 이미지, 비디오, 오디오를 하나의 모델로 통합 처리하는 멀티모달 AI 모델 '플럭스 3(Flux 3)'를 공개했습니다. 이 모델은 텍스트, 이미지, 비디오, 오디오 등 다양한 형태의 입력을 받아 이미지와 비디오를 생성하고 편집할 수 있으며, 실제 세계의 복합적인 정보를 이해하고 표현하는 데 중점을 둡니다. 특히 비디오 생성에서 경쟁 모델들을 능가하는 성능을 보여주며 주목받고 있습니다.

플럭스 3는 BFL의 '셀프-플로우(Self-Flow)' 아키텍처를 기반으로, 방대한 양의 비디오, 이미지, 오디오 데이터를 동시에 학습하여 구축되었습니다. 이를 통해 단일 모델로 다양한 모달리티를 혼합하고, 텍스트나 참조 미디어(이미지, 비디오)를 활용해 비디오와 오디오를 함께 생성할 수 있습니다. 최대 20초 길이의 비디오를 생성하며, 텍스트-투-비디오, 이미지-투-비디오, 비디오-투-비디오 변환 등 다양한 비디오 생성 및 편집 기능을 제공합니다. 예비 평가에서 루마 AI(Luma AI)의 레이(Ray) 모델보다 높은 선호도를 기록했으며, 특히 사람의 얼굴 표정, 물리적 이벤트에 맞는 사운드 매칭, 다국어 생성 능력에서 강점을 보입니다. 또한, 이미지 합성 및 편집 기능도 강화되어 복잡한 프롬프트 처리와 고정확도 텍스트 렌더링이 가능합니다.

플럭스 3의 가장 큰 특징은 '행동 예측(action prediction)' 기능으로, 단순히 장면을 인식하는 것을 넘어 다음 발생할 일을 예측하는 물리적 AI(Physical AI) 분야로 확장될 잠재력을 가졌다는 점입니다. BFL은 미믹 로보틱스(mimic robotics)와의 협력을 통해 플럭스 3의 비디오 백본을 로봇 학습에 적용, 아우디(Audi)의 실제 생산 작업에 테스트 중입니다. 이는 콘텐츠 생성과 물리적 AI를 동일한 세계 모델(world model)로 연결하려는 시도로, AI가 가상 세계를 넘어 현실 세계의 복잡한 상호작용을 이해하고 예측하는 데 중요한 진전을 의미합니다. 플럭스 3는 비디오, 이미지, 액션 예측 기능을 단계적으로 API 및 비공개 가중치 접근 방식으로 출시할 예정이며, 최종적으로는 멀티모달 백본에 대한 오픈 가중치 접근도 계획하고 있습니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
4/10
보통
4점인가

기반 모델 개발은 대기업 영역이지만, 특정 버티컬 시장에 특화된 애플리케이션 기회는 존재합니다.

문제 / 미충족 수요

멀티모달 AI 모델의 발전은 콘텐츠 제작의 효율성을 높이지만, 특정 니즈에 맞는 전문화된 도구는 여전히 부족합니다.

한국 시장
국내 있음한국에서도 이미지/비디오 생성 AI 서비스가 다수 존재하나, 멀티모달 통합 및 행동 예측까지는 아직 초기 단계입니다.
수익 모델

B2B SaaS 구독, API 종량제 · 돈 내는 주체: 콘텐츠 마케터, 소규모 스튜디오, 교육 콘텐츠 제작자, 제품 디자이너

1인 실현 가능성
2/5

기반 모델 개발은 어렵지만, 특정 니치 시장을 위한 미세조정(fine-tuning) 및 UI/UX 개발은 1인도 가능할 수 있습니다.

진입 지점 (Wedge)

특정 산업(예: 교육, 의료 시뮬레이션) 또는 특정 콘텐츠 유형(예: 짧은 애니메이션, 제품 설명 비디오)에 특화된 멀티모달 AI 기반 콘텐츠 생성 도구 개발.

이번 주 첫 실험

타겟 산업의 잠재 고객 5명과 인터뷰하여 현재 콘텐츠 제작의 어려움과 AI 도구에 대한 니즈를 파악합니다.

Original source
이 글은 Show HN의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기