블랙 포레스트 랩스(Black Forest Labs)와 미믹 로보틱스(mimic robotics)가 협력하여 로봇을 위한 차세대 비디오-액션 모델 'FLUX-mimic'을 선보였습니다. 이 모델은 이미지, 비디오, 오디오를 함께 학습하는 FLUX 3 백본에 로봇 행동 예측 기능을 결합한 것으로, 아우디(Audi) 생산 현장에 성공적으로 배포되어 복잡한 조작 작업을 수행하고 있습니다. 이는 하나의 기반 모델이 콘텐츠 생성과 로봇 제어라는 두 가지 역할을 동시에 수행할 수 있음을 보여주는 중요한 진전입니다.
FLUX-mimic의 핵심은 FLUX 3 백본의 학습 연산 중 95% 이상을 비디오 예측에 할당한다는 점입니다. 이를 통해 모델은 접촉, 운동, 무게, 인과관계 등 물리 세계의 작동 방식을 깊이 있게 이해하게 됩니다. 로봇 행동 또한 시각 관측과 밀접하게 결합된 저차원 표현으로 처리되어, 비디오, 오디오, 행동 프레임이 하나의 물리적 현실을 부분적으로 나타내는 방식으로 학습됩니다. 초기에는 행동 예측 추가로 비디오 생성 품질이 일시적으로 하락했으나, 3,500 스텝의 추가 학습 후 기존 수준을 회복하며 단일 백본으로 생성과 행동 예측이 모두 가능함을 입증했습니다. 또한, Self-Flow 기술로 생성 및 표현 학습을 통합하고 경량 행동 디코더를 연결하여 단일 NVIDIA RTX 5090 GPU에서 101ms의 빠른 로봇 반응 시간을 달성했습니다.
이 기술은 기존 자동화 방식으로는 비용이 많이 들거나 불가능했던 유연한 부품 처리, 정밀 조작 등 생산 현장의 난제를 해결할 잠재력을 가집니다. FLUX-mimic은 적은 시연만으로 새로운 작업에 빠르게 적응하고, 실패 시 스스로 재시도하여 복구하는 능력을 보여줍니다. 이는 로봇이 물리 법칙을 이미 이해하고 있기 때문에 가능한 것으로, 작업별 엔지니어링 없이도 다양한 작업과 산업, 하드웨어에 적용될 수 있는 범용성을 제공합니다. 궁극적으로 이 기술은 생산 및 물류 분야의 유연한 자동화를 확대하고, 직원의 업무 효율성을 높이는 데 기여할 것으로 기대됩니다.