FLUX 3 공개, 비디오·오디오·로봇 합쳤지만 이미지는 아직
Black Forest Labs가 7월 23일 FLUX 3를 공개했습니다. 이미지·비디오·오디오·로봇 액션을 한 네트워크로 다루는 멀티모달 모델이지만, 지금 쓸 수 있는 건 gated 비디오뿐이고 이미지와 오픈웨이트는 미래형입니다.
- 무슨 일: Black Forest Labs가 7월 23일
FLUX 3를 공개했습니다. 이미지 생성으로 이름을 알린 회사가 이미지·비디오·오디오·로봇 액션을 하나의 네트워크에서 처리하는 멀티모달 모델을 내놨습니다. - 대표 기능: 오디오가 붙은 최대 20초 비디오 생성. text-to-video, image-to-video, 다국어 대사, 인간 표정과 소리·물리 이벤트 동기화를 강조했습니다.
- 구조: Self-Flow로 이미지·비디오·오디오를 처음부터 함께 학습합니다. 각 모달리티가 서로를 제약해 단일 학습보다 나은 world model을 만든다는 주장입니다.
- 로봇용
FLUX-mimic은 조작 작업 하나를 로봇 데이터 30분으로 파인튜닝합니다. 기존 방식은 30시간 넘게 필요했습니다.
- 로봇용
- 주의: 지금 손에 쥘 수 있는 건 gated 비디오 하나입니다. 이미지 early access는 "몇 주 안", 오픈웨이트
FLUX 3 Dev는 2026년 후반 예정입니다. 벤치마크는 BFL 자체 초기 평가입니다.
이미지 생성 회사가 비디오, 오디오, 로봇 제어까지 한 모델에 담았습니다. Black Forest Labs(BFL)는 7월 23일 FLUX 3를 공개했습니다. 텍스트를 넣으면 오디오가 붙은 20초짜리 영상을 만들고, 이미지를 편집하고, 로봇 팔의 다음 동작을 예측합니다. 이 기능들이 서로 다른 모델이 아니라 같은 가중치 하나에서 나옵니다.
BFL은 이미지 생성 도구 FLUX로 알려진 회사입니다. 창업자 Robin Rombach, Andreas Blattmann, Patrick Esser는 Stability AI 출신으로, Stable Diffusion의 기반이 된 latent diffusion 연구를 이끈 사람들입니다. 회사는 2024년 8월 FLUX.1로 출발했습니다. 이어 2025년 11월 FLUX.2를 냈고, 누적 투자는 4억 5천만 달러가 넘습니다. 지금까지는 정지 이미지가 전부였습니다. FLUX 3는 그 경계를 처음으로 넘어 비디오·오디오·로봇 액션까지 손을 뻗은 발표입니다.
정직하게 볼 부분은 발표와 실제 사용의 간극입니다. 네 가지 기능을 한꺼번에 소개했지만, 7월 25일 기준 실제로 열린 건 초대받은 파트너만 쓰는 비디오뿐입니다. 이미지, 오픈웨이트, 로봇은 모두 예정 단계입니다.
이미지 한 곳에서 비디오·오디오·로봇까지
FLUX 3의 핵심 주장은 하나의 네트워크가 네 가지 모달리티를 함께 처리한다는 것입니다. 아래 도식이 그 구조입니다. 텍스트, 이미지, 비디오, 오디오, 액션이 각자의 인코더를 거쳐 가운데의 Multimodal Transformer로 들어가고, 다시 각 디코더로 나옵니다. 로봇 액션 부분은 "EXTENSIBLE", 즉 나중에 붙일 수 있는 슬롯으로 표시돼 있습니다.

이 구조의 이름은 Self-Flow입니다. 2026년 3월에 발표한 방법으로, 같은 아키텍처 안에서 여러 모달리티의 생성과 이해를 정렬합니다. 쉽게 말하면 이미지·비디오·오디오를 따로 학습하지 않고 처음부터 함께 학습합니다. BFL의 설명은 이렇습니다. 소리는 화면 속 충돌과 맞아야 하고, 움직임은 물체의 질량을 따라야 하고, 다음 장면은 이전 장면에서 이어져야 합니다. 이 상호 제약이 한 모달리티만 학습할 때보다 현실에 가까운 world model을 만든다는 것입니다.
학습 데이터 규모도 공개했습니다. 일반 영상 수천만 시간에, 인간과 로봇의 조작 작업 영상 수십만 시간을 더했습니다. CEO Robin Rombach는 "하나의 통합 아키텍처 안에서의 공동 학습이 우리를 그곳으로 데려간다, 각 학습 모달리티가 서로를 강화하기 때문"이라고 밝혔습니다.
비디오는 Luma엔 93%, Seedance엔 52%
지금 실제로 쓸 수 있는 유일한 기능이 비디오입니다. 스펙은 최대 20초 길이에 네이티브 오디오 동기화입니다. text-to-video, image-to-video, video-to-video, keyframe-to-video를 지원하고 다국어 대사도 넣습니다. BFL은 인간 표정 포착, 소리와 물리 이벤트 연동, 다국어를 강점으로 꼽았습니다.
BFL은 초기 선호도 평가 수치도 함께 공개했습니다. 사람에게 두 영상을 보여주고 어느 쪽을 골랐는지 센 결과이며, 50%는 동률을 뜻합니다.

선호도는 상대 모델에 따라 크게 갈립니다. Luma Ray 3.2 상대로는 93%, Runway Gen-4.5 상대로는 77%, Grok Imagine Video 상대로는 69%가 FLUX 3를 골랐습니다. 그런데 Seedance 2.0과 Gemini Omni Flash 상대로는 52%에 그칩니다. 최상위 경쟁 모델과는 사실상 무승부라는 뜻입니다. 이 숫자가 BFL 자체 측정인 "초기 FLUX 3 후보에 대한 예비 평가"라는 점도 함께 봐야 합니다. 비디오·오디오 생성 경쟁의 지형은 Sora 이후 AI 영상 시장의 네 갈래 경쟁에서 이미 정리했는데, FLUX 3는 그 상위권에 근접했으나 추월했다고 보긴 이릅니다.
로봇으로 넘어간 액션 슬롯
FLUX 3에서 가장 눈에 띄는 확장은 로봇입니다. BFL은 로봇 학습 회사 mimic robotics와 함께 FLUX-mimic을 만들었습니다. FLUX 3의 영상 백본에 로봇 조작 학습을 붙인 비디오·액션 모델입니다.
핵심 수치는 학습 효율입니다. 특정 조작 작업 하나를 로봇 데이터 30분으로 파인튜닝합니다. 기존 방식은 같은 작업에 30시간 넘게 필요했습니다. mimic robotics CTO Elvis Nava는 "FLUX-mimic이 프론티어 비디오 모델 위에 세워졌기 때문에 새 작업을 며칠이 아니라 몇 분 만에 익힌다"고 설명했습니다.
지연 시간은 NVIDIA RTX 5090에서 백본 80ms 미만, end-to-end 반응 101ms로 측정됐습니다. 샘플 효율은 기존 vision-language-action(VLA) 모델 대비 최대 10배라고 밝혔습니다. 영상만 학습한 백본을 그대로 얼려 써도 기존 VLA를 앞서고, 파인튜닝하면 최고 성능에 도달한다는 설명입니다. 영상 모델이 물리 세계의 인과를 학습하면 로봇 제어의 사전 지식이 된다는 발상은, NVIDIA가 로봇 안에 넣은 온디바이스 world model Cosmos 3 Edge와 같은 방향입니다. 테스팅 파트너에는 Audi Production Lab도 포함됐습니다.
발표는 넷, 손에 쥔 건 비디오 하나
FLUX 3는 네 가지 기능을 함께 소개했지만, 개발자가 오늘 실제로 쓸 수 있는 범위는 훨씬 좁습니다. 발표와 사용 가능 시점을 갈라 보면 이렇습니다.
| 변형 | 내용 | 현재 상태 (7월 25일) |
|---|---|---|
| FLUX 3 Video | 비디오+오디오 생성·편집 | early access, 초대 파트너만 |
| FLUX 3 Image | 이미지 합성·편집 | "몇 주 안" 예정, 미출시 |
| FLUX-mimic / Action | 로봇 액션 예측 | 연구·상업 파트너 대상 |
| FLUX 3 Dev | 오픈웨이트 멀티모달 백본 | 2026년 후반 예정 |
이 순서가 실무에서 의미하는 바가 있습니다. FLUX를 키운 사용자층은 이미지를 다루는 디자이너, 마케터, 일러스트레이터입니다. 그런데 이번에 먼저 열린 건 비디오이고, 정작 이미지는 뒤로 밀렸습니다. 오픈웨이트도 마찬가지입니다. FLUX.1 [dev]와 [schnell]의 공개 가중치는 로컬 파인튜닝과 ComfyUI 생태계를 키운 원동력이었는데, FLUX 3 Dev는 연말로 예정돼 있습니다. 지금 당장 붙일 수 있는 것은 gated 비디오 API 하나이고, 가격은 아직 공개되지 않았습니다.
발표 자체는 커뮤니티의 관심을 끌었습니다. Hacker News에서 428포인트를 받았고, Canva, Krea, Picsart, Magnific(구 Freepik) 같은 크리에이티브 도구 회사들이 테스팅 파트너로 이름을 올렸습니다. 하나의 모델로 이미지·비디오·오디오·로봇을 함께 학습한다는 Self-Flow 방향이 맞다면, 각 모달리티를 따로 만들던 지금의 도구 조합을 하나로 줄일 여지가 생깁니다. 다만 그 판단은 이미지와 오픈웨이트가 실제로 열리고, BFL 자체 측정이 아닌 외부 평가가 나온 뒤에 내리는 편이 안전합니다.