Black Forest Labs(BFL)가 2026년 7월 23일 이미지·영상·오디오·액션 예측을 단일 아키텍처로 통합 학습하는 멀티모달 프론티어 모델 ‘FLUX 3’를 공개했다. 20초 분량 영상을 네이티브 오디오와 함께 생성하는 FLUX 3 Video와 로봇 조작을 위한 FLUX 3 Action이 얼리 액세스로 공개됐으며, FLUX 3 Image는 수 주 내 출시 예정이다. 내부 벤치마크에서 Runway Gen-4.5 대비 77%, Luma Ray 3.2 대비 93% 선호도를 기록했으며, 이는 BFL 최초의 공개 영상 생성 모델이기도 하다.

공식 데모 영상
Black Forest Labs란? — Stable Diffusion 창시자들의 회사
Black Forest Labs는 2024년 스텔스에서 나온 독일 프라이부르크 기반 AI 연구소다. 창립자들은 VQGAN, 잠재 확산(Latent Diffusion), Stable Diffusion을 개척한 연구자들로, FLUX 모델 패밀리로 이미지 생성 분야에서 빠르게 산업 표준 지위를 확보했다. 창립 이후 BFL 창립자들의 모델은 5억 회 이상 다운로드됐다. 기업가치 32.5억 달러, 누적 투자 4.5억 달러(a16z, NVIDIA, General Catalyst, Adobe Ventures, Figma Ventures, Canva, Deutsche Telekom 등 참여). Adobe Photoshop, Picsart, Canva, Krea, Magnific 등 주요 창작 플랫폼에서 BFL 모델이 생성형 기능을 구동하고 있다.
FLUX 3 — 하나의 모델, 네 가지 능력
FLUX 3는 이전 FLUX 계열과 근본적으로 다르다. 이전 모델들이 이미지 생성에 특화된 별개 도구들이었다면, FLUX 3는 이미지·영상·오디오·액션을 동일한 가중치에서 처리하는 단일 멀티모달 모델이다. 세 가지를 하나로 조립한 것이 아니라 처음부터 함께 학습한 것이다.

| 모델 | 기능 | 출시 상태 |
|---|---|---|
| FLUX 3 Video | 20초 영상 + 네이티브 오디오 동시 생성 | 얼리 액세스 (현재) |
| FLUX 3 Action | 로봇 시각·액션 예측 (FLUX-mimic) | 얼리 액세스 (현재) |
| FLUX 3 Image | 복잡한 프롬프트, 다국어 텍스트, 다양한 스타일·해상도 | 수 주 내 출시 예정 |
| FLUX 3 Dev | 오픈 웨이트 버전 (로컬 배포·파인튜닝용) | 2026년 하반기 예정 |
핵심 1 — FLUX 3 Video: 20초 + 네이티브 오디오
FLUX 3 Video는 텍스트-투-비디오, 이미지-투-비디오, 비디오-투-비디오, 키프레임 제어 트랜지션을 지원한다. 가장 중요한 차별점은 오디오가 영상과 별도가 아니라 동일한 생성 패스에서 함께 만들어진다는 것이다. 충격음은 충격 시점에 맞춰, 발소리는 걸음걸이에 맞춰, 다국어 대사는 화자의 입 모양에 맞춰 자동 동기화된다.
- 텍스트-투-비디오 생성
- 이미지-투-비디오 생성 (시작 프레임 애니메이션 또는 비주얼 레퍼런스)
- 비디오-투-비디오 생성 (소스 클립의 핵심 요소를 새 장면으로)
- 키프레임-투-비디오 (정해진 순간 사이의 제어된 트랜지션)
- 다국어 대사 생성
- 에이전틱 클립 체이닝으로 멀티샷 시퀀스 구성
- 캠코더 영상부터 시네마틱·애니메이션까지 광범위한 스타일
Robin Rombach CEO는 이렇게 설명한다. “비디오만 학습한 모델은 비디오만 생성할 수 있다. 하지만 세계는 정지 프레임으로 이루어져 있지 않다. 움직이고, 소리가 나고, 변하고, 반응한다. 그래서 FLUX 3는 그 신호들을 함께 학습한다.”
핵심 2 — Self-Flow: 왜 멀티모달 통합 학습이 가능한가
FLUX 3의 기반 기술은 BFL이 개발한 Self-Flow다. 멀티모달 생성과 이해를 동일한 아키텍처 안에서 효율적으로 정렬하는 접근법으로, 2026년 3월 연구 논문으로 공개됐다. 핵심 발견은 이것이다. 영상 생성과 로봇 액션 예측은 사실 별개의 기반이 필요하지 않다. 다음 프레임을 예측하는 모델은 로봇이 다음 동작을 예측하는 데 필요한 세계 이해와 본질적으로 같은 능력을 훈련한다. 즉 고품질 영상 생성 능력을 희생하지 않고도 동일한 아키텍처를 로봇 제어로 확장할 수 있다.

내부 벤치마크 — 경쟁 모델 대비 선호도

| 비교 모델 | FLUX 3 Video 선호도 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
단, 이 수치는 BFL 자체 선호도 테스트 결과로 아직 독립적으로 검증되지 않았다. 평가 방법론, 샘플 크기, 평가자 수도 공개되지 않았다. Seedance 2.0과 Gemini Omni Flash와는 52% 수준으로 사실상 동률이다.
FLUX 3 Image — 샘플 갤러리
FLUX 3 Image는 수 주 내 얼리 액세스로 공개된다. 미드트레이닝 단계 평가에서 이미 이전 FLUX 버전 대비 복잡한 프롬프트 처리와 텍스트 생성에서 유의미한 개선을 보였다. 다국어 고정밀 텍스트 렌더링과 광범위한 스타일·비율·해상도를 지원한다.

핵심 3 — FLUX-mimic: Audi 생산 현장에서 작동 중
FLUX 3 발표와 함께 BFL은 로보틱스 스타트업 mimic robotics와 공동 개발한 FLUX-mimic도 공개했다. FLUX 3의 동일한 백본 위에 구축된 로봇 조작 모델로, 현재 Audi 생산 라인에서 테스트·배포 중이다. 기존 로봇 학습 방식은 새로운 작업마다 30시간 이상의 데이터가 필요했으나, FLUX-mimic은 30분의 로봇 데이터만으로 새로운 조작 작업을 학습할 수 있다.
mimic robotics CTO Elvis Nava는 이렇게 말했다. “로봇공학의 가장 어려운 부분은 데이터다. FLUX-mimic은 물리 세계가 어떻게 동작하는지 이미 이해하는 프론티어 영상 모델 위에 구축되었기 때문에, 며칠이 아닌 몇 분 안에 새 작업을 습득한다.”
이미 테스트 중인 파트너들
- Canva — 글로벌 디자인 플랫폼
- Magnific (구 Freepik) — AI 이미지 업스케일링·생성
- Krea — AI 크리에이티브 도구
- Picsart — 소비자 이미지·영상 편집
- Burda — 독일 주요 미디어 그룹
현재 접근 방법 및 출시 일정
| 모델 | 접근 방법 | 시기 |
|---|---|---|
| FLUX 3 Video + Action | 얼리 액세스 신청 후 BFL 승인 | 현재 |
| FLUX 3 Image | API + 파트너 접근 | 수 주 내 |
| 일반 접근 (General Availability) | 전체 공개 | 이후 예정 |
| FLUX 3 Dev (오픈 웨이트) | 로컬 배포·파인튜닝 가능 | 2026년 하반기 |
현재 API 공개 가격은 미발표 상태다. 👉 FLUX 3 얼리 액세스 신청하기 →
커뮤니티 리뷰 — AI 영화 랜드마크와 FLUX 3의 의미
아래 리뷰 영상은 FLUX 3 공개와 함께 AI 영화가 처음으로 실제 극장 개봉에 성공한 날을 함께 다루고 있다. FLUX 3 Video가 기존 영상 생성 시장의 위계를 어떻게 바꾸는지, 네이티브 오디오 통합의 실제 의미, 그리고 Runway·Kling·Seedance와의 비교를 상세히 분석한다.
의의 및 전망
FLUX 3는 두 가지 의미에서 중요하다. 첫째, BFL 최초의 공개 영상 생성 모델로, 이미지 생성 전문 도구에서 멀티모달 플랫폼으로의 전환을 선언한다. Stable Diffusion을 만든 팀이 Kling, Seedance, Runway와 영상 생성 시장에서 직접 경쟁하기 시작한 것이다. 둘째, 영상 생성과 로봇 제어를 동일한 아키텍처로 처리하는 Self-Flow의 접근법은 AI 영상 모델이 크리에이티브 도구를 넘어 물리적 AI 기반으로 확장될 수 있음을 실제로 증명했다. Audi 생산 현장에서의 FLUX-mimic 배포가 그 첫 번째 증거다. 단, 현재 벤치마크 수치는 BFL 자체 보고이고 FLUX 3 Image는 아직 출시 전이며 오픈 웨이트도 하반기 예정이라는 점에서, 실제 크리에이터 워크플로우에서의 검증은 수 주 후 더 명확해질 것이다.
📅 원문 날짜: 2026년 7월 23일 | 출처: Black Forest Labs 공식 블로그 · GlobeNewswire · VentureBeat · Decrypt



