MiniMax, 오픈웨이트 H3 모델로 바이트댄스에 도전

7월 31일, AI 영상 역사상 가장 치열했던 하루 — 같은 날 시댄스 2.5와 정면충돌한 MiniMax의 승부수는 ‘오픈웨이트’다

 

MiniMax H3 공식 히어로 영상 — 2K 해상도·네이티브 오디오 생성 데모

 

중국 AI 기업 MiniMax(미니맥스)가 7월 31일 새 멀티모달 영상 생성 모델 ‘H3’를 공개했다. 텍스트·이미지·영상·오디오를 하나의 맥락에서 함께 처리하는 옴니모달 모델로, 폐쇄형 상용 모델이 지배해온 영상 생성 시장에 ‘오픈웨이트(open weights)’와 파격적 가격으로 도전장을 냈다. 공교롭게도 같은 날 바이트댄스가 시댄스(Seedance) 2.5를 내놓으면서, 이날은 중국 양대 AI 랩이 정면으로 맞붙은 ‘업계 역사상 가장 경쟁적인 AI 영상 출시일’로 기록됐다.

 

폐쇄형 vs 오픈웨이트

 

이 뉴스를 이해하려면 두 용어의 차이부터 알아야 한다. 폐쇄형(closed-source) 모델은 회사가 모델을 자사 서버에서만 돌리고, 사용자는 API나 웹사이트를 통해 ‘결과물만’ 받는 방식이다. Sora, 시댄스, 런웨이 등 대부분의 상용 영상 모델이 여기 속한다. 성능과 안정성은 좋지만, 내부를 들여다보거나 고칠 수 없고 회사가 정한 가격·정책·서버에 종속된다.

 

반면 오픈웨이트(open weights) 모델은 학습이 끝난 모델의 ‘가중치(weights)’ 파일 자체를 공개한다. 가중치란 모델이 학습으로 얻은 수십억 개의 수치 값으로, 사실상 모델의 ‘두뇌’에 해당한다. 이 파일을 받으면 사용자는 모델을 자기 컴퓨터·서버에서 직접 실행하고, 특정 용도에 맞게 파인튜닝(재학습)하거나 구조를 분석할 수 있다. API 종속에서 벗어나 자유도가 크게 높아지는 셈이다. 다만 ‘오픈웨이트’는 학습 데이터나 코드까지 모두 공개하는 완전한 ‘오픈소스’와는 다르며, 보통 가중치와 라이선스만 공개한다.

 

지금까지 영상 생성 분야는 LLM(대규모 언어모델)과 달리 폐쇄형이 압도적으로 우세했다. MiniMax의 H3는 바로 이 지형에 균열을 내려는 시도다.

 

MiniMax는 어떤 회사인가

 

MiniMax는 2022년 설립된 상하이 기반 AI 스타트업으로, 자금력이 탄탄한 중국 AI 유망주들을 일컫는 이른바 ‘AI 타이거(AI 六小虎)’ 중 하나다. 올해 1월에는 Z.AI에 이어 이 그룹에서 두 번째로 홍콩 증시에 상장했다. 영상 분야에서는 ‘하일루오(Hailuo) AI’ 브랜드로 알려져 있으며, 하일루오 01·02·2.3으로 이어지는 영상 모델 라인을 운영해왔다. H3(하일루오 3.0으로도 불린다)는 그 세 번째 세대에 해당한다.

 

흥미로운 대목은 방향 전환이다. 기존 하일루오 영상 모델들은 모두 폐쇄형이었는데, H3에서 처음으로 “오픈소스 커뮤니티 지원과 폭넓은 하드웨어 호환”을 이유로 가중치 공개를 택했다. 폐쇄형으로 쌓아온 회사가 오픈웨이트로 승부수를 던진 것이다.

 

H3의 실제 스펙 — 15초·2K·네이티브 스테레오

 

MiniMax에 따르면, H3는 24fps 기준 최대 15초 길이의 2K 해상도 영상을 네이티브 스테레오 사운드(대사·음악·효과음·환경음)와 함께 한 번에 생성한다. 오디오를 별도 단계 없이 영상과 동시에 만들어내는 것이 특징이다. 여기에 ‘옴니 레퍼런스’라 불리는 강력한 제어 기능을 갖췄는데, 참조 이미지 최대 9장, 참조 영상 3개, 참조 오디오 3개를 한 번에 넣어 캐릭터의 얼굴·스타일·동작·목소리를 여러 샷에 걸쳐 일관되게 유지할 수 있다. 프롬프트로 정교하게 샷을 제어하는 텍스트투비디오, 기존 영상에서 특정 사물을 깔끔하게 제거하는 편집, 자연어 지시만으로 재킷 색이나 배경을 바꾸는 인스트럭션 편집까지 지원한다.

 

가장 강력한 무기는 가격이다. MiniMax는 2K 기준 초당 생성 비용이 주류 모델의 3분의 1 미만, 768p 기준으로는 경쟁 모델 720p의 절반 미만이라고 밝혔다. 여기에 중국산 AI 칩 여러 종과의 호환성을 강조했는데, 이는 미국산 반도체 의존을 줄이려는 중국 AI 업계의 큰 흐름과 맞닿아 있다.

 

벤치마크 — ‘편집 1위’, 그러나 만능은 아니다

 

독립 벤치마크 플랫폼 Artificial Analysis 기준으로, H3는 영상 편집(video editing) 부문에서 추적 대상 모든 모델 중 1위에 올랐다. 텍스트투비디오는 2위, 이미지투비디오는 3위였다. 오픈웨이트로 공개될 예정인 모델이 편집 부문 최상위를 차지한 것은 처음이다. 다만 모든 작업에서 최고인 것은 아니다 — 텍스트→영상에서는 구글의 Gemini Omni Flash에, 이미지→영상에서는 시댄스 2.0과 Gemini 양쪽에 뒤졌다. 즉 H3의 강점은 ‘전 영역 최강’이 아니라 ‘편집 특화 + 오픈웨이트’라는 조합에 있다. 클립 길이(시댄스가 30초로 우위)로 정면 승부하는 대신, “최상위권 성능을 가진 유일한 오픈웨이트 모델”이라는 차별점으로 파고드는 전략이다.

 

‘오픈웨이트’의 실제 상태 — 아직은 ‘예정’

 

정확히 짚어둘 점이 있다. H3의 가중치는 출시 시점(8월 초) 기준으로 아직 공개되지 않았다. MiniMax는 “관련 법규를 준수하는 선에서 수일 내에 모델 가중치를 공개할 계획”이라고 밝혔을 뿐이다. 현재 H3를 쓰려면 API나 소비자용 플랫폼 하일루오 AI, 또는 fal·Civitai 같은 파트너 호스팅 서비스를 거쳐야 한다. 로컬에서 직접 돌리려면 공개될 저장소·가중치·실행 방법·하드웨어 요구사항·라이선스를 모두 확인한 뒤라야 한다. ‘오픈웨이트를 약속했다’와 ‘지금 오픈소스로 쓸 수 있다’는 다르다는 점에 유의해야 한다.

 

리스크 — 진행 중인 저작권 소송

 

H3를 상업적으로 도입하려는 팀이라면 반드시 알아야 할 사실이 있다. H3의 기반이 되는 하일루오 AI 플랫폼은 현재 디즈니·유니버설·워너브라더스 디스커버리가 제기한 저작권 침해 소송의 대상이다. 이 소송은 2026년 5월 연방 판사의 각하 신청 기각으로 본안 심리에 들어간 상태다. 즉 H3를 채택하는 것은 ‘진행 중인 지식재산권 소송에 걸린 제품’을 쓰는 셈이라는 지적이 나온다. 독립적으로 검증된 가격·성능 우위와, 스튜디오들이 문제 삼는 소송 리스크가 동시에 존재하는 것이다.

 

의의 및 전망

 

H3의 등장은 AI 영상 생성 시장이 ‘폐쇄형 프리미엄 vs 오픈웨이트’라는 새로운 경쟁 구도로 재편되고 있음을 보여준다. 지금까지 영상 생성은 폐쇄형 모델이 지배하며 생태계 개방과 반복 개선 속도가 느렸는데, 최상위권 성능의 오픈웨이트 모델이 나오면 이 구도가 흔들릴 수 있다. 크리에이터 입장에서 오픈웨이트는 모델을 직접 분석·파인튜닝해 자신의 스타일이나 브랜드에 맞춰 커스터마이징할 수 있다는 뜻이라, API에 종속되지 않는 자유도가 매력이다.

 

다만 실질적 판단은 실제 가중치가 공개되고 라이선스 조건이 확인된 뒤에 내리는 게 안전하다. 특히 상업 프로젝트라면 저작권 소송 리스크까지 함께 저울질해야 한다. 그럼에도 시댄스 2.5와 같은 날 정면으로 맞붙은 이번 출시는, 중국 AI 랩들의 경쟁이 글로벌 크리에이터가 쓰는 도구의 성능과 가격을 얼마나 빠르게 끌어내리고 있는지를 상징적으로 보여주는 장면이다.

 

📅 원문 날짜: 2026년 7월 31일 | 출처: MiniMax 공식 블로그 · South China Morning Post · Reuters · Tech Times · Artificial Analysis