NVIDIA·허깅페이스 협력, 디퓨저 모델 대규모 파인튜닝 기술 공개

NVIDIA와 Hugging Face가 협력해 FLUX.2-dev, Wan 2.1, HunyuanVideo 같은 최신 오픈소스 이미지·영상 생성 모델을 대규모로 파인튜닝할 수 있는 기술을 공개했다. NVIDIA NeMo Automodel과 Diffusers 라이브러리의 통합으로, 크리에이터와 개발자는 Hugging Face 허브의 모든 디퓨저 포맷 모델을 체크포인트 변환 없이 바로 자신의 데이터셋으로 학습시켜 독자적인 스타일의 이미지·영상을 생성할 수 있다. Apache 2.0 라이선스 완전 오픈소스다.

 

 

NVIDIA NeMo Automodel + Hugging Face Diffusers 통합

 

Hugging Face란? — AI 모델의 GitHub

Hugging Face(허깅페이스)는 2016년 설립된 프랑스계 미국 AI 스타트업으로, AI 모델과 데이터셋을 공유하는 오픈소스 플랫폼 ‘Hugging Face Hub’를 운영한다. AI 분야의 GitHub라고 불리며, FLUX, Wan, HunyuanVideo, Stable Diffusion 등 대부분의 주요 오픈소스 이미지·영상 생성 모델이 이 플랫폼을 통해 배포된다. 현재 100만 개 이상의 모델과 20만 개 이상의 데이터셋이 허브에 등록되어 있으며, 🤗 Diffusers는 이 모든 디퓨전 모델을 위한 사실상의 표준 라이브러리로 자리잡았다.

 

이 협력이 크리에이터에게 의미하는 것

파인튜닝(Fine-tuning)이란 이미 학습된 AI 모델에 자신의 데이터셋을 추가로 학습시켜 특정 스타일·화풍·주제에 특화된 모델을 만드는 것이다. 예를 들어 지브리 스타일 영상 클립들로 Wan 2.1을 파인튜닝하면, 이후 어떤 프롬프트를 넣어도 지브리 특유의 시각적 스타일로 영상이 생성된다.

기존에는 이 파인튜닝 작업이 매우 복잡했다. 모델 포맷 변환, 분산 학습 코드 재작성, GPU 메모리 한계 등이 진입 장벽이었다. NeMo Automodel + Diffusers 통합은 이 과정을 설정 파일(YAML) 수정만으로 처리하게 해준다.

 

지원 모델 목록

모델 타입 파라미터 LoRA
FLUX.1-dev 텍스트→이미지 12B
FLUX.2-dev 텍스트→이미지 32B
Wan 2.1 T2V 1.3B 텍스트→영상 1.3B (A100 40GB 1장)
Wan 2.1 T2V 14B 텍스트→영상 14B
Wan 2.2 T2V A14B 텍스트→영상 27B (MoE), 14B 활성
HunyuanVideo 1.5 텍스트→영상 13B
Qwen-Image 텍스트→이미지 20B (MMDiT)

 

실제 결과물 — Wan 2.1을 지브리 스타일로 파인튜닝

가장 인상적인 결과물은 Wan 2.1 모델을 지브리(Ghibli) 스타일 영상 데이터셋으로 파인튜닝한 예시다. 동일한 프롬프트에서 베이스라인과 파인튜닝 결과물을 직접 비교할 수 있다.

베이스라인 (파인튜닝 전):

 

 

지브리 스타일 파인튜닝 후:

 

 

LoRA 적용 전후 비교도 주목할 만하다. LoRA는 모델 전체를 재학습하지 않고 소수의 파라미터만 학습하는 경량 파인튜닝 방식으로, GPU 메모리를 크게 절약하면서도 특정 스타일을 효과적으로 주입한다.

LoRA 미적용:

 

 

LoRA 적용 (지브리 스타일):

 

 

FLUX.1-dev 타로 카드 스타일 파인튜닝 — 이미지 비교

FLUX.1-dev를 78장의 라이더-웨이트 타로 카드 이미지 데이터셋으로 파인튜닝한 결과다. 동일한 “화성에서 장미 정원을 가꾸는 우주비행사” 프롬프트에서 베이스라인(사실적 사진)과 파인튜닝 결과(타로 카드 스타일)를 비교할 수 있다.

베이스라인 파인튜닝 후 (타로 카드 스타일)
FLUX.1-dev 베이스라인 FLUX.1-dev 타로 스타일 파인튜닝
FLUX.1-dev 베이스라인 2 FLUX.1-dev 타로 스타일 파인튜닝 2

트리거 토큰(trtcrd)을 프롬프트에 포함하면 크림색·빨간색·검정색의 빈티지 팔레트, 두꺼운 잉크 윤곽선, 평면 색상, 오래된 종이 톤의 타로 카드 스타일이 적용된다. 트리거 토큰 없이 동일한 프롬프트를 입력하면 베이스 모델의 사실적인 사진 스타일이 유지되어, 파인튜닝 효과가 특정 키워드에 강하게 연결되어 있음을 보여준다.

 

FLUX.2-dev LoRA 파인튜닝 결과

FLUX.2-dev LoRA 결과 1 FLUX.2-dev LoRA 결과 2
FLUX.2-dev LoRA 결과 3 FLUX.2-dev LoRA 결과 4

 

NeMo Automodel의 두 가지 핵심 설계 원칙

1. Hugging Face 네이티브 지원
pretrained_model_name_or_path에 허브의 모든 디퓨저 모델 ID를 지정하면 즉시 학습이 시작된다. 체크포인트는 디퓨저 생태계로 깔끔하게 복귀하므로 파인튜닝 후 곧바로 ComfyUI, Diffusers 파이프라인 등 기존 도구에서 사용 가능하다.

2. 단일 코드로 모든 규모에서 작동
1개 GPU에서 수백 개 GPU까지, 병렬 처리 방식 전환이 코드 재작성이 아닌 설정 선택이다. FSDP2, 텐서 병렬화, 전문가 병렬화, 컨텍스트 병렬화, 파이프라인 병렬화 사이를 YAML 설정으로만 전환할 수 있다. Wan 2.1 1.3B 모델은 A100 40GB GPU 단 1장에서도 파인튜닝이 가능하다.

 

성능 벤치마크 — H100 8장 기준

모델 학습 방식 스텝당 시간 GPU당 메모리
FLUX.1-dev (12B) Full (FSDP2) 0.902초 63.88 GiB
FLUX.1-dev (12B) LoRA r64 (DDP) 0.894초 67.43 GiB
Wan 2.1 1.3B Full 0.942초 6.09 GiB
Wan 2.1 14B Full 3.798초 33.35 GiB
HunyuanVideo 1.5 Full 5.926초 15.90 GiB
HunyuanVideo 1.5 LoRA r64 5.575초 10.58 GiB

 

시작하는 방법

설치는 Docker 컨테이너 또는 pip 두 가지 방법이 있다.

# pip 설치
pip3 install nemo-automodel

# 또는 Docker 컨테이너
nvcr.io/nvidia/nemo-automodel:26.06

 

의의 및 전망

이번 협력이 의미 있는 이유는 오픈소스 이미지·영상 생성 모델의 커스터마이징 문턱을 대폭 낮췄기 때문이다. FLUX.2-dev(32B), HunyuanVideo(13B) 같은 거대 모델을 파인튜닝하려면 기존에는 분산 학습 전문 지식과 복잡한 코드 작업이 필요했다. 이제는 YAML 설정 파일 수정으로 GPU 1대부터 수백 대까지 동일한 코드로 확장할 수 있다. AI 아트, 광고 제작, 영화 VFX, 브랜드 스타일 영상 생성 등 크리에이티브 분야에서 자신만의 파인튜닝 모델을 보유하는 것이 훨씬 현실적인 옵션이 됐다. 곧 출시 예정인 Pythonic 레시피 API는 YAML이 아닌 파이썬 코드로 동일한 작업을 할 수 있게 해 접근성을 한층 더 높일 것이다.

 

📅 원문 날짜: 2026년 7월 17일 | 출처: Hugging Face Blog (NVIDIA 공동 저술) · GitHub