YouTube 자동 제작 파이프라인 도구 PyPI 출시

AI 기반 영상 생성부터 업로드까지 모든 과정을 자동화하는 ‘youtube-factory-pipeline’ 도구가 공개되었다. 이 모듈식 파이프라인은 연구·스크립트 작성·음성 생성·비주얼 제작·편집·업로드 등 유튜브 영상 제작의 전 단계를 자동으로 처리할 수 있으며, 파이썬 3.10 이상에서 실행 가능하다.

 

자동화된 영상 제작 파이프라인 구성

youtube-factory-pipeline은 ‘Weight and See’ 유튜브 채널의 핵심 오케스트레이션 라이브러리로 개발되었으며, MIT 라이선스 하에 공개되었다. 이 도구는 영상 제작의 전 과정을 13개의 독립적인 에이전트로 분담하여 처리한다.

각 에이전트의 주요 기능은 다음과 같다. ResearchAgent는 GitHub, Hugging Face, arXiv, 웹, YouTube, RSS 등에서 자료를 수집하고 의미론적 검색을 통해 구조화된 JSON 형식의 브리프를 생성한다. VideoAnalysisAgent는 화면 기록을 FFmpeg 장면 분석, Whisper 음성 인식, Tesseract OCR을 활용해 8가지 클래스로 분류한다. ScriptBuilderAgent는 자산 중심 스크립트 구성을 통해 OCR 세그먼트를 그룹화하고 명시적 타임스탬프를 가진 장면을 구축한다.

IdeaGeneratorAgent는 3개의 영상 컨셉을 생성한 후 니치 다양성을 고려해 1개를 선택한다. ScriptwriterAgent는 훅-분석-심화 3막 구조의 시청 유지 스크립트를 작성하고 클릭유도 버튼(CTA)을 포함한다. VoiceoverAgent는 OmniVoice, Edge, Supertonic을 통해 TTS(Text-to-Speech)를 지원하며, 다중 스피커와 단어 수준의 타임스탐프를 제공한다. CPU만으로도 Supertonic M4 음성을 생성할 수 있다.

 

AI 기반 비주얼·오디오 자동 생성

VisualAssetAgent는 Pexels, Stable Diffusion, Fal, Pollinations, 로컬 모델을 활용해 B-롤과 AI 이미지, 썸네일을 자동 생성한다. AudioGenAgent는 Stable Audio 3을 통해 배경음악(BGM)을 생성하며, 더킹(오디오 감소) 및 볼륨 자동화 기능을 제공한다. VideoAssemblerAgent는 FFmpeg를 사용한 어셈블리 과정에서 자막 추가, 더킹, 4K 출력을 지원한다.

ShortGenerator는 9:16 세로 형식의 숏폼 클립을 자동으로 선택하여 58초 이내로 생성한다. UploaderAgent는 YouTube Data API v3를 활용해 플레이리스트, 썸네일, 숏폼 영상을 자동으로 업로드한다. GuideGeneratorAgent는 SEO 최적화된 HTML 리소스 페이지를 생성하여 GitHub Pages에 배포할 수 있으며, CommunityAgent는 영상 결과물을 바탕으로 유튜브 커뮤니티 포스트를 자동 생성한다.

 

유연한 설치와 JSON 기반 설정

모든 에이전트는 독립적으로 사용 가능하며, 공급자 중립적(provider-agnostic) 구조로 설계되어 있어 단일 JSON 파일을 통해 전체 파이프라인을 설정할 수 있다. 설치 방식은 사용자의 필요에 따라 선택할 수 있다. 핵심 의존성만 설치하려면 ‘pip install youtube-factory-pipeline’, 선택적 제공자를 포함하려면 ‘pip install “youtube-factory-pipeline[omnivoice]”‘ 명령을 사용한다. Stable Audio 3를 통한 BGM 생성이 필요한 경우 ‘pip install “youtube-factory-pipeline[stable-audio]”‘를 실행하고, 모든 기능을 원하면 ‘pip install “youtube-factory-pipeline[all]”‘을 입력하면 된다.

빠른 시작을 위해 PipelineOrchestrator와 load_config를 임포트한 후 경로에 맞는 config.json을 로드하면 즉시 자동화된 영상 제작 파이프라인을 시작할 수 있다.

 

의의 및 전망

youtube-factory-pipeline의 공개는 개인 크리에이터와 소규모 팀이 대규모 영상 제작 시스템을 구축할 수 있도록 민주화하는 의미를 갖는다. 기존에는 고비용의 인프라와 전문 인력이 필요했던 자동화된 영상 제작 워크플로우를 오픈소스 도구로 접근할 수 있게 된 것이다. 특히 Stable Diffusion, Stable Audio 3, Whisper 등 검증된 AI 모델들과의 통합으로 안정성 있는 결과물을 기대할 수 있으며, JSON 설정 기반의 모듈식 구조는 사용자가 필요한 단계만 선택하여 커스터마이징할 수 있는 유연성을 제공한다. 향후 더 많은 AI 음성 모델 통합, 고급 자막 생성 옵션, 실시간 스트림 지원 등이 추가될 경우 영상 크리에이터의 생산성 향상에 크게 기여할 것으로 예상된다.

📅 원문 날짜: 2026년 6월 15일 | 출처: PyPI