구글 ‘Gemini Omni Flash’ 영상 편집 성능 2위 달성, 3위와 40점 격차

구글 DeepMind가 Google I/O에서 공개한 Gemini Omni Flash가 Video Edit Arena 리더보드에서 1347점으로 2위를 차지했다. 3위 모델과는 약 39점의 격차를 벌렸으며, 1위 ByteDance의 dreamina-seedance-2.0-720p(약 1377점)와는 30점 차이로 매우 근접한 성능을 보이고 있다.

 

관련 이미지

 

멀티모달 영상 생성·편집 기능

 

Gemini Omni Flash는 텍스트, 이미지, 오디오, 비디오를 입력으로 받아 대화형 지시사항(conversational instructions)에 따라 영상 콘텐츠를 생성하거나 편집한다. “Omni” 브랜딩은 구글 DeepMind가 추구하는 진정한 멀티모달 통합을 의미하며, 단일 모델이 여러 콘텐츠 타입을 동시에 처리하고 생성한다는 점에서 기존의 특정 작업에만 국한된 모델과 차별화된다.

이 모델은 Video Edit 카테고리뿐만 아니라 Text-to-Video와 Image-to-Video 카테고리에서도 강력한 성능을 보이고 있다. 실제 사용자가 모델 출력물을 평가하는 인간 선호도 평가(human preference evaluation)에 따르면, 지시 따르기 및 편집 능력에서 가장 두드러진 성과를 거두고 있다.

 

빠른 출시와 즉시 통합

 

Gemini Omni Flash는 5월 19일 Google I/O에서 발표된 지 불과 몇 주 만에 주요 AI 벤치마크에서 2위를 차지한 것으로, 모델 출시 후 매우 빠른 성과다. 현재 Gemini 앱, Google Flow, YouTube Shorts, 개발자 API를 통해 이용할 수 있다. Gemini 앱 구독자는 이미 해당 모델에 접근할 수 있으며, Google은 향후 Google Docs, Google Slides 및 더 광범위한 Google Workspace 전역에 통합할 계획이다.

 

콘텐츠 크리에이터를 위한 의미

 

전문 수준의 영상 편집이 이제 자연어 지시사항만으로 가능해졌다는 점이 가장 중요한 의미다. 종래에는 편집 소프트웨어 전문 지식과 수 시간의 수동 작업이 필요했던 작업들을 대화형 프롬프트로 처리할 수 있게 된 것이다. 마케팅, 영상 제작, 소셜 미디어 콘텐츠 크리에이션 등 다양한 분야의 크리에이터들이 복잡한 편집 기술 습득 없이도 전문가 수준의 결과물을 만들어낼 수 있는 환경이 조성되었다.

Video Edit Arena 리더보드에서 상위 모델들 간의 격차가 좁혀지고 있는 추세는 고성능 영상 생성·편집 도구들이 시장에서 빠르게 성숙해지고 있음을 시사한다. 특히 구글이 자사 에코시스템 전반에 Gemini Omni Flash를 통합하려는 계획은 일반 크리에이터들의 접근성을 한층 높일 것으로 예상된다.

 

📅 원문 날짜: 2026년 6월 30일 | 출처: Crypto Briefing