Gemini Omni 1.1 Flash 영상 생성 기능 업데이트

구글이 8월 27일 제미니 옴니 1.1 플래시를 공개했다. 장면 확장, 시작·끝 프레임 지정, 4K 업스케일, 영상 레퍼런스가 추가됐다. 360p 프리뷰는 720p 대비 최대 60% 빠르고 비용은 3분의 1이다.

 

 

구글 딥마인드 프로덕트 매니저 아니시 낭기아와 알리사 포틴이 발표했다. 제미니 옴니가 생성 작업에 현실 세계 추론을 가져왔다면, 이번 업데이트는 구글 AI 스튜디오의 제미니 API를 통해 옴니 1.1을 실무에 쓸 수 있는 수준으로 만든 것이라고 설명했다.

 

영상 제작 워크플로, 창작 도구, 미디어 편집 소프트웨어를 만드는 개발자를 대상으로 생성 영상을 더 통제 가능하고, 반복이 빠르고, 실제 배포에 쓸 수 있게 다듬었다는 것이다.

 

장면 확장

기존 영상을 받아 끝난 지점부터 이어서 생성하는 기능이다.

 

이전 모델은 마지막 1초만 참조했으나 옴니 1.1은 앞선 맥락을 최대 10초까지 분석한다. 시각적 일관성과 서사 연결이 개선돼 더 긴 이야기를 만들거나 다른 방향으로 분기할 수 있다는 설명이다. 10초 단위로 확장하며 누적 최대 40초까지 늘릴 수 있다.

 

카메라가 살짝 패닝하며 그녀가 곱슬머리 남자와 이야기하고 있음이 드러난다. 남자의 등이 보이고 그가 “나도 보여”라고 말한다. 극적인 음악

영상을 이어가라. 시네마틱 옵티컬 돌리 줌. 카메라가 전진하며 동시에 줌 아웃해 인물의 굳은 표정을 같은 크기로 유지한다. 배경의 석조 기둥 회랑이 강한 원근 왜곡과 함께 늘어난다. 끊기지 않는 연속 숏

파란 스웨터의 남자가 답한다. “당신 아버지도 배를 타셨나요?” 이어 카메라가 하나의 연속된 움직임으로 물러나며 그가 이야기를 잇는다. “이 항구에는 영혼이 있다고 하셨죠. 배들은 우리의 일부라고.” 음악이 고조된다

인물이 카메라를 정면으로 보며 마지막 장이 어떻게 끝날지 이야기한다. 이어 자리에서 일어나 책상을 돌아 카메라로 다가와 말한다. “당신이라면 무엇을 택하겠습니까?”

 

구글이 공개한 API 호출 예시는 이런 형태다. 이전 생성 결과의 ID를 넘기고 이어가라는 지시만 붙인다.

 

interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id,
    input=[{"type": "text", "text": "Continue the scene."}],
    response_format={"resolution": "360p"},
)

 

시작·끝 프레임 지정

숏의 시작 프레임과 끝 프레임을 지정하면 그 사이를 연속 영상으로 생성한다. 복잡한 카메라 궤도, 줌 전환, 이음매 없는 반복 클립에 쓴다.

 

 

▲ 베이지 수트 드러머를 로우앵글 클로즈업으로 잡다가 카메라가 옆으로 휩 팬하며 색소포니스트와 발레 무용수가 드러난다. 점프컷 없는 하나의 연속 숏

 

360p 초안 생성

360p 프리뷰는 720p 대비 최대 60% 빠르고 비용은 3분의 1이다. 구글은 이 수치가 두 해상도의 시스템 처리량 비교에 근거한다고 밝혔다. 빠른 프로토타이핑, 스토리보드 반복, 개발 플랫폼에서의 빠른 렌더링에 쓰는 용도다.

 

 

▲ 무지갯빛 해양 규조류의 현미경 시점. 유리 같은 규산질 껍질과 자연적 대칭, 영상 내내 현미경 렌즈 효과 유지

 

4K 업스케일

최종 결과물을 1080p 또는 4K로 생성한다. 구글은 전문 제작에 바로 쓸 수 있는 수준이라고 밝혔다.

 

 

▲ 황금빛 주홍 일본 단풍잎의 시네마틱 매크로 클로즈업. 얕은 심도, 보케 배경, 사진 사실적 4K

 

영상 레퍼런스 입력

장면을 만들 때 최대 3초 분량의 영상을 레퍼런스로 넣을 수 있다. 영상 레퍼런스를 기준으로 시각적 맥락과 인물 일관성을 유지한다.

 

 

▲ 춤추는 사람 영상 3개와 캐릭터 이미지 3개를 함께 입력. 개는 클래식 무용, 문어는 힙합, 곰은 브레이크댄스를 추도록 지정하고 컷 없는 하나의 연속 숏으로 요청한 결과

 

구글이 제시한 활용 사례

전환 생성 앱
시작·끝 프레임을 넣으면 그 사이 전환을 프리셋이나 프롬프트로 생성한다. 옴니의 전체 맥락 추론 덕에 실제처럼 읽히는 카메라 움직임이 나온다

부동산 영상 앱
카메라가 방을 통과하며 아크를 그리고, 밀고 들어가고, 물러난다. 하루 중 가장 좋은 시간대의 이상적인 상태로 보여주되 존재하지 않는 가구나 디테일은 넣지 않는다

드래프트 룸
360p로 초안 3~4개를 만들어 한 번에 하나씩만 바꿔가며 나란히 비교한다

 

도입 사례

어도비는 옴니 플래시를 Firefly에 통합했다.

 

 

▲ 어도비 Firefly의 영상 편집 기능 시연 (출처: 구글)

 

피그마 위브
이타이 시프 크리에이티브 디렉터는 옴니 플래시가 위브에서 쓸 수 있는 가장 강력한 영상 모델 중 하나라고 밝혔다. 캔버스가 레퍼런스를 붙이고 버전을 분기하며 고유한 것을 만들게 돕는데, 확장 기능과 풍부한 레퍼런스, 4K 해상도가 더해지면서 팀이 영상을 생성하는 단계를 넘어 연출하는 단계로 간다는 설명이다

GMI 클라우드
루이자 궈 마케팅 부사장은 옴니의 두드러진 점이 정확성이라며 디테일이 자세히 들여다봐도 무너지지 않는다고 밝혔다. 교육·설명 콘텐츠 고객에게는 개별 기능보다 그 신뢰성이 중요하며, 옴니가 그동안 AI 영상을 쓸 수 없던 영역에서 실용성을 확보했다는 설명이다

 

런웨이의 제이미 움퍼슨 최고크리에이티브책임자는 옴니 플래시가 프롬프트나 이미지, 영상에서 시작해 생성하거나 편집하는 런웨이의 기존 사용 방식에 자연스럽게 들어맞는다고 말했다.

 

이용 경로

경로 대상
구글 AI 스튜디오 개발자. 제미니 API로 바로 사용
제미니 엔터프라이즈 에이전트 플랫폼 기업
구글 플로우 AI 플러스·프로·울트라 구독자 전 세계
제미니 앱 AI 플러스·프로·울트라 구독자. 장면 확장만 제공

 

개발자용 문서, 쿡북, 프롬프트 가이드도 함께 공개됐다. 구체적인 가격은 구글이 별도 표로 제시했다.

 

의의 및 전망

구독자에게 실질적인 변화는 구글 플로우와 제미니 앱에서 바로 쓸 수 있다는 점이다. 개발자용 API를 거치지 않아도 장면 확장을 시험해볼 수 있다.

 

누적 40초 제한은 여전히 짧다. 며칠 전 다룬 힉스필드 시네마 스튜디오가 한 번에 30초, 페이스리스 스튜디오가 5분을 생성하는 것과 비교하면 용도가 다르다. 장면 확장은 긴 영상을 한 번에 만드는 기능이 아니라 기존 클립을 이어가는 도구에 가깝다.

 

360p 초안을 만들어 비교한 뒤 최종만 고해상도로 올리는 방식은 최근 여러 도구에서 나타나는 흐름이다. Kling IMAGE 3.0 Omni도 초기 구상은 낮은 해상도로, 최종만 4K로 전환하라고 권했다.

 

📅 원문 날짜: 2026년 8월 27일 | 출처: Google Blog