800===Dev Concepts and License/Tech News

Gemini Omni 1.1 Flash 완전 정리: 4K AI 영상 생성과 API 활용법

블로글러 2026. 8. 30. 12:44

AI 영상 생성에서 어려운 부분은 첫 장면을 만드는 일이 아닙니다. 같은 인물과 공간을 유지하면서 장면을 늘리고, 원하는 카메라 움직임으로 연결한 뒤, 최종 해상도까지 끌어올리는 과정이 더 어렵습니다.

Google이 2026년 8월 27일 공개한 Gemini Omni 1.1 Flash는 이 후반 작업을 API로 묶은 영상 생성·편집 모델입니다. 모델 ID는 gemini-omni-1.1-flash이며, Gemini API에서 일반 제공(GA) 상태입니다. 핵심은 40초까지 가능한 장면 연장, 시작·끝 프레임 보간, 빠른 360p 초안, 4K 업스케일입니다.

Gemini Omni 1.1 Flash 핵심 사양

Gemini Omni 1.1 Flash는 텍스트·이미지·영상 입력을 받아 소리가 포함된 영상을 만들고, 대화로 결과를 이어서 편집하는 멀티모달 모델입니다.

공식 개발자 문서와 모델 카드가 밝힌 주요 사양은 다음과 같습니다.

항목 공식 사양
API 모델 ID gemini-omni-1.1-flash
제공 상태 일반 제공(GA)
API 입력 텍스트, 이미지, 영상
출력 오디오가 포함된 영상
컨텍스트 윈도우 1,048,576토큰
기본 영상 길이 3~10초
해상도 360p, 720p, 1080p, 4K
프레임 속도 24fps
화면 비율 16:9, 9:16
편집·연장용 영상 입력 최대 10초

여기서 Omni는 질문에 답하는 일반 챗봇보다 생성형 미디어 모델에 가깝습니다. 모델 카드는 오디오까지 이해하는 구조라고 설명하지만, 현재 API는 별도 오디오 참고 파일과 음성 편집을 지원하지 않습니다. 텍스트 답변을 주로 원한다면 Gemini 3.7 Flash가 더 맞습니다.

새 기능은 영상 제작 흐름을 어떻게 바꾸나

첫째, 기존 장면을 한 번에 최대 10초 연장할 수 있습니다. Omni 1.1은 직전 영상의 마지막 1초만 보는 대신 최대 10초를 참고합니다. 인물, 배경, 이야기 흐름을 더 오래 유지하는 데 유리합니다. 연장을 반복하면 누적 40초까지 만들 수 있습니다.

둘째, 시작 프레임과 끝 프레임을 지정할 수 있습니다. 모델이 두 이미지 사이의 움직임을 생성하므로, 카메라가 인물 주변을 도는 장면이나 화면 안으로 들어가는 줌, 반복 재생용 전환을 설계하기 쉽습니다. 쉽게 말하면 첫 컷과 마지막 컷을 정하고 중간 동작을 맡기는 방식입니다.

셋째, 360p 초안을 먼저 만들 수 있습니다. Google은 360p 생성이 720p보다 시스템 처리량 기준 최대 60% 빠르고 비용은 3분의 1이라고 설명합니다. 구도와 움직임을 여러 번 확인한 뒤 선택한 결과만 고해상도로 올리면 시행착오 비용을 줄일 수 있습니다.

넷째, 최종 결과를 1080p 또는 4K로 업스케일할 수 있습니다. 1080p와 4K는 네이티브 생성 해상도가 아니라 업스케일 결과입니다. 해상도가 높아져도 잘못 생성된 손, 글자, 동작이 자동으로 고쳐지는 것은 아닙니다.

다섯째, 최대 3개의 참고 영상을 입력에 넣을 수 있습니다. 각 영상은 최대 3초이며 오디오는 무시됩니다. 춤이나 카메라 동작을 모델에 보여 주고, 별도 이미지의 캐릭터를 그 동작에 맞춰 배치할 수 있습니다.

Gemini Omni 1.1 Flash API와 가격

Omni 1.1은 Google AI Studio와 유료 Gemini API에서 사용할 수 있습니다. 무료 API 등급은 없습니다. 표준 요금은 입력 100만 토큰당 1.50달러입니다. 출력은 텍스트 100만 토큰당 9달러, 영상 100만 토큰당 17.50달러입니다.

720p 영상은 초당 5,792개의 출력 토큰으로 계산됩니다. Google이 제시한 실효 가격은 약 0.10달러/초입니다. 해상도별 출력 가격은 360p 0.03달러/초, 720p 0.10달러/초, 1080p 0.15달러/초, 4K 0.30달러/초입니다. 10초짜리 720p 결과 한 개라면 약 1달러가 기준입니다. 재생성 횟수와 입력 비용은 별도입니다.

공식 발표의 장면 연장 예시는 Interactions API를 사용합니다. 이전 생성 결과의 interaction_id를 넘기고, 새 지시와 해상도를 지정하는 구조입니다.

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id,
    input=[{"type": "text", "text": "Continue the scene."}],
    response_format={"resolution": "360p"},
)

처음부터 4K로 반복 생성하는 방식은 비효율적입니다. 360p에서 프롬프트와 구도를 좁히고, 720p로 움직임을 확인한 뒤, 승인한 결과만 업스케일하는 흐름이 현실적입니다. 사용량이 많다면 요청별 예산 상한과 호출 기록도 함께 운영해야 합니다.

어떤 제품에 적합하고 무엇을 조심해야 하나

Gemini Omni 1.1 Flash는 영상 제작 도구, 광고 시안 생성기, 스토리보드 앱, 부동산 가상 투어, 교육용 설명 영상에 검토할 만합니다. 특히 사용자가 결과를 보고 자연어로 수정하는 대화형 편집 제품과 잘 맞습니다. Adobe Firefly, Figma Weave, GMI Cloud, Runway가 공식 발표의 적용 사례로 소개됐습니다.

반면 한 번의 요청으로 완성본을 보장하는 모델은 아닙니다. Google DeepMind 모델 카드는 여러 차례 편집할 때의 일관성, 복잡한 움직임, 정확한 글자 표현이 여전히 어렵다고 밝힙니다. 업로드한 영상의 음성을 편집하는 기능도 지원하지 않습니다.

콘텐츠 출처와 권리도 확인해야 합니다. 실제 인물, 브랜드, 음악, 고객 영상은 사용 권한을 먼저 확보해야 합니다. Google은 생성 결과에 SynthID 디지털 워터마크를 적용합니다. 제품에 붙일 때는 금지된 사용 정책, 사용자 신고, 결과 검수, 삭제 절차를 함께 설계해야 합니다.

기존 프리뷰 모델 gemini-omni-flash-preview를 쓰고 있다면 마이그레이션 일정도 필요합니다. Google은 이 엔드포인트를 2026년 9월 30일에 폐기 대상으로 전환합니다. 새 모델 ID로 바꾼 뒤 해상도 매개변수, 연장 흐름, 비용 계산을 다시 시험해야 합니다.

결론: 360p에서 검증하고 4K는 마지막에

Gemini Omni 1.1 Flash의 가치는 영상 한 편을 바로 완성하는 데 있지 않습니다. 초안, 장면 연장, 키프레임 전환, 고해상도 출력을 한 API 흐름으로 연결하는 점이 핵심입니다.

도입할 때는 대표 장면 10~20개를 먼저 고르십시오. 인물 일관성, 카메라 움직임, 프롬프트 재현율, 생성 시간, 장면당 비용을 기록해야 합니다. 360p로 충분히 비교한 뒤 승인된 결과만 1080p나 4K로 올리는 방식이 가장 안전합니다.

참고자료

728x90
반응형