2026년의 AI 동영상 생성 모델은 모두 같은 경주를 하지 않는다. 텍스트 한 줄로 새 장면을 만드는 모델이 있는가 하면, 여러 이미지·영상·오디오를 레퍼런스로 받아 긴 쇼트를 만드는 모델도 있다. 이미 촬영한 영상을 키프레임으로 제어하며 바꾸는 도구도 있다.
그래서 “가장 좋은 모델”보다 먼저 정해야 할 것은 어떤 쇼트를 어떤 소재로 만들어 어디까지 편집할 것인가다. 여기에 접근 지역, 결제, 상업적 이용 조건, API 버전과 수명까지 포함해야 실제 후보가 남는다. 특히 OpenAI의 공식 Sora 2 동영상 API는 2026년 9월 24일 영구 종료 예정이다.
이 비교는 직접 수행하지 않은 공통 벤치마크의 순위를 제시하지 않는다. 2026년 8월 26일 기준 공식 사양과 수명 주기를 바탕으로, 어떤 모델을 실제 소재로 테스트할지 결정하는 안내서다.
쇼트 요구사항에서 후보를 찾는 빠른 표
| 후보 | 먼저 테스트할 만한 쇼트 | 계약 전에 확인할 경계 |
|---|---|---|
| Seedance 2.5 | 혼합 레퍼런스, 긴 연기, 카메라 동선, 연장·편집 | 정확한 모델 ID, 지역, 할당량, 해당 API 가격 |
| MiniMax H3 | 많은 레퍼런스, 다국어 대화, 오픈 웨이트 조사 | 공개 H3-Base와 비공개 2K 재생성 모듈은 다름 |
| Wan 2.7 | 배포 지역을 명확히 선택해야 하는 오디오 동영상 | Global, International, US, 중국 본토 scope 차이 |
| Kling 3.0 / Omni | 인물 연기, 상호작용, 여러 소재와 네이티브 오디오 | 제품 화면과 API가 같은 기능을 제공하는지 |
| Veo 3.1 / Fast / Lite | Google 제작 환경에서 품질·속도·물량을 나눌 때 | Gemini, Flow, Vertex AI의 제어 차이 |
| Runway Gen-4.5 | 생성기뿐 아니라 팀의 편집 워크플로가 중요할 때 | 2~10초, 720p, 문서화된 웹 경로는 초당 12크레딧 |
| Luma Ray3.2 | 기존 영상이나 키프레임의 의도를 유지해 변환할 때 | 일반 텍스트 투 비디오의 대체재가 아님 |
| Sora 2 | 기존 파이프라인을 다른 모델로 옮길 때 | 공식 API가 2026년 9월 24일 종료 예정 |
표에 있는 수치는 공식 경로의 사양이지, 모든 앱과 집계 서비스에 공통인 약속이 아니다. 같은 모델 이름 아래에서도 내보내기 해상도, 워터마크, 파라미터, 지역, 가격 단위와 업데이트 시점이 달라질 수 있다.

모델을 가르는 기준은 화질보다 넓다
레퍼런스 패키지
Seedance 2.5 공식 발표는 이미지·영상·오디오 혼합 레퍼런스, 편집, 여러 차례 연장과 최대 30초를 설명한다. MiniMax H3는 레퍼런스 모드에서 이미지 9장, 영상 3개, 오디오 3개까지 받되 전체 파일은 12개 이하다. Kling 3.0은 텍스트, 이미지, 오디오, 영상을 한 멀티모달 시스템에서 다룬다.
따라서 모든 모델에 같은 프롬프트만 넣는 비교는 각 모델의 강한 제어 방식을 버릴 수 있다. 쇼트의 목표와 합격 조건은 같게 두되, 각 모델이 설계된 레퍼런스와 시작·끝 프레임을 활용해야 한다.
오디오 동시 생성
H3는 32kHz 스테레오 오디오를 만들고 한국어를 포함한 11개 언어에서 안정적인 대화를 지원한다고 밝힌다. Kling 3.0은 언어, 방언, 억양을 아우르는 대화를 제시한다. Wan 2.7과 Veo 3.1도 공식 경로에 오디오 동영상 생성이 있다.
하지만 ‘오디오 지원’은 대사, 주변음, 효과음, 오디오 레퍼런스가 모두 같은 수준이라는 뜻이 아니다. 테스트에서는 립싱크, 음성의 연속성, 발음, 동작과 효과음 타이밍, 편집기로 옮긴 뒤의 상태를 따로 판정한다.
모델·서비스·API·오픈 웨이트
MiniMax H3가 이 차이를 잘 보여 준다. 공개된 H3-Base 체크포인트의 기본 출력은 짧은 변이 768픽셀이다. MiniMax가 호스팅하는 H3-Regenerate-2K는 기본 결과와 원래 컨텍스트로 2K 결과를 다시 생성하지만, 이 2K 모듈은 아직 오픈소스가 아니다. ‘오픈소스 2K H3’라고 묶으면 GPU 요구량, 라이선스, 비용과 재현성을 잘못 계산한다.
크리에이터 앱은 편집과 내보내기를 더할 수 있고, 공식 API는 더 좁은 파라미터만 노출할 수 있다. 집계 API는 모델 ID, 과금 단위, 지역과 버전 반영 시점이 다를 수 있다. 실제 구매 경로의 문서와 응답을 확인해야 한다.
여덟 후보를 실제 작업에 배치하면
Seedance 2.5 — 긴 연속성과 복합 레퍼런스
긴 퍼포먼스, 복잡한 카메라, 인물·제품·오디오를 함께 유지하는 비용이 큰 작업에 우선 테스트할 만하다. 최대 30초와 다단계 연장은 캐릭터나 사운드를 다시 맞춰야 하는 접점을 줄일 수 있다. 다만 BytePlus 문서는 dreamina-seedance-2-5-260628을 2.0, Fast, Mini와 다른 경로로 적는다. Seedance라는 이름만 보고 2.5 접근을 추정하지 말고 ID, 입력 조합, 지역, 현재 가격을 확인한다. 계열 차이는 2026 Seedance 모델 가이드에서 더 자세히 볼 수 있다.
MiniMax H3 — 개방성과 다국어 제작
H3는 4~15초, 24fps, 32kHz 스테레오 오디오를 지원한다. 인물, 동작, 목소리와 여러 맥락을 함께 참조하는 작업에 맞는다. 오픈 웨이트 파일과 호스팅 API를 별도 후보로 두고, 로컬 GPU, 기본 해상도, 라이선스 의무, 호스팅 2K 재생성 비용을 각각 기록한다.
Wan 2.7 — 배포 scope가 설계 조건일 때
Alibaba Cloud의 International 문서는 2~15초, 720p 또는 1080p, 30fps와 오디오를 적고 있다. Global, International, US, 중국 본토는 별도 scope다. 한 가지 가격 기준으로 International reference-to-video는 현재 720p 초당 $0.10, 1080p 초당 $0.15지만, 다른 모드·지역·Fast 변형에 그대로 적용할 수 없다.
Kling 3.0 — 인물 행동과 네이티브 대화
Kling 3.0과 Omni는 최대 15초이며 생성, 레퍼런스 투 비디오, 영상 안 편집을 한 프레임워크로 설명한다. 아름다운 인물 단독 쇼트보다 대화, 여러 사람의 상호작용, 가림, 카메라 이동을 한 장면에 넣어 보면 제작 위험이 더 잘 드러난다.
Veo 3.1 — Google 환경의 단계별 경로
Google은 Veo 3.1을 품질, Fast를 빠른 제작, Lite를 대량 처리 지향 단계로 배치한다. 오디오, 가로·세로, 4·6·8초를 지원한다. Vertex AI 문서의 3.1 경로는 720p/1080p, 24fps, 이미지 투 비디오, 시작·끝 프레임을 지원하고 API 프롬프트 언어는 영어로 적는다. Gemini나 Flow의 기능이 Vertex 파라미터와 일대일로 대응한다는 뜻은 아니다.
Runway Gen-4.5 — 주변 제작 도구까지 평가
Gen-4.5는 텍스트 또는 이미지에서 2~10초, 720p, 24/25fps를 만든다. Runway는 인과 순서가 바뀌거나, 가려진 물체가 사라지거나, 행동이 성공 쪽으로 치우치는 한계를 공개한다. 실패해야 하는 행동과 가려지는 브랜드 제품을 시험에 넣으면 재작업 비용을 더 현실적으로 볼 수 있다.
Ray3.2 — 새로 만들기보다 변환하기
Ray3.2는 기존 영상이나 최대 16개 키프레임을 출발점으로 삼아 최대 20초의 1080p, HDR/EXR 워크플로를 제공한다. 촬영 원본, 프리비즈, 승인된 구도가 있다면 처음부터 재생성하는 것보다 의도를 지키기 쉽다. 텍스트만 있는 작업과는 같은 입구가 아니다.
Sora 2 — 신규 채택이 아닌 이관
Sora 2 모델 페이지는 동기화 오디오와 표준 720p 초당 $0.10을 적고, API는 4·8·12초를 받는다. 그러나 동영상 생성 메서드는 deprecated다. 기존 사용자는 프롬프트, 레퍼런스, 설정, 채택 결과와 실패 결과를 지금 보존해야 한다. 제3자 서비스가 Sora라는 이름을 계속 써도 OpenAI 공식 API 수명이 연장되지는 않는다.
작은 테스트로 ‘쓸 수 있는 테이크’를 찾기
실제 제작 목록에서 8~12개 쇼트를 뽑는다. 제품 정물, 인물 클로즈업, 여러 인물, 큰 동작, 카메라 이동, 텍스트·브랜드, 대화, 의도적으로 실패해야 하는 행동을 포함한다. 각 모델의 네이티브 제어는 쓰되 납품 조건과 합격 기준은 고정한다.
먼저 다음 기능을 통과하는지 본다.
- 주체, 행동, 구도와 타이밍이 맞는가?
- 움직임과 가림 뒤에도 얼굴, 제품 형태와 문자가 유지되는가?
- 대사, 립싱크, 주변음과 효과음이 쓸 수 있는가?
- 편집, 색보정과 합성 파이프라인에 들어가는가?
- 실패를 자동으로 찾거나 안전하게 고칠 수 있는가?
그다음 모든 생성, 재생성, 해상도 향상, 다운로드, 편집자 개입과 채택 수를 기록한다.
쓸 수 있는 테이크 비용 = 해당 쇼트의 전체 생성·후반 비용 ÷ 채택 테이크 수

초당 가격이 낮아도 네 번 다시 만들면 한 번에 통과하는 비싼 모델보다 총비용이 커질 수 있다. 쇼트 종류마다 기본 모델, 전환 조건, 종료 조건을 남겨 두면 다음 버전이 나와도 전체 제작 방식을 다시 세울 필요가 없다.



