承接上一篇通用大模型横评,本篇专门聚焦视频生成专用模型,面向分镜驱动、短剧 / 漫剧 / 短视频多 Agent 生产工作流做选型参考。 2026.09 现状:单镜头生成已经成熟,核心分化不在能不能出视频,而在:分镜适配度、I2V 参考图一致性、原生音频、异步任务 API、按秒成本、排队策略、是否可本地私有化、对批量重试链路友好度。
很多做 Agent 视频工作流的坑,不是画质坑,而是 API 是同步阻塞、不支持首尾帧、没有参考图能力、计费不透明、排队超长、不适合逐镜头队列化生成。
本文覆盖 Kling、Seedance、Wan、MiniMax H3、Vidu、Veo、Runway、Pika、Sora2,分国产闭源 API、国产开源可部署、海外闭源旗舰三类,从价格、核心定位、画面质量、控制能力、时长分辨率、角色一致性、音频、API 工程特征、适配分镜 Agent 程度做对比。
重要前提:几乎所有生产级视频 API 都是异步 task_id + 轮询模式,和 LLM 同步调用完全不一样,天然适配队列 / 重试 / 状态机,接入 Agent 工作流要单独封装 MCP / 任务 Worker。
一、全模型核心信息总览对比表
表格
| 模型 | 厂商 | 类型 | 计费基准 | 典型单价 (720P) | 单段原生时长 | 最佳输入方式 | 角色参考一致性 | 原生音频 | 可本地部署 | 核心定位 | 最适配场景 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Kling 3.0 Omni | 快手 | 闭源 API | 按秒 | ~0.6-0.9 元 / 秒 | 10s,可续写最长 2min | T2V / I2V / 首尾帧 | 良好,多参考图支持 | ✅ | ❌ | 物理运动、动作、长镜头续写、写实人物 | 短剧动作镜头、实拍风、长片段拼接 |
| Seedance 2.5 | 字节 / 即梦 | 闭源 API | 按秒 / 积分 | ~0.3-0.5 元 / 秒 | 5-15s | I2V 优先、分镜 prompt | 优秀,镜头语言 / 运镜强 | ❌(新版可选) | ❌ | 分镜叙事、短视频、漫剧、主体迁移 | 分镜 Agent 逐镜头生成首选,剪映生态打通 |
| Vidu | 数智新视界 | 闭源 API | 按秒 | ~0.3 元 / 秒 | 10s | 多主体参考图 I2V | 极强,专门做多角色锁定 | ❌ | ❌ | 参考驱动、多角色一致性 | 漫剧、固定 IP 系列内容 |
| Wan 3.0 | 阿里 | 闭源 API / 开源权重 | 按秒 | ~0.25-0.5 元 / 秒 | 10-30s | T2V/I2V | 中等 | ❌ | ✅开源 1.3B/14B | 性价比、长单段、产品演示 | 低成本批量素材、本地开源链路 |
| MiniMax H3 | MiniMax | 开源 + 云端 API | API 按秒 / 本地无成本 | ~0.4 元 / 秒 | 4-15s | T2V / I2V / 多参考 Ref2VA | 优秀,多参考图锁定 | ✅原生音画同步 | ✅ 最低 12G 显存 | 开源本地、音画同出、漫剧 | 私有化工作流、不想外发素材、低成本迭代 |
| Google Veo 3.1 | 闭源 API | 按秒 | ~$0.1-0.4 / 秒 | 8s,支持延伸加长 | 多参考图、导演级 prompt | 中等偏上 | ✅原生音画 | ❌ | 电影级质感、原生音频、广告大片 | 高质量关键镜头、海外业务 | |
| Runway Gen4.5 | Runway | 闭源 API / 会员 | 按 credits | ~$0.2-0.5 / 秒 | 6-12s | 首帧 + 运动控制、视频编辑 | 良好,参考图 + 世界一致性 | ❌ | ❌ | 专业后期、镜头控制、inpainting 编辑 | 二次修改、镜头精修、创意剪辑 Agent |
| Pika 2.0 | Pika | 闭源 API | 按秒 / 会员 | ~$0.15-0.3 / 秒 | 3-8s | 风格化、局部编辑 | 一般 | ❌ | ❌ | 风格化、魔改、短视频创意 | 风格化素材、非叙事单镜头 |
| Sora 2 | OpenAI | 闭源 API | 按秒 | ~$0.2 / 秒 | 20s | T2V | 中等 | 部分支持 | ❌ | 强物理、长叙事单镜头 | 高预算少数关键镜头,国内访问困难 |
几个关键结论前置:
- 分镜驱动、逐镜头 I2V、短剧漫剧工作流:优先 Seedance、Vidu、Kling、MiniMax H3,这四个对参考图 / 角色资产链路最友好。
- 追求本地私有化、数据不出网、无限试错成本:只有 Wan、MiniMax H3 两个主流选项。
- 原生音频同步目前 Veo、MiniMax H3 第一梯队,其余绝大多数视频模型还是「出画面,TTS 后配音」链路,更符合现有 Agent 拆分工作流。
- 长段不是一次性生成 2 分钟,Agent 工程最佳实践依然是拆 5-15 秒分镜逐镜生成,再 TTS+FFmpeg 拼接,这也是上篇市场分析里路线 C 的核心逻辑。
二、分阵营深度拆解
阵营 A:国产闭源 API(绝大多数短剧 / 短视频 Agent 工作流首选)
1. Seedance 2.5(字节即梦底层)
- 价格:720P 性价比好,1080P 加价,积分 / 按秒双计费,异步 API 成熟,适配批量队列
- 质量定位:镜头语言、分镜理解、运镜、角色一致性是当前中文叙事最强一档,天然懂推拉摇移、特写全景,非常适配分镜 Agent 输出结构化 prompt;图文动态化、漫剧、短视频种草是主场。
- 能力:I2V 强于纯文生,支持主体参考迁移,对接剪映生态链路完整。
- 短板:原生单段时长偏短,复杂高速物理动作弱 Kling,原生不带音频。
- Agent 适配度:⭐⭐⭐⭐⭐ 最适合分镜→资产图→I2V 逐镜头生成链路,MCP 封装友好,大量内容团队已经在工作流里用它。
- 不适合:纯物理特效打斗、长镜头一次性生成。
2. Kling 3.0 Omni(可灵 / 快手)
- 价格:中高,高清 / 长片段加价明显,高峰期排队严重。
- 质量定位:物理运动、流体、高速动作、写实人体、首尾帧控制、视频续写最强。适合武侠、实拍、动作类分镜。
- 能力:支持首尾帧控制、片段续写,做镜头之间衔接比别家友好;4K 能力强。
- 短板:纯分镜叙事感、运镜语义弱 Seedance;跨镜头纯 prompt 角色漂移问题依然存在,必须搭配参考资产图;排队是 API 批量工作流大坑。
- Agent 适配度:⭐⭐⭐⭐ 适合作为动作镜头专项模型,混合调度。
3. Vidu
- 价格:偏低,错峰额度友好。
- 质量定位:多主体角色一致性专项强项,专门支持多参考图锁定不同角色,对漫剧 / 多人物短剧非常友好。
- 短板:运动流畅度、镜头语言弱 Seedance/Kling,社区相对小。
- Agent 适配度:⭐⭐⭐⭐ 角色资产库优先选型。
4. Wan 3.0 阿里
- 价格:API 低价梯队,480P 非常便宜。同时开源权重。
- 质量定位:均衡,中文理解不错,单段时长偏长,产品展示、电商素材友好。
- Agent 适配度:⭐⭐⭐ 低成本批量草稿、生成占位镜头、开源备选。
阵营 B:开源可本地部署(MiniMax H3 / Wan 系列)
这一类是私有化 Agent 工作流最关键选项,也是区别纯 API 调用 Demo 的重要工程分支
1. MiniMax H3
- 部署门槛:最低 12G 显存,推荐 24G;支持 768P 原生音画同出,Ref2VA 多参考图角色锁定、首尾帧能力强。2K 超分部分依赖云端 API。
- 协议:社区商用许可,不是 Apache/MIT,上线前细读。
- 价格:本地生成无按秒 API 成本,算力成本前置;同时也有官方异步 API。
- 定位:开源里面最适配分镜漫剧工作流,原生音频 + 多参考一致性是杀手级特性,不用分开视频 + TTS 两条链路。
- 短板:生成速度慢于云端 API,2K / 超分受限,显存门槛高于小参数 Wan。
- Agent 适配度:⭐⭐⭐⭐ 私有化、素材不能出网、迭代试错量大、想封装成本地 MCP 服务首选。
2. Wan 2.x/ 3.0 开源版
- 部署门槛:1.3B 轻量版 8G 显存可跑;14B 版需要 20G+。
- 定位:轻量草稿、T2V、低成本本地占位生成;生态好 ComfyUI 链路成熟。
- 短板:无原生音频,角色一致性一般,更适合单镜头素材,不如 H3 适合多角色叙事短剧。
- Agent 适配度:⭐⭐⭐ 低成本草稿层。
重要提醒:目前没有任何开源视频模型能在消费级显卡稳定跑 1080P 15 秒高质量,且速度远慢云端 API。开源价值是私有化、中间草稿、无限重试成本,不是同等质量替代云端。混合工作流是最优解:本地跑草稿筛选 prompt,优质分镜再调用云端高清 API。
阵营 C:海外闭源(Veo / Runway / Pika / Sora2)
- Google Veo 3.1:原生音画同出、电影级画面质量、导演 prompt 理解强,单价高,国内网络 + 合规门槛,适合预算高的关键镜头,不适合中文短剧批量生产。
- Runway Gen4.5:强在视频编辑、inpaint、运动轨迹控制、已有素材二次修改,不是最优第一遍分镜生成,非常适合审片 Agent 之后的修片 / 补镜头环节。它的价值在工作流后段,不是前段 I2V 生成。
- Pika 2.0:风格化、创意、魔改强,叙事一致性弱,适合创意素材分支。
- Sora 2:长镜头物理强,价格高、访问受限,国内批量业务基本不纳入主链路。
三、几个工程关键维度专项讨论(对接 Agent 工作流必看)
3.1 价格分层 & 批量生产成本
- 低成本草稿层:Wan API / Wan 本地 / MiniMax H3 本地
- 主力分镜生产层:Seedance / Vidu
- 动作 / 高清关键镜头:Kling 3.0
- 后期编辑层:Runway
- 电影级少数镜头:Veo / Sora2
短剧 Agent 工作流成本控制最佳策略:分模型分层调度,不要全链路只用最贵一个模型;大量草稿试镜用低价 / 本地模型,确认分镜 prompt 再上主力高清 API。这和之前大模型分层选型逻辑完全一致。
3.2 角色一致性:模型能力 vs 工作流能力
这是短剧漫剧最大卡点,也是很多人对模型产生误解的地方:
- 没有任何一个模型单靠自由 T2V prompt 可以稳定跨镜头保持人物。
- 当前可靠路径全部是Agent 工作流层解决 > 模型原生能力:角色资产卡 + 参考 I2V / IPAdapter / LoRA > 专门一致性模型 (Vidu/H3/Seedance) > 纯文生视频。
- 这也是我们上篇为什么把「资产 Agent、分镜结构化、引用 asset_id」作为核心环节,而不是指望视频模型一步解决。
3.3 API 异步任务特征,对接多 Agent 队列系统
几乎所有视频 API:
- 提交返回 task_id,轮询状态(排队 / 生成 / 成功 / 失败),不能同步阻塞等待
- 有并发限制、429 限流、高峰期排队差异巨大(Kling 排队 > Seedance > Vidu)
- 失败分:prompt 内容风控拒绝 / 生成崩坏 / 超时 / 资源满,需要不同重试策略
- 产物 URL 有时效,业务侧必须下载归档到自有素材库
结论:封装成统一 MCP/Worker 层非常必要,统一 task 状态、重试、计费统计、模型路由、资产绑定,这是中篇技术选型部分会展开的架构点。
3.4 原生音频怎么选
- MiniMax H3 / Veo:原生音画同出
- 绝大多数主力(Seedance / Kling / Wan / Runway):只出画面,行业主流成熟链路依然是视频画面生成 + 独立 TTS Agent + 字幕时间轴 Agent 拼接。可控性更好、换配音方便、成本拆分清晰,更适配多 Agent 拆解架构。
四、面向「分镜驱动短剧多 Agent 工作流」的选型推荐
正好承接我们前面规划的 AIGC Agent 项目:
- MVP 首选主力生成模型:Seedance 2.5
- I2V、分镜理解、中文、异步 API、排队、成本、一致性综合最均衡,最适配结构化分镜→参考资产→逐镜头生成链路。
- 多角色漫剧优先:Vidu / MiniMax H3
- 多参考图角色锁定更强;如果要求私有化数据不出网选 MiniMax H3 本地。
- 动作 / 写实镜头专项:Kling 3.0
- 做成模型路由分支,分镜识别到打斗 / 高速运动镜头切 Kling。
- 草稿试错、私有化链路:MiniMax H3 / Wan 开源
- 先本地跑分镜小样筛选 prompt,再上云端高清,节省大量积分成本。
- 后期修改、局部重绘:Runway
- 放在审片 Agent 之后,处理坏镜头、局部修正,而不是从头生成。
- TTS / 字幕 / 剪辑保持独立 Agent,不要强行合并进视频生成模型。
五、总结
- 2026 下半年视频模型已经分化:不是谁画质第一,而是各自适配工作流不同环节;分镜批量叙事、短剧漫剧有自己最优子集,不等于通用最强模型。
- Seedance、Kling、Vidu、MiniMax H3 是中文分镜 Agent 工作流最值得优先接入的四个,分别覆盖叙事、动作、多角色、私有化四个差异化位置。
- 开源模型价值在本地草稿、私有化、无限试错,云端闭源 API 适合最终高清成片,混合分层调度是成本 / 质量最优工程方案。
- 所有视频 API 天然异步 task 模式,接入 Agent 系统必须封装队列、状态、重试、资产绑定 MCP 层,和普通 LLM 调用完全不一样。
- 角色一致性优先靠上层分镜 + 资产参考图工作流解决,不要单纯期待底层模型自由生成解决跨镜头一致性。