视频生成首次按秒收费:Gemini Omni 1.1 Flash 4K 每秒 0.3 美元,360p 到 4K 全档位定价
AI 视频生成第一次有了按秒计价的价格表。8 月 27 日,Google 把视频生成模型 Gemini Omni 1.1 Flash 推向正式版,同时公开了从 360p 到 4K 的全档位每秒价格:360p 每秒 0.03 美元,720p 每秒 0.10 美元,1080p 每秒 0.15 美元,4K 每秒 0.30 美元。这意味着生成一条 40 秒的 4K 视频,光模型输出就要 12 美元,而同样的内容用 360p 草稿模式只要 1.2 美元,价格差 10 倍。
按秒计价这件事本身,比任何单个数字都值得琢磨。过去视频生成工具要么按月订阅、要么按条计费,价格是个模糊的盒子;现在 Google 把视频生成拆成和文本 token 一样的计量单位,价格透明度一下子拉到和大模型 API 同级。对内容生产团队来说,这既是成本可预算化的好消息,也是"每一秒都看得见账单"的新压力。
一、全档位价格表:一秒多少钱
先放完整价格表,这是理解整个产品定位的钥匙:
| 分辨率 | 定位 | 每秒价格(美元) | 40 秒成本 |
|---|---|---|---|
| 360p | 草稿预览 | 0.03 | 1.2 |
| 720p | 标准输出 | 0.10 | 4.0 |
| 1080p | 高清成片 | 0.15 | 6.0 |
| 4K | 专业级成片 | 0.30 | 12.0 |
四个档位覆盖了从快速试稿到正式交付的完整链路。360p 是草稿模式,Google 官方说它比 720p 快约 60%、成本只有三分之一,适合在正式渲染前先看节奏和构图;720p 是默认输出;1080p 和 4K 属于超分档,模型先生成较低分辨率再上采样到高清,适合广告、品牌、影视前期这类对画质有要求的场景。
把价格换算成实际场景更直观。一段 10 秒的 720p 视频,输出成本约 1 美元;同样 10 秒推到 4K,约 3 美元。一条 40 秒的 720p 宣传片,模型输出约 4 美元。对商业团队来说这个量级的成本完全可接受,甚至比请实拍团队便宜几个数量级;但对高频试错、一天生成几十条的创作者来说,账单会累积得很快,选对档位就成了真正的成本管理。
二、计费机制:按 token 折算的每秒定价
按秒标价是结果,背后的计费机制仍是按 token。Google 的视频输出 token 定价是每百万 token 17.5 美元,每秒视频按分辨率折算成固定数量的 token:360p 每秒 1931 个,720p 每秒 5792 个,1080p 每秒 8688 个,4K 每秒 17376 个。用每秒 token 数乘以单价,正好落在前面那张价格表上,所以"每秒 0.1 美元"本质是 Google 替开发者算好的等效价格。
这个设计有个对开发者友好的点:视频生成的计量和文本生成统一了。输入侧文本、图片、视频、音频统一按每百万 token 1.5 美元计价,输出侧文本 token 每百万 9 美元、视频 token 每百万 17.5 美元。也就是说,一个同时用文本和视频的应用,可以把两者塞进同一个 token 预算模型里统一规划,而不需要分别对接两套计费体系。
对视频需求波动大的团队,这个计费方式也意味着成本随用量线性伸缩。没有月费、没有阶梯套餐,用多少付多少。短片的边际成本低,长片、4K 片子的成本按比例上升,这让"先算账再开工"成为可能,也让产品定价时能精确地把模型成本打进客单价,而不是拍脑袋估个区间。
三、能力升级:40 秒场景延伸和首尾帧控制
价格之外,1.1 版本的能力比预览版明显补齐。最核心的是场景延伸:模型可以分析一段已有的视频,并接着它往下生成,按 10 秒一个增量延伸,最多累计到 40 秒。这解决了 AI 视频生成最大的痛点之一,也就是单段太短、没法讲完一个完整镜头,现在创作者可以先拍 10 秒,再让模型沿着镜头语言续写,人物动作和画面风格能保持连贯。
首尾帧控制是另一个关键能力。给定第一帧和最后一帧,模型能在两个画面之间补出中间的运动过程,相当于给导演一个"按起止点反推过程"的工具。这在分镜设计和动态故事版阶段非常实用,创作者可以先用两张关键画面定住叙事,再让模型填充中间的连续运动,叙事节奏的掌控权回到了人手里。
还有两点工程上的补充。一是风格参考,开发者可以上传最多 3 秒的外部真实素材,让生成结果在角色、动作或视觉风格上贴近既有素材,品牌方可以把自家产品的实际画面喂进去,保证 AI 生成片段和实拍片段放在一起不跳戏。二是 360p 草稿模式配合超分,先低成本快速出多版草稿、选定方向后再渲染高清,把试错成本压到了极低。
四、与自家 Veo 3.1 对照:价格锚怎么定
Google 把 Omni 1.1 Flash 的价格放在自家视频模型序列里对照,能看出它的定位。Veo 3.1 Lite 主打更便宜:720p 每秒 0.05 美元、1080p 每秒 0.08 美元;Veo 3.1 Fast 主打快速生成:720p 每秒 0.10 美元、1080p 每秒 0.12 美元、4K 每秒 0.30 美元。Omni 1.1 Flash 的 4K 定价 0.30 美元和 Veo 3.1 Fast 的 4K 完全一致,说明在旗舰画质档,Google 用同一个价格锚把所有模型钉在同一条线上。
这个定价策略的潜台词是:分辨率和速度决定价格,模型之间的能力差异被刻意模糊,让开发者按"要什么画质、要多快"选模型,而不是按"哪个模型更高级"选。对开发者来说,这种对标降低了选择成本;对行业来说,4K 每秒 0.3 美元这个锚点,很可能成为后续所有 AI 视频厂商对标或绕开的参照系,就像文本 token 价格战里每百万 token 的报价一样。
对照整个行业,AI 视频生成已经进入"按秒算钱"的时代。一个月前 Veo 3.1 系列和各家工具还在按条或按月卖,如今头部厂商把价格打到了秒级粒度,意味着视频生成从"尝鲜玩具"加速滑向"生产资料"。当成本可以精确到秒,企业客户才能把 AI 视频纳入正式的预算科目,这个价格表本身就是在为规模化买单铺路。
五、对视频生产者的实际影响
按秒收费对三类人影响最深。第一类是广告和营销团队,过去用 AI 视频做几十版素材再挑选,现在每一版草稿都花钱,360p 草稿模式就是为这种高频试错设计的,先低成本看方向、再花大钱渲染终版。第二类是独立创作者和 MCN,4K 单价是 720p 的三倍,选错档位等于白烧钱,流程上应该默认 720p 或 1080p 起步,只在交付给品牌客户时上 4K。第三类是平台和 SaaS,如果产品内嵌视频生成能力,每秒计费让成本可以直接转嫁给终端用户,按用量付费的产品模型第一次在视频上成立。
实际操作层面的建议有三条。一是把草稿和成片流程分开,能用 360p 看清的不上 4K,这是成本下降最快的一步。二是善用场景延伸和首尾帧,用已有片段续写比从零生成更容易控制成本,因为单段时长能被有效复用。三是留意上下文窗口和长度上限,40 秒是当前单条累计上限,长视频要规划成多段拼接,成本预估要按段算而不是按总时长一次性算。
对科技从业者来说,Omni 1.1 Flash 的价值不只是"又多了一个视频模型",而是它把视频生成的计量单位从"条"改成了"秒"。文本 token 化用了几年才让大模型成本透明到可预算,视频按秒计价则是一步到位。当成本可预测、能力可控制、档位可选择,AI 视频才真正具备进入商业生产流程的资格。接下来值得盯的是两件事:这个 0.3 美元每秒的 4K 价格锚,会被行业向上还是向下打破;以及按秒计费之后,AI 视频的调用量会不会像当年文本 token 一样迎来爆发。