一天发两个模型,Google 在图像和视频上走了两条完全不同的路

2026-07-02 11:52:29 0点赞 0收藏 0评论

6 月 30 日,Google DeepMind 在同一天放出了两个模型更新:图像侧的 Nano Banana 2 Lite 和视频侧的 Gemini Omni Flash 开发者版本。前者是 Gemini 图像家族最快最便宜的版本,后者是 Omni 系列打头阵的多模态视频模型。

两个产品放在一起看,有意思的不在各自能力——图像和视频的定价路线差太多了。


图像:往死里卷价格

Nano Banana 2 Lite 的核心卖点只有三个字:快、便宜。

4 秒出一张图,输出分辨率固定在 1K。不支持 2K 或 4K,砍掉了高分辨率输出,把工程资源全部砸在速度和成本上。定价是 0.034 美元一张,千张 34 美元。

这个价格比自家标准版 Nano Banana 2 的 0.067 美元/张便宜了一半,比 Pro 版 0.134 美元/张便宜了四分之三。跟 Midjourney 最低档(月付 10 美元约 200 张,合 0.05 美元/张)比,单张也便宜了三分之一。

代价是输出质量的上限被卡住了。1K 分辨率在社交媒体和电商场景下够用,但到不了印刷级或大屏展示级。高分辨率交给标准版和 Pro 版,Lite 只管铺量。

官方推荐开发者直接从原来的 Nano Banana 迁移到 Lite 版,直言前者已过时。Google 的判断是:未来的图像生成,性价比比极致画质重要。

图片图片

视频:还在 premium 区间

图像侧打到地板了,视频侧完全是另一回事。Gemini Omni Flash 定价 0.10 美元/秒。

一段 10 秒视频 1 美元,100 秒就是 10 美元。这跟 Veo 3.1 Fast 持平,但 Omni Flash 多了原生的多模态输入和对话式编辑能力——你可以传一张图、一段音频、一段文字描述,混合输入,然后用自然语言反复修改,不需要每次重写 prompt。

技术上,Omni Flash 不再是单纯的"文生视频"或"图生视频"模型。它原生支持文本、图像、音频、视频四种输入的任意组合,多模态融合是写进架构里的。你给它一张产品照片、一段环境音、一段描述文字,它直接生成一段匹配的视频,连背景音乐和音效都在同一个前向推理中完成。

这也是 Omni 系列的第一枪。把图像、视频、音频的生成能力塞进同一套架构里,Omni Flash 是第一个。往下肯定还有更多。

图像和视频的定价差这么大,说到底就是市场竞争激烈程度不一样。图像生成赛道已经卷成红海——开源模型加商业产品加云 API,选择太多,不拼价格根本抢不到开发者的批量调用需求。而高质量 AI 视频生成能打的没几家,Google 的 Veo 系列加上 Omni Flash 处于第一梯队,没必要急着打价格战。

图片图片

两个产品,一个平台

分开发 Nano Banana 2 Lite 和 Gemini Omni Flash 很容易,但把它们连起来看更有意思。

Google 在 6 月 30 日这天做的事情,是用两个产品卡住了同一个平台的两端:用 Nano Banana 2 Lite 兜住图像生成的高频低客单需求,用 Omni Flash 切入视频生成的高客单市场。两个产品共享 Gemini API 和 Google AI Studio,开发者可以在同一个平台、同一套 API 下完成从图像到视频的完整生成管线。

对于独立开发者和小团队来说,这个平台效应的价值比单个模型的价格或性能更重要。以前你要凑齐一套生成管线,可能要拼好几个平台,现在 Google 一张 API 把所有东西串了。

当然,Omni Flash 目前还是 preview 阶段,GA 时间和正式定价都没定。但已经能看出来了——Google 在把 AI 生成从单点工具往平台能力上推,图像和视频只是第一波。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松