作者:脑洞君
发布时间: 2026-07-20 20:31:02
浏览量:0次



数据来源:谷歌官方基准测试图表(2026-06-30),Elo分数来自LMArena,延迟数据来自Artificial Analysis
核心发现:
vs Seedream v5 Lite(字节跳动):价格几乎持平(0.034 vs 0.035),但Nano Banana 2 Lite的生成Elo高出119分(1251 vs 1132),延迟仅为对手的不到十分之一(4.0秒 vs 45.1秒)。据腾讯新闻报道,这意味着在"图片好不好看"和"能不能嵌入产品交互"两个维度上同时反超。
vs Nano Banana 2(标准版):生成质量仅低约1.5%(1251 vs 1270 Elo),但速度快5倍、价格便宜一半。据Ars Technica报道,对于快速迭代和设计灵感探索场景,Lite版可大幅节省时间和成本。
vs Flux 2 Klein 9B / Grok Imagine Image:虽然价格略高,但生成Elo分别高出182分和77分,质量优势明显。
1.3 能力保持与已知局限
谷歌官方强调,尽管Lite版优先追求速度,但仍保持了以下能力:
提示词遵循:对文字描述的准确还原
角色一致性:多张图中同一角色保持稳定外观
图中文字渲染:生成图像中的文字清晰可读
但Ars Technica测评也指出了当前局限:
图中小尺寸文字容易出现错误
信息图(Infographic)中的数据可能不准确
多次迭代中的角色一致性偶有波动
最大分辨率限制在1K(1024×1024),不支持4K
1.4 默认"低思考"模式
据iaipie.com技术拆解,Nano Banana 2 Lite默认运行在Low-Thinking(低思考)模式下——模型跳过大部分复杂逻辑推理和长链条规划的计算步骤,直接利用训练好的潜空间映射进行快速采样。这是其能将延迟压缩至4秒的关键技术原因。
1.5 全面接入谷歌生态
Nano Banana 2 Lite已全面登录以下平台:
开发者平台:Google AI Studio、Gemini API、Gemini Enterprise Agent Platform
消费端产品:搜索AI模式、Gemini App、NotebookLM、Google Photos、Stitch、Google Flow、Google Ads
二、Gemini Omni Flash:支持对话式编辑的视频生成模型
2.1 核心参数
Gemini Omni Flash(API名称:gemini-omni-flash-preview)于2026年谷歌I/O大会首次亮相,此次正式向开发者开放。据谷歌官方博客公布的信息:

数据来源:谷歌官方博客(2026-06-30)
10秒视频的生成成本为1美元(约合人民币7.2元),在当前主流AI视频生成模型中属于中档定价。
2.2 四大核心能力
据谷歌官方介绍,Omni Flash的核心亮点包括:
① 对话式视频编辑:用户用自然语言描述修改需求(如"把背景换成夜晚""让人物从左边走入"),模型直接在已有视频基础上修改,无需重新生成。最多支持连续三轮迭代编辑。
② 多模态参考输入:支持文本、图像、视频混合输入。用户可以同时传入一张产品图、一段参考视频和文字描述,模型综合理解后生成视频。
③ 真实世界知识:Omni Flash继承了Gemini大模型的知识库,能调用历史、生物学、叙事逻辑等领域知识来构建视频内容。例如,生成一段古罗马场景时,模型能自动还原符合历史事实的服饰和建筑风格。
④ 文字与动作同步:可以将文字、图形直接与视频中的动作联动,通过简单的提示词实现图文与动态画面的精确配合。
2.3 当前版本限制
谷歌官方坦承了以下局限(开发者需提前知悉):

数据来源:谷歌官方博客及腾讯新闻(2026-07-06)
三、串联工作流:一条API打通"文字→图→视频"
3.1 Interactions API串联机制
谷歌此次发布的核心策略,是通过Interactions API将两个模型串联为完整的创作流水线。具体工作流如下:

Interactions API的关键价值在于会话历史与上下文记忆:用户每轮编辑不需要重新描述全部需求,模型记住之前的修改历史,实现渐进式精修。最多支持连续三次迭代编辑。
3.2 三个开源演示应用
为展示这条工作流的应用潜力,谷歌开源了三个Demo应用,开发者可直接在Google AI Studio中查看代码、修改参数并构建自己的变体:
① Anywhere:一秒穿越全世界
场景:社交媒体、旅游营销、个人娱乐
流程:用户上传一张自拍或普通照片 → Nano Banana 2 Lite将背景替换为全球数十个地标场景(埃菲尔铁塔、金字塔、富士山等) → 点击生成的图像,Omni Flash将其转化为该地标的动态视频
体验地址:aistudio.google.com/apps/bundled/anywhere
② Space Lift:空间焕新魔术师
场景:室内设计、房地产中介、家居电商
流程:上传现有房间照片 → Nano Banana 2 Lite自动生成多种装修风格概念图 → 选定风格后,Omni Flash将静态设计图转化为沉浸式漫游视频,让用户在装修前"走进"未来的家
体验地址:aistudio.google.com/apps/bundled/space-lift
③ Omni Product Studio——电商爆款制造机
场景:电商卖家、广告营销、自媒体矩阵
流程:Nano Banana 2 Lite生成静态产品图 → Omni Flash将其转化为电影级电商展示视频,大幅降低中小商家的产品视频拍摄成本
体验地址:aistudio.google.com/apps/bundled/omni-product-studio
数据来源:谷歌官方博客(2026-06-30)、搜狐科技(2026-07-01)、techgenyz.com
3.3 SynthID水印全面集成
两款模型生成的所有内容均内置SynthID数字水印技术。这是一种人眼不可见但可通过工具检测的标识,用户可通过以下方式验证内容是否由AI生成:
Gemini App
Chrome浏览器内置AI工具
Google搜索
据谷歌介绍,SynthID水印即使在内容经过编辑后仍可被识别,有助于降低AI生成虚假内容的传播风险。
四、实战场景与行业影响
4.1 适用场景速查

据腾讯新闻分析,谷歌此次发布的核心意图是补齐可编辑视频生成能力,推动图像、视频、自然语言编辑在Gemini生态内形成连贯的创作链路。
从竞争角度看,Nano Banana 2 Lite在几乎同价位下,对字节Seedream v5 Lite实现了"质量+速度"双反超——这将迫使竞品在延迟优化上加大投入。而Omni Flash的对话式编辑能力,则直接对标Runway、Pika等视频生成工具的编辑功能,区别在于Omni Flash深度整合了Gemini的知识库和多模态理解能力。
五、上手指南
5.1 Nano Banana 2 Lite
在线体验:访问Google AI Studio,选择模型gemini-3.1-flash-lite-image
API调用:参考Gemini API官方文档的图像生成部分
提示词指南:谷歌提供了专门的Nano Banana提示词最佳实践文档
在线体验:访问Google AI Studio,选择模型gemini-omni-flash-previewAPI调用:参考Gemini API官方文档的Omni部分提示词指南:谷歌提供了Omni Flash专属提示词指南
注意:Omni Flash目前为公开预览版(Public Preview),部分功能可能随版本更新调整。区域可用性请查阅官方文档。
互动话题:Nano Banana 2 Lite的4秒出图+Omni Flash的对话式视频编辑,这两个能力组合起来,你觉得最先会在哪个场景大规模落地?电商短视频、室内设计可视化、还是旅游营销?欢迎在评论区聊聊你的判断。

相关阅读



如果觉得有用,随手点个赞、在看、转发。也可以给我个星标⭐,第一时间收到推送

优秀作品赏析
作 者:李思庭
所学课程:2101期学员李思庭作品
作 者:林雪茹
所学课程:2104期学员林雪茹作品
作 者:赵凌
所学课程:2107期学员赵凌作品
作 者:赵燃
所学课程:2107期学员赵燃作品
同学您好!