当前位置:首页 >学院新闻

4秒出图023元10秒成片7块钱谷歌双模型打通AI创作全链路

脑洞君作者:脑洞君 发布时间: 2026-07-20 20:31:02 浏览量:0次

2026年6月,谷歌DeepMind一口气发布两款AI生成模型——图像模型Nano Banana 2 Lite和视频模型Gemini Omni Flash,并通过Interactions API将二者串联,实现"文字→图像→视频"的端到端创作流水线。
图片
4秒生成一张1024×1024图像,成本0.034美元/张(约合人民币0.23元);10秒生成一段视频,0.10美元/秒。更关键的是,你可以先用图像模型出图,再把图丢给视频模型生成动态画面,还能用自然语言连续修改三轮——无需重新开始。
这不是两个独立工具的简单叠加,而是谷歌在AI创作流水线上的一次系统性布局。
一、Nano Banana 2 Lite:Nano Banana家族最快最便宜的图像模型
1.1 核心参数
Nano Banana 2 Lite的官方API名称为gemini-3.1-flash-lite-image,定位为"极速、高性价比"的轻量级图像生成模型。据谷歌官方博客公布的数据:
图片
数据来源:谷歌官方博客(blog.google,2026-06-30)及tosea.ai测评报告
谷歌明确建议:仍在使用初代Nano Banana(Gemini 2.5 Flash Image)的开发者直接升级到2 Lite版本,可获得更高质量、更快速度和更低成本。
1.2 竞品横评:同价位下速度碾压
根据谷歌官方公布的四维度基准测试数据(Elo分数来自LMArena人类盲测,延迟数据来自第三方评测平台Artificial Analysis),Nano Banana 2 Lite与主要竞品对比如下:
图片

数据来源:谷歌官方基准测试图表(2026-06-30),Elo分数来自LMArena,延迟数据来自Artificial Analysis

核心发现:

vs Seedream v5 Lite(字节跳动):价格几乎持平(0.034 vs 0.035),但Nano Banana 2 Lite的生成Elo高出119分(1251 vs 1132),延迟仅为对手的不到十分之一(4.0秒 vs 45.1秒)。据腾讯新闻报道,这意味着在"图片好不好看"和"能不能嵌入产品交互"两个维度上同时反超。

vs Nano Banana 2(标准版):生成质量仅低约1.5%(1251 vs 1270 Elo),但速度快5倍、价格便宜一半。据Ars Technica报道,对于快速迭代和设计灵感探索场景,Lite版可大幅节省时间和成本。

vs Flux 2 Klein 9B / Grok Imagine Image:虽然价格略高,但生成Elo分别高出182分和77分,质量优势明显。

1.3 能力保持与已知局限

谷歌官方强调,尽管Lite版优先追求速度,但仍保持了以下能力:

提示词遵循:对文字描述的准确还原

角色一致性:多张图中同一角色保持稳定外观

图中文字渲染:生成图像中的文字清晰可读

但Ars Technica测评也指出了当前局限:

图中小尺寸文字容易出现错误

信息图(Infographic)中的数据可能不准确

多次迭代中的角色一致性偶有波动

最大分辨率限制在1K(1024×1024),不支持4K

1.4 默认"低思考"模式

据iaipie.com技术拆解,Nano Banana 2 Lite默认运行在Low-Thinking(低思考)模式下——模型跳过大部分复杂逻辑推理和长链条规划的计算步骤,直接利用训练好的潜空间映射进行快速采样。这是其能将延迟压缩至4秒的关键技术原因。

1.5 全面接入谷歌生态

Nano Banana 2 Lite已全面登录以下平台:

开发者平台:Google AI Studio、Gemini API、Gemini Enterprise Agent Platform

消费端产品:搜索AI模式、Gemini App、NotebookLM、Google Photos、Stitch、Google Flow、Google Ads

二、Gemini Omni Flash:支持对话式编辑的视频生成模型

2.1 核心参数

Gemini Omni Flash(API名称:gemini-omni-flash-preview)于2026年谷歌I/O大会首次亮相,此次正式向开发者开放。据谷歌官方博客公布的信息:

图片

数据来源:谷歌官方博客(2026-06-30)

10秒视频的生成成本为1美元(约合人民币7.2元),在当前主流AI视频生成模型中属于中档定价。

2.2 四大核心能力

据谷歌官方介绍,Omni Flash的核心亮点包括:

① 对话式视频编辑:用户用自然语言描述修改需求(如"把背景换成夜晚""让人物从左边走入"),模型直接在已有视频基础上修改,无需重新生成。最多支持连续三轮迭代编辑。

② 多模态参考输入:支持文本、图像、视频混合输入。用户可以同时传入一张产品图、一段参考视频和文字描述,模型综合理解后生成视频。

③ 真实世界知识:Omni Flash继承了Gemini大模型的知识库,能调用历史、生物学、叙事逻辑等领域知识来构建视频内容。例如,生成一段古罗马场景时,模型能自动还原符合历史事实的服饰和建筑风格。

④ 文字与动作同步:可以将文字、图形直接与视频中的动作联动,通过简单的提示词实现图文与动态画面的精确配合。

2.3 当前版本限制

谷歌官方坦承了以下局限(开发者需提前知悉):

图片

数据来源:谷歌官方博客及腾讯新闻(2026-07-06)

三、串联工作流:一条API打通"文字→图→视频"

3.1 Interactions API串联机制

谷歌此次发布的核心策略,是通过Interactions API将两个模型串联为完整的创作流水线。具体工作流如下:

图片

Interactions API的关键价值在于会话历史与上下文记忆:用户每轮编辑不需要重新描述全部需求,模型记住之前的修改历史,实现渐进式精修。最多支持连续三次迭代编辑。

3.2 三个开源演示应用

为展示这条工作流的应用潜力,谷歌开源了三个Demo应用,开发者可直接在Google AI Studio中查看代码、修改参数并构建自己的变体:

① Anywhere:一秒穿越全世界

场景:社交媒体、旅游营销、个人娱乐

流程:用户上传一张自拍或普通照片 → Nano Banana 2 Lite将背景替换为全球数十个地标场景(埃菲尔铁塔、金字塔、富士山等) → 点击生成的图像,Omni Flash将其转化为该地标的动态视频

体验地址:aistudio.google.com/apps/bundled/anywhere

② Space Lift:空间焕新魔术师

场景:室内设计、房地产中介、家居电商

流程:上传现有房间照片 → Nano Banana 2 Lite自动生成多种装修风格概念图 → 选定风格后,Omni Flash将静态设计图转化为沉浸式漫游视频,让用户在装修前"走进"未来的家

体验地址:aistudio.google.com/apps/bundled/space-lift

③ Omni Product Studio——电商爆款制造机

场景:电商卖家、广告营销、自媒体矩阵

流程:Nano Banana 2 Lite生成静态产品图 → Omni Flash将其转化为电影级电商展示视频,大幅降低中小商家的产品视频拍摄成本

体验地址:aistudio.google.com/apps/bundled/omni-product-studio

数据来源:谷歌官方博客(2026-06-30)、搜狐科技(2026-07-01)、techgenyz.com

3.3 SynthID水印全面集成

两款模型生成的所有内容均内置SynthID数字水印技术。这是一种人眼不可见但可通过工具检测的标识,用户可通过以下方式验证内容是否由AI生成:

Gemini App

Chrome浏览器内置AI工具

Google搜索

据谷歌介绍,SynthID水印即使在内容经过编辑后仍可被识别,有助于降低AI生成虚假内容的传播风险。

四、实战场景与行业影响

4.1 适用场景速查

图片

4.2 对行业格局的影响

据腾讯新闻分析,谷歌此次发布的核心意图是补齐可编辑视频生成能力,推动图像、视频、自然语言编辑在Gemini生态内形成连贯的创作链路。

从竞争角度看,Nano Banana 2 Lite在几乎同价位下,对字节Seedream v5 Lite实现了"质量+速度"双反超——这将迫使竞品在延迟优化上加大投入。而Omni Flash的对话式编辑能力,则直接对标Runway、Pika等视频生成工具的编辑功能,区别在于Omni Flash深度整合了Gemini的知识库和多模态理解能力。

五、上手指南

5.1 Nano Banana 2 Lite

在线体验:访问Google AI Studio,选择模型gemini-3.1-flash-lite-image

API调用:参考Gemini API官方文档的图像生成部分

提示词指南:谷歌提供了专门的Nano Banana提示词最佳实践文档

5.2 Gemini Omni Flash

在线体验:访问Google AI Studio,选择模型gemini-omni-flash-previewAPI调用:参考Gemini API官方文档的Omni部分提示词指南:谷歌提供了Omni Flash专属提示词指南

注意:Omni Flash目前为公开预览版(Public Preview),部分功能可能随版本更新调整。区域可用性请查阅官方文档。

互动话题:Nano Banana 2 Lite的4秒出图+Omni Flash的对话式视频编辑,这两个能力组合起来,你觉得最先会在哪个场景大规模落地?电商短视频、室内设计可视化、还是旅游营销?欢迎在评论区聊聊你的判断。

如果你已经试过这两个模型,也欢迎分享你的使用体验——特别是Omni Flash的对话式编辑实际效果如何,三轮迭代够不够用。

一 END 

还想看什么?可以在评论区留下你的?,我会继续为大家整理AI前沿资讯~

你也可以点击文末左下角“阅读原文”咨询课程~!

图片

   相关阅读  


图片

免费IP+免费工具+亿级资金:国家队AI漫剧扶持计划全盘点


图片

7个要素讲透AI短剧分镜:景别、角度、构图、光影、色调、动势、转场


图片

半年接100+商单、流水数百万:AI创作者的另一个身份,是"AI账号操盘手"

如果觉得有用,随手点个赞、在看、转发。也可以给我个星标⭐,第一时间收到推送


点击“阅读原文”按提示添加老师
1对1了解课程详情
你懂图片

火星时代教育 影视学院刘老师,为你解答

相关文章

×

同学您好!

您已成功报名0元试学活动,老师会在第一时间与您取得联系,请保持电话畅通!
确定