第一次使用 Nano Banana,可以先完成一个很小的闭环:选择图片生成模式,写清主体、构图、光线和限制项,生成一张图,只检查一个主要问题,再用第二轮提示词修正。不要一开始就堆叠十种风格,也不要同时修改人物、镜头、文字和背景。分轮处理,才看得出哪句话真正有效。
这篇教程适合第一次做文生图、已有参考图但不知道怎么描述修改,以及生成结果反复跑偏的用户。它讲的是通用操作与提示词方法,不代替某个特定产品界面的实时说明。不同入口、账号、模型版本和地区可能显示不同按钮或能力,实际名称以你使用时的页面为准。
先记住四点
- 第一轮只追求主体和构图正确,不急着修全部细节。
- 提示词先写“要什么”,再写镜头、光线和排除项。
- 图生图要明确哪些元素必须保持,哪些元素允许改变。
- 重要文字、商标、产品参数和人物身份必须人工复核。

图片说明:示例板用于解释操作顺序和验收重点,不代表所有 Nano Banana 入口都采用相同界面。图中的场景和对象均为虚构演示,不含真实品牌、人物或产品参数。
生成披露:本页封面于 2026 年 8 月 27 日由编辑使用 Codex 内置图像生成工具制作;工具未返回可核实的模型版本,因此它不是 Nano Banana 模型实测结果。后处理仅包含等比缩放、转为 WebP(Q84)和移除元数据。
Nano Banana 是什么,入口有什么区别?
Nano Banana 是 Google 对 Gemini 原生图像生成与编辑能力的产品名称。它既可以根据文字从零生成图片,也可以结合一张或多张输入图进行编辑、合成和连续迭代。Google 的 Gemini API 图像生成文档会随模型更新列出当前可用版本、输入方式和限制,开发者应以该文档为准。
普通用户可能从 Gemini 应用、AI Studio 或集成了相关模型的第三方产品进入;开发者还可以通过 API 调用。入口不同,按钮名称、可选比例、参考图数量、速度和费用也可能不同。对初学者而言,最重要的不是记住全部型号,而是先判断任务属于哪一种:
| 任务 | 需要准备 | 第一轮目标 |
|---|---|---|
| 文生图 | 一段清楚的文字描述 | 主体、构图和风格方向正确 |
| 图生图编辑 | 一张有权使用的参考图 | 只改变指定区域,其他部分尽量保持 |
| 角色连续图 | 清晰角色参考图和固定特征表 | 脸型、发型、服装标志保持稳定 |
| 商品视觉图 | 清晰商品参考图或完整结构描述 | 商品结构不变,背景和光线符合用途 |
如果你要保留人物或商品身份,应优先使用参考图编辑,并明确“保持项”。如果只是探索海报、插画或概念图,可以从文生图开始。想进一步控制人物,可继续阅读 角色一致性教程;要制作商品主图,可参考 电商主图提示词。
开始前需要准备什么?
准备工作越简单,第一轮越容易判断结果。
- 任务目标: 用一句话说明图片要解决什么问题,例如“为咖啡店活动做一张横版海报背景”。
- 输出用途: 明确社交封面、商品详情页、头像、漫画或打印稿,避免比例和细节方向冲突。
- 参考素材: 只上传你有权使用的图片。人物照片应获得本人授权,商品图应确认使用范围。
- 验收清单: 第一轮最多列四项,例如主体数量、构图位置、文字数量和是否出现水印。
- 迭代规则: 每一轮只改一个主要变量,保留上一轮有效部分。
不需要先掌握摄影术语。镜头、光圈和焦段只是帮助模型理解视觉语言,并不等于真实相机设置。若不确定,用“平视、中景、自然柔光、主体居中偏左”这类可观察描述,通常比堆叠器材名更容易验收。
从零开始:生成第一张图的四个步骤
第一步:把任务缩成一句可验收的结果
先写结果,不写背景故事。例如“生成一张 16:9 的暖色咖啡店活动海报背景,桌上只有一杯无品牌拿铁,右侧留出标题区域”。这句话已经包含画幅、主体、数量、场景和留白。相比“做一张高级、有氛围、很惊艳的咖啡海报”,它更容易检查。
判断这一步是否完成,只看别人能否从一句话回答四个问题:画什么、放在哪里、用什么比例、留给谁使用。答不出来,就继续删减含糊形容词,并补充可见对象。
第二步:补充构图、光线和材质
第二段负责控制视觉。构图写主体位置、视角和留白;光线写方向、软硬和时间;材质写表面特征。不要在同一句里同时要求“正午硬光”和“柔和阴天光”,也不要同时要求“极简纯色背景”和“繁忙街景”。
可以使用这条完整文生图模板:
生成一张横向 16:9 的商业生活方式照片。画面中只有一杯无品牌拿铁,放在浅色橡木桌面上,杯子位于左侧三分之一位置,右侧保留干净留白。背景是安静的现代咖啡店,只有模糊的木质家具和绿色植物,不出现可识别顾客。
使用清晨从相机右后方进入的自然柔光,杯沿和拉花有清楚但不过曝的高光,桌面保留真实木纹。采用平视略俯角的中近景,背景轻微虚化,整体为暖米色与深绿色配色,真实摄影质感。
不要品牌、菜单文字、价格、标志、水印、第二个杯子、重复餐具、变形杯沿、悬浮物体、手或人物;画面中不要出现任何可读文字。
第三步:生成后按优先级检查
先检查结构,再检查美感。推荐顺序是:主体数量和形状、构图位置、文字或标志、人物手脸、光线材质、细小装饰。如果杯子数量已经错误,此时调整色温没有意义。把最严重问题写成一句修正指令,并保留其余条件。
例如第一轮多出一个杯子,不必重新复制整段提示词并加入更多风格词。只写:“保持上一张图的构图、桌面、光线和配色不变;删除右侧多余杯子,画面中只保留左侧一个拿铁杯。”这种局部修正更容易判断。
第四步:只修改一个变量并再次验收
第二轮可以改光线、比例、主体位置或背景中的一个。若同时改四项,即使结果更好,也无法知道是哪条指令生效。把每轮结果和修改语句保留下来,三到五轮后就能形成自己的稳定模板。
用于商业发布时,还要检查图片尺寸、裁切安全区、商标、人物授权、事实性文字和平台规则。生成成功只代表视觉结果可用,不代表已经获得版权、商标或肖像方面的许可。
文生图提示词怎样写得更稳定?
一条稳定提示词可以拆成六部分:用途、主体、环境、构图、光线与材质、排除项。顺序不是绝对规则,但每部分只解决一个问题,便于后续替换。
用途:【社交封面 / 商品详情 / 头像 / 海报背景】
主体:【对象、数量、外观、动作】
环境:【地点、时间、必要道具】
构图:【画幅、视角、主体位置、留白方向】
光线与材质:【光源方向、软硬、颜色、表面特征】
排除项:【不要文字、品牌、水印、重复对象、结构变形】
Google 的 Nano Banana Pro 提示技巧建议把主体、构图、动作、地点和风格写具体。实际写作时还应补上用途和排除项,因为这两项直接决定图片是否适合你的发布场景。
形容词要能转化为可观察结果。“高级”可以改成“低饱和配色、克制高光、大量留白、无多余装饰”;“电影感”可以改成“低机位广角、前景遮挡、冷暖对比、可见体积光”。越能直接检查,越容易在下一轮修正。
图生图怎样保持原图,只改变指定内容?
图生图的核心不是重复描述整张图,而是把“保持项”和“修改项”分开。保持项至少写主体身份、结构、构图和不允许变化的区域;修改项只写一个明确动作。若使用人物照片,还应确认本人同意被编辑,不把生成结果冒充真实事件。
使用我上传的图片作为唯一参考。保持人物的脸型、五官比例、发型长度、肤色、身体姿势、镜头角度和背景构图不变。
只把外套颜色从深蓝色改为纯橄榄绿色,保留原有布料褶皱、拉链、口袋和光影。不要修改内搭、裤子、手部、表情、背景物体或画面比例。
输出自然照片效果,不增加文字、标志、水印、配饰、第二个人物或新的背景元素。
如果结果同时改了脸和背景,先缩小任务:裁切到需要修改的区域,或在新一轮明确“除外套颜色外像素布局尽量保持”。复杂编辑可以拆成多轮,但每轮都要从最近一次正确结果继续,不要把错误结果当成下一轮基准。
如何选择中文提示词还是英文提示词?
中文和英文都可以使用,关键是语义清楚且没有互相冲突。中文适合描述真实需求和逐项修改;英文在摄影、设计和材质术语上可能更简洁。最稳妥的方法不是把同一段机械翻译两遍,而是先用你最熟悉的语言写结构,再保留少量必要专业词。
例如“golden hour”可以直接写成“日落前的黄金时刻暖光”;“shallow depth of field”可以写“浅景深,主体清晰,背景轻微虚化”。如果模型对某个英文风格词理解更好,可以把它放在中文句子后面,但不要堆叠五六个近义风格。
涉及图片内文字时,先缩短内容。正式海报、合同、价格、网址和产品参数仍应后期人工排版。即使当前模型的文字能力改善,逐字复核仍是发布前必做步骤。
四类常见失败怎么修复?
主体数量错误或物体重复
把数量写成“只有一个”“恰好两个”,同时删除会暗示更多对象的场景描述。若画面需要配件,列出固定清单,例如“一只杯子、一把勺子、一块方形托盘”,避免使用“丰富餐具”这类开放词。
人物脸型、服装或身份漂移
使用清晰参考图,并建立固定特征表。先锁定脸型、发型、服装标志和色彩,再改变姿势或场景。多张连续人像可参考 角色一致性的参考图工作流,不要用“完美一致”代替具体特征。
文字乱码或多出无关字符
第一轮尽量不要生成长文字。若必须出现短标题,写明“画面唯一文字是‘NOVA’,只出现一次,顺序为 N-O-V-A”。生成后仍要逐字核对。中文长句、网址和价格建议在设计工具中后期添加。
画面很漂亮但不符合用途
回到提示词第一行补充用途和版式。社交封面需要安全留白,商品图需要结构准确,漫画需要分镜顺序,流程图需要节点和箭头可读。用途比“高级、震撼、梦幻”更能约束结果。
使用限制与发布边界
- 模型结果不保证事实准确。 地图、流程、医学结构、历史服饰和数据图表必须对照可靠来源人工校验。
- 文字不适合盲目信任。 商标、合同、价格、产品参数、网址和包装说明应由人工排版并复核。
- 参考图需要权利基础。 不上传无权使用的图片,不制作冒充真实人物的误导内容。
- 连续性是可改善目标,不是绝对保证。 参考图、固定特征和单变量迭代能降低漂移,但不能承诺每一张完全相同。
- 不同入口能力不同。 模型名称、参考图数量、分辨率、费用和可用地区会变化,以实际页面和官方文档为准。
- 生成图可能带有来源标记。 Google 说明其生成图片包含 SynthID;不要移除平台要求保留的标识,也不要把生成内容描述成真实摄影证据。
常见问题
Nano Banana 需要下载吗?
不一定。许多用户直接通过网页或应用中的 Gemini 图片功能使用,不需要安装所谓的“Nano Banana 安装包”。第三方下载页可能与 Google 无关。需要判断网页、手机端和未知安装包时,可先看 Nano Banana 下载与安全使用指南。
Nano Banana 可以直接用中文提示词吗?
可以。中文适合描述主体、构图、限制项和局部修改。效果不稳定时,先检查语句是否冲突,而不是立即翻译成英文。少量摄影或材质术语可保留英文,但同一概念不必重复堆叠两种语言。
为什么同一条提示词每次结果不同?
生成式模型会产生变化,同一提示词也不等于固定像素输出。要比较某个变量,应保持其他描述、参考图、比例和入口一致,只修改一个字段。记录每轮提示词与结果,比反复随机生成更容易找到稳定方案。
Nano Banana 能保持人物完全一致吗?
不能承诺完全一致。清晰参考图、固定五官和服装特征、相同构图范围及小步编辑能提高连续性,但角度、表情、遮挡和复杂场景仍可能导致漂移。重要人物形象需要人工筛选和后期修正。
生成的 Logo、商品图和海报可以直接商用吗?
不能只凭生成成功判断。你仍需检查训练和平台条款、参考图权利、商标近似、人物授权、产品参数与所在地区规则。正式 Logo 应人工矢量化和查重;商品与广告文案应由业务负责人逐项核验。
参考资料与适用说明
- Google 官方 Gemini API 图像生成文档,复核日期:2026-08-27。本文仅概括通用生成、编辑和模型差异,不固定展示可能变化的价格或额度。
- Google 官方 Nano Banana 图片编辑技巧,复核日期:2026-08-27。本文将其“明确修改内容、通过后续对话继续编辑”的方向改写为可验收的中文步骤。
- Google 官方 Nano Banana Pro 提示技巧,复核日期:2026-08-27。本文采用主体、构图、动作、地点和风格的拆分方法,并补充用途、保持项和发布边界。
- 本文没有使用第三方示例图,也不声称所有入口和模型具有完全相同的界面、额度或输出。涉及具体模型、费用和使用限制时,请以使用当日的官方文档与产品页面为准。