教程2026年10月10日4,876 浏览约 25 分钟阅读

Qwen-Image-2.1提示词怎么写?5类案例、Prompt Rewrite与API批量生图教程

Qwen-Image-2.1提示词怎么写才能减少文字错误和画面跑偏?详解Prompt Rewrite原理,提供中文海报、商品摄影、透明背景、人物一致性及局部编辑5类可复制案例,附Python API批量生图代码、参数配置与报错排查。

Qwen-Image-2.1提示词怎么写?5类案例、Prompt Rewrite与API批量生图教程

Qwen-Image-2.1 不仅支持文本生成图片,还具备中文文字渲染、原生 RGBA 透明图、多参考图编辑和局部修改能力。2026 年 9 月 20 日,Qwen 开源 Qwen-Image-2.1,并提供独立的 Prompt Rewrite 模型;10 月 9 日又推出 Turbo 版本及 Pro、Turbo 托管 API。本文从官方提示词改写机制入手,解析结构化 Prompt 的写法,提供中文海报、商品摄影、透明背景、人物一致性和局部编辑五类提示词案例,同时介绍中英文提示词对照方法与批量 API 调用流程。

同样使用 Qwen-Image-2.1,为什么有人能够生成布局清晰、文字完整的宣传海报,有人却反复遇到文字错误、商品形状变化和构图失控?
问题不一定出在模型能力上,也可能是提示词没有准确表达生成目标。
例如,输入“制作一张高级感的咖啡海报”,模型虽然能够识别咖啡、海报和高级感,但无法确定应该使用什么颜色、如何安排标题、商品位于什么位置,以及是否需要在图片中出现中文。
如果只依赖模型自行补充细节,每次生成的结果就可能存在明显差异。
Qwen-Image-2.1 的 Prompt Rewrite 机制提供了另一种解决思路:在图像生成之前,先将简短、模糊的自然语言描述转换为更加明确的视觉指令,让模型获得相对完整的主体、构图、材质、文字和场景信息。
不过,Prompt Rewrite 不是万能的。它能够减少部分指令歧义,却不能保证所有中文文字 100% 正确,也不能代替图像编辑中的主体一致性约束。
对于需要将 AI 生图接入网站、电商系统或自动化内容工作流的开发者而言,理解这套机制比收集大量通用提示词更有价值。

一、Qwen-Image-2.1 更新了什么?为什么值得重新研究提示词?

Qwen-Image-2.1 于 2026 年 9 月 20 日正式开源,与早期单独区分文生图和图像编辑的使用方式相比,它将两类能力统一到了一个图像生成模型中。
根据 Qwen 官方公布的架构信息,模型视觉生成组件包含 70 亿参数,采用 32 层 Single-Stream Diffusion Transformer(单流扩散 Transformer)。文本编码部分使用 Qwen3-VL 8B,图像表示则通过支持 RGBA 的变分自编码器(VAE)处理。
这里的 7B 指视觉生成组件的参数规模,不能直接理解为整个推理系统只有 70 亿参数。
模型主要改进体现在三个方面:其一,文本生成图片和参考图编辑可以通过统一架构完成;其二,模型能够直接生成带 Alpha 通道的透明图片;其三,通过混合粒度注意力机制和前缀 KV Cache 复用,减少扩散过程中的部分重复计算。
官方资料中可以确认以下关键能力:

表格

技术指标官方公开信息
视觉生成组件7B 参数
DiT 网络深度32 层
文本编码器Qwen3-VL 8B
原生生成能力文生图、图像编辑、RGBA 透明图
参考图片最多 10 张
原生分辨率2K 级
原始模型默认去噪步数40 步
Turbo 版本推荐去噪步数8 步
提示词增强两个基于 Qwen3.5-VL 9B 微调的模型

2026 年 10 月 9 日,Qwen-Image-2.1-Turbo 进一步将官方推荐去噪流程缩减为 8 步,同时上线 Pro 和 Turbo 托管 API。
需要区分去噪步数和真实速度。40 步与 8 步是模型采样流程的参数差异,并不意味着端到端请求一定快 5 倍。实际耗时还受硬件、排队、图片尺寸和提示词处理时间影响。

对于提示词工程来说,真正值得关注的是:模型现在能够把文字排版、商品保真、局部编辑和透明图生成放入更加统一的工作流。
但功能越多,提示词越需要明确区分 “必须保持的条件” 和 “允许模型发挥的部分”。

二、Qwen-Image-2.1 提示词怎么写?先理解五个关键要素

一条适合图像生成的 Prompt,并不一定需要几百个形容词。关键在于它能否减少模型需要自行猜测的信息。
对于中文海报、商品摄影和商业素材生成,可以将一条提示词拆成五个部分:主体内容、空间构图、视觉风格、固定约束和输出要求。

主体内容决定画面中有什么,例如一个咖啡杯、一双运动鞋或者一名站在办公室中的人物。
空间构图决定这些元素出现在哪里,包括主体位于画面中央还是右侧、背景是否需要留白、文字是否覆盖主体。
视觉风格描述光照、色彩、材质和摄影语言。与 “高级感、精美、好看” 这种抽象词相比,“暖色侧光、浅景深、磨砂玻璃材质、米白色背景” 更容易形成明确的视觉目标。
固定约束用于定义不能被模型任意改变的信息,例如商品颜色、文字内容、人物服装、Logo 和参考图之间的关系。
输出要求涉及图片比例、尺寸和透明度等内容。需要注意,这些信息不应该全部依赖自然语言描述。真正的宽高尺寸通常还需要在 API 参数中设置。

例如,一条简单提示词:

> 生成一张白色运动鞋的高级商品海报。

可以扩展为:

> 制作一张简洁的运动鞋商品摄影海报。画面中央偏右展示一双白色低帮运动鞋,鞋面为细腻网布材质,鞋底具有清晰的橡胶纹理。主体放置在浅灰色几何展示台上,背景为米白色渐变,左侧保留约三分之一的干净空间用于后期排版。使用柔和侧光,准确表现鞋面纹理与鞋底轮廓,整体呈现代商业产品摄影风格。

修改后的提示词并没有明显增加主体数量,而是补充了空间关系、材质细节和光照信息。
这也是结构化提示词的核心:让每个新增信息都承担明确的视觉控制作用。

需要注意,提示词越长并不必然效果越好。如果同时要求极简背景、复杂霓虹灯、复古胶片、人像大片和工业风格,模型就可能面临相互冲突的条件。
因此,优先级比词汇数量更重要。

三、官方 Prompt Rewrite 是什么?为什么要区分文生图和图片编辑?

Qwen-Image-2.1 的 Prompt Rewrite 并非一个简单的字符串拼接程序。
官方提供了两个独立微调的 Qwen3.5-VL 9B 检查点,分别处理 Text-to-Image(T2I,文生图)和 Image-to-Image(I2I,图像编辑)任务。
两者共享部分运行代码,但承担不同的提示词增强目标。

1. 文生图 Prompt Rewrite:把简短描述转换为完整画面

文生图增强模型的输入是一段自然语言,输出主要包含两个字段:

{
   "rewritten_prompt": "Detailed visual description",
   "wh_ratio": "16:9"
}

其中,rewritten_prompt 是改写后的画面描述,wh_ratio 是建议的宽高比。
官方 T2I 改写规则要求将提示词整理为描述最终画面的英文段落,同时保留用户明确指定的可见文字、对象数量、颜色与位置。
例如,用户要求生成三杯咖啡,改写过程不能擅自将数量变成两杯;如果海报标题指定为中文 “周末限定”,改写过程也不应该把画面中真正需要渲染的文字替换成英文。
因此,提示词改写更像是补充缺失的视觉信息,而不是重新定义创作需求。

这里有一个开发者容易忽略的细节:官方 T2I 增强模型输出英文描述,并不意味着图片中必须出现英文。提示词描述语言和画面最终文字语言是两个不同概念。

2. 图片编辑 Prompt Rewrite:重点控制需要修改的范围

图片编辑的输入除了文本,还包含一张或多张参考图片。
官方输出结构类似:

{
   "rewritten_prompt": "Precise editing instruction",
   "wh_ratio": "",
   "ratio_follow": "<image1>"
}

ratio_follow 表示输出图片应当继承哪张输入图片的宽高比例。
如果编辑任务明确指定新的输出比例,则可能通过 wh_ratio 指定,而不是继续继承原图。

图片编辑的重点不在于补充更多装饰细节,而在于准确区分哪些属性应该改变,哪些内容必须保持。
例如,用户要求将人物衣服从蓝色改为红色,模型不应该顺便改变人物表情、发型、背景光照和构图。
官方编辑增强规则还强调:当输入指令为中文时,改写后的描述性文字使用中文;对于多图输入,则使用 <image1>、<image2> 等标签明确区分图片角色。

因此,文生图与图片编辑不适合直接共用同一套提示词模板。

3. 如何调用官方 Prompt Rewrite?

Qwen 官方已经提供独立的 Prompt Rewrite 代码。
获取项目后,可以进入对应目录安装依赖:

git clone https://github.com/QwenLM/Qwen-Image-2.1.git
cd Qwen-Image-2.1/prompt_rewrite
pip install -r requirements.txt

对于文生图任务,可以采用官方提供的离线批量处理方式:

python run_vllm.py \
  --task t2i \
  --ckpt Qwen/Qwen-Image-2.1-PE-T2I \
  --input data/t2i_example.jsonl \
  --output out.jsonl

对于图片编辑任务,则将任务类型和模型检查点改为:

python run_vllm.py \
  --task edit \
  --ckpt Qwen/Qwen-Image-2.1-PE-I2I \
  --input data/edit_example.jsonl \
  --output out.jsonl

这两种方式运行的是提示词增强模型,不是最终图片生成模型。
执行后得到的是改写结果,开发者还需要将改写后的提示词传入图像生成或编辑服务。

另外,这两个 9B 模型本身需要额外的推理资源。使用官方托管图像 API 时,可以通过服务提供的 prompt_extend 参数启用提示词改写,但不能直接假定云端所有改写路径与上述开源检查点完全一致。
对于只需要使用提示词优化功能的开发者,优先考虑已提供改写能力的托管接口,可以减少自行部署两个模型的工作量。

四、五类 Qwen-Image-2.1 实用提示词案例

相比一次性收集几十条风格词,更有价值的是建立针对不同任务的提示词模板。
下面五组案例分别对应文字排版、商品摄影、透明素材、人物一致性和局部编辑。每组都提供可直接修改的示例,并说明生成后应该检查什么。
这些案例是按照模型公开能力设计的实验方案,不代表已经完成批量实测。

案例一:中文海报生成,如何减少文字错误?

适用场景: 产品活动海报、社交媒体宣传图、中文视觉封面。
中文海报的问题通常不是模型不知道怎样生成文字,而是文字内容、布局和装饰元素容易相互干扰。
例如,提示词只写 “制作一张中文活动海报,标题是夏日轻行”,模型可能自行增加其他宣传文案,也可能将文字融入背景纹理。
更合理的方式是明确所有可读文本及其位置。

提示词示例:

> 制作一张竖版夏季运动品牌活动海报,整体为极简现代平面设计风格。背景使用浅米白色,配合少量薄荷绿色几何图形。画面下半部分展示一双白色轻量运动鞋,采用商业静物摄影质感,光线柔和,鞋面纹理清楚。画面上方居中放置主标题 “夏日轻行”,使用大号、清晰的深绿色无衬线中文字体。主标题下方放置副标题 “舒适,从每一步开始”,字号明显小于主标题。两段文字必须保持原始汉字、标点和顺序,不增加其他可读文字。鞋子与文字区域之间保留充足留白,整体构图干净,适合电商活动海报。

这个示例有两个重要特点:其一,文字内容被明确限定;其二,标题与副标题之间建立了清晰的层级关系。
生成后建议检查字符正确率、文字位置、可读性和主体遮挡情况。
如果文字准确性属于强约束,例如必须展示法律声明、商品型号或复杂价格信息,更稳妥的流程是让模型先生成没有文字的背景,再使用 Pillow、SVG 或前端 Canvas 排版文字。
Prompt Rewrite 能够改善文字生成条件,但不能取代程序化排版对字符准确性的控制。

案例二:商品摄影,如何控制材质和产品外观?

适用场景: 电商商品主图、场景图、详情页素材。
商品摄影与艺术绘画有一个明显区别:画面美观只是目标之一,产品信息不能被随意改变。
例如,要求模型生成 “一只透明玻璃香水瓶”,它可能生成造型漂亮的香水瓶,但瓶盖、标签和包装比例与真实商品并不一致。
如果只是概念设计,可以直接使用文生图。如果要求保持真实商品外观,则应该提供参考图,通过 I2I 方式进行编辑。

提示词示例:

>
> 以输入的商品照片为主要参考,将商品放入明亮、简洁的商业摄影场景。保留原始商品的瓶身轮廓、玻璃透明度、瓶盖结构、标签位置和颜色。商品位于画面中央,放置在浅米色石材展示台上,背景为暖白色室内空间。左上方有柔和自然光,玻璃边缘出现真实的高光和折射,台面保留合理的接触阴影。只调整场景、布光和商品摆放环境,不重新设计商品包装,不增加额外标签或文字。

在这里,提示词应该把商品的固定属性放在比场景描述更高的优先级。
如果使用多张参考图,可以分别提供商品正面、侧面和局部细节,让模型获得更完整的结构信息。
不过,多参考图不等于真实的三维建模约束。对于商标文字、特殊花纹和尺寸比例,仍然需要通过图片比对进行复核。
尤其是在电商场景中,模型生成的图片不能仅凭视觉相似就直接认定符合平台主图规范。具体是否可以上架,还要依据销售平台对背景、文字、商品真实性和合成图片的要求判断。

案例三:透明背景图片,如何生成真正的 RGBA 素材?

适用场景: App 图标、贴纸、商品抠图、设计素材库。
Qwen-Image-2.1 的一个重要变化是原生支持透明通道。
传统做法常常是先生成白底图片,再调用背景移除模型进行抠图。Qwen-Image-2.1 则能够直接根据提示词生成带 Alpha 通道的图片。
官方推荐在提示词中明确表达 RGBA 和透明背景要求。

提示词示例:

> This is an RGBA image with transparency. A small orange robot mascot holding a blue notebook, front three-quarter view, rounded body, smooth plastic material, clean silhouette, soft highlights, centered composition, complete visible outline, isolated subject. The image has alpha channel and the background is transparent.

这段提示词明确了主体、材质、视角和透明输出需求。
它与 “在白色背景上生成一个机器人” 并不相同。
白色背景图片通常仍然是普通 RGB 图像;透明图片则需要真实的 Alpha 通道,用于表示不同像素的不透明程度。

例如,使用 Python Pillow 可以检查图片是否含有有效透明像素:

from PIL import Image
image = Image.open("result.png")
if "A" in image.getbands():
    alpha = image.getchannel("A")
    min_alpha, max_alpha = alpha.getextrema()
    print("存在Alpha通道")
    print("Alpha范围:", min_alpha, max_alpha)
    print("是否包含透明像素:", min_alpha < 255)
else:
    print("图片没有Alpha通道")

如果图片含有 Alpha 通道,但全部像素的 Alpha 值都是 255,说明图像依然完全不透明。
如果透明背景已经正确生成,还应进一步检查主体边缘是否存在白边、阴影断裂或半透明区域异常。
这些问题往往在将素材叠加到深色背景时才会显现,因此建议同时在白色、黑色和高饱和度背景上检查最终效果。

需要注意,模型支持透明生成,不代表任意 API 平台都能完整保留 RGBA 数据。调用时还应确认返回格式以及图片保存流程没有丢失 Alpha 通道。

案例四:人物一致性,如何避免换场景后人物变样?

适用场景: 虚拟模特、角色视觉素材、人物写真、故事分镜。
人物一致性是图像生成任务中的常见难点。
例如,用户上传一张人物照片,希望生成同一人物在咖啡馆、办公室和户外的不同场景。模型虽然能够理解 “同一个人”,但仍可能改变脸型、发型、服饰或身材比例。
对于这类任务,提示词需要区分身份来源与目标场景。

提示词示例:

> 使用输入图片中的成年人物作为身份参考,生成一张现代城市咖啡馆中的半身摄影照片。保留参考人物的面部轮廓、五官比例、发型、发色和整体年龄特征。人物身穿与参考图一致的服装,坐在木质咖啡桌旁,身体微微侧向镜头,表情自然。背景为温暖的咖啡馆内部,包含柔和窗光、浅棕色木质家具和适度虚化的环境元素。仅调整人物姿态、光照和所在场景,尽量保持人物身份特征及服装细节一致。

如果使用多张参考图,还可以更明确地定义每张图片的作用。

> 以 <image1> 提供人物身份和面部特征,以 <image2> 提供服装款式,以 <image3> 提供目标背景。将人物放入目标场景,保持人物五官特征以及服装的颜色、材质和主要结构,调整光照以匹配背景环境。

这类任务建议重点观察五官差异、服装结构、手部细节和人物比例。
模型本身支持最多 10 张参考图,并不代表上传越多效果越好。如果参考图光照、角度和身份信息相互冲突,也可能降低一致性。
更重要的是,提示词中的 “保持一致” 属于生成约束,而不是像素级的身份锁定。对商业人像或品牌角色有严格要求时,仍然需要建立固定参考资产和人工验收机制。

案例五:局部图片编辑,如何做到只改需要修改的部分?

适用场景: 更换服装颜色、修改商品背景、修复局部瑕疵、调整海报文字。
局部编辑与整图重新生成不同。
用户通常希望只改变一个目标区域,其余内容尽量维持原样。
例如,给定一张室内商品照片,只想把桌面上的花瓶改成蓝色,却不希望模型改变桌面、背景和光照。
如果只输入 “把花瓶改成蓝色”,模型可能重新生成整张图片。
因此,局部编辑提示词应明确目标对象、目标变化和保留条件。

提示词示例:

> 以输入图片为基础,仅修改画面中央玻璃花瓶的颜色,将原本的透明无色玻璃调整为浅蓝色半透明玻璃。保留花瓶原有形状、尺寸、瓶口结构和摆放位置,保持玻璃材质的透光性与反射特征。桌面、花朵、背景家具、相机视角和整体构图保持不变。调整后的花瓶颜色应清晰可辨,同时让透射光与周围环境协调。

对于复杂场景,仅靠文字描述目标区域可能仍然不够准确。
Qwen-Image-2.1 的原始模型支持通过圆圈、涂画标注或独立蒙版辅助局部编辑。开发者可以结合标注信息减少目标区域识别歧义。

但这里必须区分模型能力与 API 接口能力。
当前阿里云百炼的 OpenAI 兼容图片接口并不支持 /images/edits 的 multipart 文件上传和 mask 参数。因此,不能把本地 Diffusers 或其他原生推理流程中的蒙版能力,直接假定为所有托管 API 都支持。
如果所用接口不接收蒙版,通常应使用参考图和文本指令完成编辑;若业务需要严格的区域控制,则应选择支持对应编辑控制输入的推理部署方式。

五、中文提示词和英文提示词,哪个更适合 Qwen-Image-2.1?

Qwen-Image-2.1 支持中文和英文提示词,但不能因此直接得出两种语言生成效果完全相同的结论。
语言差异可能影响模型对细节、空间关系和文字渲染要求的理解。
如果需要进行可靠比较,应该把测试拆成两个问题。
一个问题是描述语言是否影响视觉生成。另一个问题是画面中的中文或英文文字是否能够正确渲染。
这两个问题不能混为一谈。

例如,下面两段提示词描述的是相近的画面目标。
中文提示词:

>
> 一张极简风格的商业产品摄影图片。主体是一只白色陶瓷咖啡杯,放在浅色木桌上,背景为柔和的米白色墙面。左侧自然光照射杯身,杯子位于画面右侧,左侧保留留白,整体使用低饱和度暖色调。

英文提示词:

>
> A minimalist commercial product photograph featuring a white ceramic coffee cup on a light wooden table. A soft beige wall forms the background. Natural daylight enters from the left, creating gentle highlights on the cup. The cup is positioned on the right side, leaving clean negative space on the left, with a warm, low-saturation color palette.

要比较两种语言,应当保证两个版本描述的主体、构图、色彩和材质尽可能一致。
如果英文版本比中文版本额外增加大量摄影术语,那么结果差异就可能来自信息密度,而不是语言本身。

对于带文字的图片,还应另外设计测试。例如固定海报上的中文标题,只切换画面描述语言,观察中文字符正确率是否发生变化。
官方 T2I Prompt Rewrite 默认会生成英文视觉描述,但仍要求保留需要显示在图片中的原始文本。这也说明,提示词语言与画面文字内容可以独立控制。

对于需要生成中文海报的开发者,没有必要为了追求英文描述而把中文标题翻译成英文。
更值得优化的是明确文字内容、层级和布局,并在生成后执行文字正确性检查。

六、短提示词、结构化提示词和 Prompt Rewrite,如何设计对照实验?

如果想判断 Prompt Rewrite 是否真正提高生成质量,不能只展示一张看起来不错的图片。
至少应该比较三个实验组。

表格

实验组输入方式观察重点
A:短提示词直接提交简短自然语言模型自行补全细节的能力
B:结构化提示词人工明确主体、构图与约束手动控制的稳定性
C:Prompt Rewrite使用官方增强机制处理提示词自动补全能否减少歧义

例如,三个实验组都围绕 “制作一张中文咖啡宣传海报” 展开,保持同一个模型版本、输出尺寸和主要内容要求。
为了减少随机采样带来的影响,可以选择四个固定随机种子,让每组分别生成四张图片。
这样单个场景得到 12 张样本。
如果测试五类场景,总计就是 60 张图片。这个规模能够帮助开发者初步观察不同提示词策略的差异,但仍不应直接视为具有统计显著性的模型评测。

测试过程中,还需要注意官方托管 API 的 prompt_extend 默认值可能为 true。
如果测试人工结构化提示词时没有关闭自动改写,那么 B 组实际上也可能经过提示词增强,导致实验条件混淆。
因此,A 组与 B 组应显式设置 prompt_extend=false,C 组再开启改写,并记录所使用的改写模式。

建议将结果按照以下维度评估:

表格

评估指标检查内容
主体准确性对象数量、类型、形态是否符合要求
文字准确性中文字符、英文字符和标点是否正确
构图符合度主体位置、比例、留白是否合理
参考图保真度颜色、外形、身份特征是否被改变
编辑范围准确性是否修改了未要求变化的区域
输出可用性是否需要人工修图或重新生成

还可以记录每组生成耗时、失败次数和返工次数。
对于商业场景,单张图片生成质量并不是唯一指标。完成一张真正可用的素材需要多少次生成,往往比单次生成耗时更重要。

七、Qwen-Image-2.1 API 如何调用?从单张生成到批量任务

当提示词模板逐渐稳定后,可以将生成流程从网页操作迁移到 API。
截至 2026 年 10 月 10 日,Qwen-Image-2.1 已经提供 Pro、Turbo 托管 API,也可以通过 Diffusers、vLLM-Omni 等开源推理框架部署。
不同接入方式的参数结构并不完全一致。
例如,阿里云百炼的 OpenAI 兼容图像接口采用 /images/generations,并支持通过扩展字段进行图像编辑和提示词改写。

1. 配置 API 环境

先安装必要的 Python 依赖:

pip install -U openai requests

在终端中准备 API Key 和 Base URL。
示例使用官方 OpenAI 兼容接口的配置形式:

export IMAGE_API_KEY="YOUR_API_KEY"
export IMAGE_BASE_URL="https://YOUR_WORKSPACE.cn-beijing.maas.aliyuncs.com/compatible-mode/v1"
export IMAGE_MODEL="qwen-image-2.1-pro"

其中 YOUR_WORKSPACE 需要替换为实际业务空间 ID,API Key 也必须属于对应地域。
qwen-image-2.1-pro 是官方托管版本的模型标识,不应与开源模型仓库路径 Qwen/Qwen-Image-2.1 混淆。

2. 发送单张图片请求

使用 OpenAI Python SDK 的 Images 接口,可以采用以下方式:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["IMAGE_API_KEY"],
    base_url=os.environ["IMAGE_BASE_URL"],
    timeout=600.0,
)

response = client.images.generate(
    model=os.getenv("IMAGE_MODEL", "qwen-image-2.1-pro"),
    prompt=(
        "制作一张极简咖啡产品海报,"
        "主体是一只白色陶瓷咖啡杯,"
        "位于画面中央,柔和侧光,"
        "米白色背景,清晰的产品纹理。"
    ),
    size="1024x1024",
    n=1,
    extra_body={
        "prompt_extend": True,
        "prompt_extend_mode": "direct",
        "seed": 42
    }
)

for image in response.data:
    print(image.url)

这里有几个参数需要单独解释。
size 控制实际生成尺寸;n 指定生成图片数量;seed 用于控制随机采样;prompt_extend 决定是否开启提示词智能改写。
官方托管接口还提供 prompt_extend_mode,其中 direct 是直接提示词增强模式,适用于文生图和图生图;agent 是进一步的智能体增强模式,目前适用于文生图,不适用于图生图编辑。

需要注意,prompt_extend、prompt_extend_mode 和 seed 在这里属于服务商扩展参数,不是所有 OpenAI 兼容图片服务都必须实现的标准字段。

仅仅能够使用 OpenAI SDK,并不能证明提示词改写、多参考图编辑和透明图输出都具有相同兼容性。

3. 如何进行批量生成并保存结果?

实际项目往往需要批量生成不同尺寸和内容的图片。
例如,运营系统可能需要为多个商品分别生成场景图,而不是每次手工复制提示词。
可以将任务定义为一个数组,再通过 Python 并发执行。

下面是一个可按实际服务环境修改的示例:

import os
import json
from pathlib import Path
from concurrent.futures import ThreadPoolExecutor, as_completed

import requests
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["IMAGE_API_KEY"],
    base_url=os.environ["IMAGE_BASE_URL"],
    timeout=600.0,
    max_retries=2,
)

model = os.getenv("IMAGE_MODEL", "qwen-image-2.1-pro")

output_dir = Path("generated_images")
output_dir.mkdir(exist_ok=True)

tasks = [
    {
        "id": "coffee_01",
        "prompt": "白色陶瓷咖啡杯,极简商业摄影,柔和自然光。",
        "seed": 42
    },
    {
        "id": "shoes_01",
        "prompt": "白色运动鞋商品摄影,浅灰色背景,突出鞋面纹理。",
        "seed": 43
    },
    {
        "id": "poster_01",
        "prompt": "极简夏季海报,标题为“夏日轻行”,绿色视觉风格。",
        "seed": 44
    }
]

def generate_image(task):
    response = client.images.generate(
        model=model,
        prompt=task["prompt"],
        size="1024x1024",
        n=1,
        extra_body={
            "prompt_extend": True,
            "prompt_extend_mode": "direct",
            "seed": task["seed"]
        }
    )

    image_url = response.data[0].url
    if not image_url:
        raise ValueError("API未返回图片URL,请检查响应格式")

    download = requests.get(image_url, timeout=120)
    download.raise_for_status()

    file_path = output_dir / f"{task['id']}.png"
    file_path.write_bytes(download.content)

    return {
        "id": task["id"],
        "model": model,
        "seed": task["seed"],
        "file": str(file_path),
        "request_id": getattr(response, "_request_id", None)
    }

results = []
with ThreadPoolExecutor(max_workers=2) as executor:
    futures = {
        executor.submit(generate_image, task): task["id"]
        for task in tasks
    }

    for future in as_completed(futures):
        try:
            results.append(future.result())
        except Exception as exc:
            print(f"{futures[future]} 生成失败: {exc}")

(output_dir / "results.json").write_text(
    json.dumps(results, ensure_ascii=False, indent=2),
    encoding="utf-8"
)

以上代码是依据官方接口结构编写的示例,不代表已经在特定账户上完成执行。
这里将并发数设置为 2,是为了避免初次接入时提交过多请求。真实业务应根据账户限流、生成耗时与服务稳定性调整并发,遇到 429 时使用退避重试,并记录失败任务以便重新执行。

需要特别注意返回图片的保存问题。
官方托管接口可能返回具有有效期的临时图片 URL。阿里云百炼当前文档提示图像 URL 保留时间为 24 小时,因此应在任务完成后及时下载并保存到自己的文件存储系统,不要把临时 URL 直接作为长期素材地址。
对于更大规模的任务,建议使用包含任务队列、状态查询、失败重试和结果归档的异步工作流。不能将同步图片请求简单理解为已经具备完整的异步批处理能力。

八、Qwen-Image-2.1 API 接入容易遇到哪些问题?

在开发环境中,图像 API 的失败原因比普通文本生成更加多样。
除了密钥、模型和请求路径问题,还需要检查输入图片格式、尺寸、提示词改写参数及输出资源保存方式。

表格

问题可能原因排查方向
401 UnauthorizedAPI Key 无效或地域不匹配检查密钥和接口所属地域
404 Not Found接口路径不正确核对完整 Base URL
400 Invalid Parameter模型不支持某个参数检查模型版本和扩展字段
图像编辑失败图片无法访问或格式不合法检查图片 URL、大小与编码
生成图片不透明未生成有效 Alpha 数据检查 RGBA 输出和透明像素
中文文字错误字符生成或排版不准确缩短文案,明确逐字要求
批量请求超时图片生成耗时超过客户端超时增大超时时间或使用异步任务
图片 URL 失效临时资源过期生成后立即下载归档

其中,有三个细节值得单独关注。
一是不同 API 对输出尺寸的表示方式可能不同。OpenAI 兼容模式使用 1024x1024 形式,而部分原生接口使用 1024*1024。直接复制不同协议的参数,可能造成格式错误。
二是模型本身支持的功能不一定完整暴露在所有兼容接口中。例如,Qwen-Image-2.1 支持局部编辑,但当前官方 OpenAI 兼容接口并不直接支持 /images/edits 的蒙版上传形式。
三是提示词改写可能改变部分画面细节。如果业务要求严格遵守品牌颜色、固定文字和对象数量,应当比较改写前后结果,并保留自动改写关闭选项。

同时要注意,某些常见图像 API 参数并不适用于 Qwen-Image-2.1。例如当前官方托管文档将 negative_prompt 支持范围限定在其他指定模型系列中,因此不能默认把它用于 2.1 版本。
对于业务系统,建议将模型能力和具体接口能力分开维护。只有经过接口验证的参数才应进入生产环境配置。

九、Qwen-Image-2.1 Pro、Turbo 和自部署应该如何选择?

Qwen-Image-2.1 提供不同的运行方式,开发者需要根据图片质量要求、生成频率和基础设施条件进行选择。
如果只是开发原型、测试提示词或制作少量图片,托管 API 往往更容易接入,因为不需要自行准备 GPU 环境。
如果已经有 GPU 推理基础设施,并希望深入控制采样参数、参考图和图片编辑流程,可以部署开源模型。
对于大量生成任务,Turbo 值得纳入测试。但不应该仅凭它采用 8 步去噪,就断言在所有任务上都能以相同质量替代 Pro 或原始模型。
尤其是中文海报和高保真商品图,仍然需要在相同任务条件下对比字符准确率、局部细节、生成耗时与返工次数。

对 API 中转服务的使用者来说,真正需要检查的是模型接入完整度。如果使用统一入口调用不同图像模型,最好确认每个模型分别支持哪些扩展参数,而不是假设所有图像接口完全一致。

以 koalaAPI 为统一模型调用入口的项目为例,若后台已提供对应 Qwen-Image-2.1 服务,可以将模型选择、生成记录和调用统计纳入同一工作流;实际能否使用 Prompt Rewrite、RGBA 或多参考图编辑,仍应以已开放接口和测试结果为准。

另外,图像模型的实际成本不能只按照单次请求价格判断。
假设模型 A 单张图片价格较低,但每生成 10 张只有 5 张满足要求,那么它的有效素材成本可能高于单价稍高、但可用率更高的模型 B。
对电商、广告和内容平台来说,可以采用:

> 单张可用图片成本 = 全部生成费用 ÷ 最终验收通过的图片数量。

这比单次生成价格更适合用于评估真实业务价值。

十、怎样建立可复用的 Qwen-Image-2.1 提示词工作流?

当提示词开始用于批量业务时,不建议继续完全依赖人工复制和修改。
更合理的方式,是将提示词、参数和生成结果分开管理。
例如,建立一份结构化任务记录:

{
   "task_id": "product_001",
   "task_type": "product_photography",
   "model": "qwen-image-2.1-pro",
   "prompt_version": "v1.2",
   "prompt": "白色运动鞋商品摄影...",
   "size": "1024x1024",
   "seed": 42,
   "prompt_extend": true,
   "reference_images": [],
   "status": "pending"
}

其中,prompt_version 用于记录提示词版本,reference_images 用于管理输入图片,status 则由业务系统维护任务执行状态。
这些字段属于自定义任务管理结构,并不代表可以原样提交给图像 API。

当一张图片生成失败或需要修改时,开发者可以追溯当时使用的模型版本、提示词、随机种子和参考资源,再决定是调整提示词还是更换生成参数。
还应该将人工验收结果纳入数据记录,例如文字是否准确、主体是否变形、是否符合品牌配色、是否可以直接使用。
积累一定数量的数据后,开发者可以筛选表现较稳定的提示词模板,并逐步形成针对海报、商品摄影、透明贴纸与局部编辑的独立任务配置。

这样一来,Prompt Rewrite 不只是一个改善图片观感的工具,而是能够参与内容生产流程的标准化模块。

结语

Qwen-Image-2.1 提示词优化的关键,并不是不断增加 “超高清”“电影质感”“大师级摄影” 这样的修饰语,而是让模型清楚理解画面中什么必须出现、什么可以变化,以及哪些内容需要严格保留。
官方 Prompt Rewrite 为短提示词提供了自动补充信息的能力,但文生图与图片编辑的控制逻辑并不相同。前者强调完整画面的构建,后者更加关注局部修改与参考内容保真。
对于中文海报,需要重点约束字符与版面;对于商品摄影,应当优先保持主体外观;对于透明素材,需要检查真实 Alpha 通道;对于人物和局部编辑,则需要明确参考图角色和编辑范围。
在 API 应用中,还应该结合模型版本、请求参数、提示词改写开关和结果质量,建立可以重复验证的生成流程。
Qwen-Image-2.1 的意义不仅在于能够生成更复杂的图片,更在于图像生成、透明素材和多参考编辑已经能够围绕统一模型组织起来。随着 Pro、Turbo API 的开放,开发者可以进一步将这些能力接入自己的应用和内容生产系统。
真正需要优化的不是提示词长度,而是提示词的可控性、结果的可验证性,以及批量生成过程中的有效素材成本。

了解更多: https://koalaapi.com/

标签Qwen-Image-2.1Prompt Rewrite提示词工程AI生图图像编辑RGBA透明背景koalaAPI
Koala API · 一站式大模型 API 中转

把博客读到的,落地到你的下一个项目

国内直连 · 兼容 OpenAI SDK · GPT / Claude / Gemini 等主流模型聚合

延伸阅读

免费注册