Qwen-Image 一句话直出(37类型模板库)
依据:阿里官方demo全量案例(references/官方提示词手册.md=金标准全文,references/cases.json=结构化源数据)。
本skill做三件事:类型识别 → 模板填充 → 直出与质检。不发明官方没有的类型。
工作流(收到用户简短需求后)
- 识型:对照下方类型速查表,把用户一句话路由到唯一类型(并列命中时问一句,其余情况不追问)。
- 填槽:读
references/官方提示词手册.md对应小节的官方提示词,把它当槽位模板——从用户话里提取【主体/风格/画面文字/比例】,替换官方示例中的对应成分;用户没说的维度保留官方默认。改写规则按手册§一。 - 输出:
#### 💡 解析:命中类型+画幅+关键槽位(3行内)#### 📋 提示词(可直接复制):完整提示词代码块- 编辑类必须注明所需 inputs(几张参考图/是否掩码)
- 直出(可选):用户要求直接出图时,用
scripts/gen_api.py(需环境变量 DASHSCOPE_API_KEY)调 DashScope 渲染,落盘后继续第5步。 - 质检(文字类必做):画面含大量文字的类型(信息图/试卷/科普卡/时间轴/界面/海报/分镜),出图后用视觉/OCR核对文字内容逐字一致;不一致按
references/qc_rules.md重试(≤2次,每次只收紧文字描述句)。 - 密字类型槽位补全(铁律,D3实证):时间轴/科普卡/脚本表格/分镜字幕等类型,官方prompt常只给版式不给内容→直接出图必生伪字。标准动作:先产出全部画面文字清单(标题/节点/年份/每句描述逐字)→逐字注入prompt→尾部加"除上述文字外不得出现任何其他文字"→出图后OCR回验。实证:AI时间轴逐字注入25要素命中24(96%),不注入则满图伪字。用户没给内容时先帮用户拟好文字清单再确认。
- 多格漫画+字幕=两阶段法(架构性边界,业界共识路线):当类型同时满足「不规则拼贴布局+迷你字幕条×多+杂色背景+文字元素≥10」四条件(如多格漫画/绘本页),单次直出必出伪字——不要尝试修复,直接走两阶段:①各格画面分格生成(禁字令,每格零文字)②PIL真实字体合成标题条/字幕条/格号(文字=排版印上去,100%正确)。参考实现=阿里账号经营/scripts/d3_comic_composite.py(小羊肖恩实测:直出4轮不过→两阶段1次100%)。单图单字幕的格可保留画中字(如HAPPY BIRTHDAY粉末字)。 三附加规(D3三版对照实验实证):①叙事必须短语化——剧情用≤8字名词短语("老街全景雨雾"式),长句入prompt必被当作可渲染文字采样、画到后半段崩成伪字;②文字元素≤14、多格图画布≥1152x2048;③可渲染字幕短句≤12字最佳。
类型速查表(37种)
精选文生图(§二):透明婚纱角色立绘|旅行规划应用界面|数学试卷|学术信息图|建筑讲解图板 中文文生图(§三,智能改写=开):电影角色三视图|IP生日故事|民国漫剧分镜|地标拆解科普卡|主题进化时间轴|美妆广告分镜|巨兽对决故事板 图像编辑(§四,均需参考图):角色风格信息图(1图)|分镜图(1)|全景图(1)|商品场景(1)|饰品佩戴(1)|节日布置(1)|饰品组合展示(1)|传统服饰人像(1)|运动广告(1)|户外人像(1)|室内抓拍(1)|发型编辑(1)|表情编辑(1)|老照片修复(1)|风格化(1)|多人合照(6图)|多品穿戴(5图)|多物布置(10图)|局部编辑·圈选(1)|局部编辑·掩码(2)|局部编辑·涂抹(1) 英文文生图(§五):Editorial portrait|Typography poster|Six-panel storyboard|Product photography
比例与尺寸预设一律取手册§六,不在用户未提时自造。
槽位提取优先级
用户话里的信息 > 官方示例默认。槽位顺序:主体与动作 → 画面内文字(逐字照抄,勿意译)→ 风格/媒介 → 比例。画面文字永远用用户原文,这是Qwen-Image文字渲染质检的判分依据。
与同类skill的分工
提示词重写见 iamyoki/qwen-image-2.1-skill(官方8步改写规范,Apache-2.0);本skill的差异=全类型模板直出+API闭环+文字质检回环。需要深度改写非模板类需求时,可引用其规则文件。
红线
- 官方示例提示词是金标准:只在槽位上动刀,不重构句式结构
- 编辑类缺参考图时,先向用户要图,不要拿文生图模板顶替
- 直出脚本失败不重试超过2次,报错原文给用户
微信扫一扫