第一次为什么失败:图很好看,却根本不能交付
设想一个非常常见的需求:“给原创幻想IP的合作页面做一张高级主视觉——年轻男主、灵狼、霓虹雨夜、优雅城市、电影感。”生成工具几分钟就可能给出一张很惊艳的图,但这张图仍然完全不能用。
不同版本里男主外套结构一直变;灵狼更像普通哈士奇,没有稳定识别点;城市里出现一些似是而非的品牌字样;画面没有给中英文标题留安全区域;灯光很戏剧,却正好把未来要放合作产品的位置压暗;更麻烦的是,没有人记录每张参考图到底承担什么作用。
问题不一定出在提示词,而是团队在定义“交付物”之前就开始生产。
把任务改写成美术指导简报:网页16:9 Hero;男主占右下三分之一;灵狼必须保持白色毛色、耳朵轮廓和与人物的比例关系;左上留安静区域给双语标题;避免可读的第三方标识;整体是潮湿夜景,但脸部仍要清楚;最终资产不仅要有成图,还要保留可编辑构图方案,以及参考图和人工修改的记录。
到了这里,“生成”才拥有一个比“看起来不错”更明确的目标。
先给参考图分工,再碰生成工具
团队手里有六张参考:已批准人物设定、灵狼转面图、雨夜街拍、奢侈品编辑版式、材质板,以及一张旧活动视觉。如果不加区分全部一起丢进去,最容易出现的就是“参考串味”。
先给它们分工。
| 参考资料 | 主要任务 | 必须保留 | 不能盲目借用 |
|---|---|---|---|
| 人物设定 | 身份 | 脸部特征、外套结构 | 原设定背景 |
| 灵狼转面图 | 身份/比例 | 耳形、白毛、体型关系 | 原姿势 |
| 雨夜街拍 | 氛围 | 湿地反光、雾感 | 标牌、路人 |
| 编辑版式 | 构图 | 留白逻辑 | 对方品牌风格 |
| 材质板 | 表面质感 | 金属/布料对比 | 具体物体造型 |
| 旧活动视觉 | 约束 | 合作方安全区域 | 已过期产品细节 |
当前一些工具已经把“风格参考”和“结构参考”做成不同概念,例如Adobe Firefly当前文档就分别介绍了style reference与structure reference。具体按钮会随产品和版本变化,但更耐用的方法不是背按钮,而是先把为什么要用这张参考写清楚。
权利问题则必须另过一道门。网上能看到、能下载的图,不等于你自然拥有上传、变换和商业发布它的权利。来源权利、客户授权和当前工具条款都要分别核对。
先解决构图,再花时间做质感
第二轮只回答一个问题:缩成缩略图以后,画面关系还对不对?
先忽略刺绣、雨滴和微小纹理,把人物和灵狼当成大形体,生成或搭出几套构图。凡是侵占标题安全区、让白狼淹没在背景里、或者一到手机裁切就把人物切坏的方案,直接淘汰。
选定一个版本后,把选择理由记下来,例如:“C版能让男主脸部留在安全裁切区,白狼轮廓正好压在更暗的墙面上,同时左上有大约三分之一的视觉安静区。”
这个比例不需要升级成永恒标准。真正有价值的是可追溯:另一个设计师一看就知道,这套构图究竟在保护什么。
接下来再处理身份一致性。对照批准过的人物锚点,而不是只看“像不像”。头发方向对吗?外套扣位对吗?白狼耳朵几何还认得出来吗?如果这些关键身份仍在漂移,就不要先去修水洼反光。
好的流程,会先稳定那些最贵、最难返工的决定,然后才把时间花到细节上。
把迭代变成受控实验,而不是形容词堆积
构图和身份稳定后,迭代才进入真正有效的阶段:每一轮只回答一类问题。
A轮检查空间逻辑:手和道具怎么接触、狼爪落点是否合理、台阶透视、反射、家具、前后关系有没有错。B轮看材质行为:被雨打湿的布不能像镀铬板,拉丝金属也不能融进皮肤。C轮直接进入交付环境:桌面裁切、手机裁切、文字覆盖、深色页面环境、压缩以后和缩略图状态下还是否成立。
每一轮只记录一行:问题 → 改了什么 → 结果 → 保留/淘汰。
这样可以阻止提示词膨胀。没有记录时,团队很容易不断加“更电影、更高级、更细节”,最后没人知道到底是哪次变化真的让图变好。受控迭代应该尽量只动一个变量家族,其余保持稳定。
如果某个局部缺陷需要大量修补,也要算时间账。传统paint-over、3D块面、摄影或合成,有时比再生成三十轮更快、更可控。生成工具只是生产路径之一,不是每个问题的默认答案。
人类创作、来源记录和最终审查包
商业项目不要只保存最后一张JPEG。
至少保留批准过的简报、重要参考资料的使用权限、关键中间版本、编辑源文件,以及一份很短的人工贡献说明,例如构图调整、合成、遮罩、paint-over、排版和最终选择。在美国语境下,美国版权局2025年关于生成式AI版权性的报告强调,保护仍取决于作品中是否存在足够的人类创作表达,单靠提示词并不会自动建立这种作者性。具体法律结果始终取决于实际作品,所以记录有价值,但记录本身不是法律保证。
如果流程支持Content Credentials或其他基于C2PA的来源信息,也要理解边界:这类机制可以记录有关来源和编辑历史的声明,却不是一台自动认证“内容真实、安全、已获授权、质量优秀”的机器。
在这个案例里,最终审查包应该包括:美术简报、参考图角色表、迭代记录、分层最终文件、导出设置,以及所用工具能够提供的来源信息。把这样一包资料交给合作方,显然比“这是我们挑出来最好看的一张”更容易进入真正商业流程。
最后预检:真正可用,意味着它能活在真实页面里
在宣布完成前,把图真的放进页面Mockup。加上真实的中英文标题、导航、CTA和合作方标识;检查响应式裁切;用网站真实压缩设置导出;在亮屏和暗屏上都看一次。
然后做“事实宣称”检查。如果视觉里出现具体产品、地点、制服、历史物件或品牌特征,要问:用户会不会把这张图当成真实产品或事实呈现?纯幻想插画可以高度风格化;放在购买按钮旁边的产品图,却承担完全不同的误导风险。
最后请一个没有参与生成的人做一次红队式快速检查:寻找意外出现的标志、人体结构错误、文化符号、可能造成安全误解的画面,以及任何和页面文字直接冲突之处。
所以最终资产从来不只是“那一次生成结果”。它是需求定义、参考纪律、受控迭代、人工编辑、权利与来源审查、真实交付环境测试共同产生的结果。这才是从粗糙AI绘图想法走到可交付创作资产之间真正的距离。
这个案例最后留下什么可复用方法
把整个案例压缩后,可以得到一条非常清楚的顺序:先定义交付场景,给参考资料分工,先解决构图,再稳定身份;每轮只处理一类问题;记录人工编辑;审查权利与来源;最后在真实使用环境里测试成图。
这里故意没有把流程绑死在某个模型上。图像生成系统变化极快,一个产品、一个版本里存在的控制项,换个工具就可能没有。涉及具体功能时,应始终以当前官方文档为准。
真正耐用的能力,是在不确定里做美术指导。成熟团队能讲清楚什么必须稳定、什么允许变化、审查者怎么识别失败,以及什么时候继续生成已经不再是成本最低的解决方式。
这也能避开“提示词魔法师”陷阱。真正有价值的交付,不是一句神秘文字偶然成功一次,而是一套其他合格创作者能够检查、重复并继续改进的流程。
最终选图不要只比“哪张最震撼”
进入最后选择前,不要让剩下几张图互相比“谁更好看”,而要让它们逐项回答最初的简报。
| 指标 | 本项目权重 | A版 | B版 | C版 |
|---|---|---|---|---|
| 男主和灵狼身份稳定 | 高 | 弱 | 强 | 强 |
| 标题安全留白 | 高 | 强 | 弱 | 强 |
| 手机裁切 | 高 | 弱 | 中 | 强 |
| 产品/合作方区域 | 中 | 强 | 中 | 强 |
| 空间合理性 | 中 | 中 | 强 | 强 |
| 预计修补成本 | 中 | 高 | 低 | 中 |
这张表不需要变成伪科学打分。它只是防止某一个极其惊艳的优点,把致命交付问题遮住。雨夜光影再漂亮,如果手机裁切根本不能用,对这份简报来说,它就不是“差一点完成”,而是另一个概念。
C版胜出,是因为它同时通过高优先约束,而且修补成本可控。被淘汰的图也不是完全浪费,可以按它们做得最好的部分标记:灯光、气氛、姿势——前提当然是团队有权保留这些内部资料。
这一选择步骤还能让审批对话变干净。美术指导不必说“我就是更喜欢B”,而可以说:“B的脸最好,但只有C同时保住身份、文字区和手机裁切;我们会在局部编辑阶段借鉴B的脸部处理。”这才是生产团队真正能执行的决定。
合作方中途改需求时,先判断是“新概念”还是“新版本”
假设做到一半,合作方突然要求再出一张方形社媒图,同时希望白狼更突出。弱流程往往只能从头来,因为原始画面从一开始就是为单一扁平构图优化的。
受控流程会先回到简报:这次要求到底改变了视觉层级,还是只改变交付格式?如果白狼现在必须升级为共同主焦点,那就是层级变化,应重新打开构图阶段,先做方形块面,保护人物身份锚点,只复用那些在新关系里仍然成立的元素。
如果需求只是“另外需要一个方形衍生版本”,就不必重造概念,而应该保留原层级,认真设计另一套裁切或延展,绝不要直接把原图硬拉伸。
区分新概念和新呈现版本,可以省掉大量返工。这一判断也应该进入交接记录,因为授权、审批和来源记录可能需要跟着衍生资产继续走,而不能因为文件换了比例就突然消失。
最后连文件命名也要进入可交付流程
批准后的文件最好按活动、资产角色、比例和版本命名,而不是按提示词情绪命名。例如 collab-hero-desktop-16x9-v07-approved,下一个人一看就知道自己打开的是什么。可编辑源文件也应和交付导出一起保留。文件管理一点都不酷,但它能避免团队做完前面所有审查,最后却把“final-final-2”错当正式稿发出去。
保留少量被淘汰版本,并写清为什么淘汰
不用永远保存每一张生成图,但应该有意识保留少量被淘汰版本,而且写明原因。一张可能白狼身份最稳定,却没有文字区;另一张气氛极好,但男主外套结构已经错掉。
这些带标签的失败,对团队培训很有价值。它能让下一次简报更清楚,也帮助审查者分辨“只是审美偏好”与“反复出现的技术问题”。
当然,失败库不能变成无治理的第三方参考或客户机密仓库。保留策略仍要服从项目真实权限和信息处理规则。
一个小而有注释的失败资料夹,经常比只放最终赢家的画廊更能教人,因为它保留了成图已经看不见的决策过程。
Sources
- U.S. Copyright Office — Copyright and Artificial Intelligence
- U.S. Copyright Office — Copyright and Artificial Intelligence, Part 2 (2025 summary)
- C2PA — Content Credentials Specification 2.2
- NIST — AI Risk Management Framework
- Adobe Firefly — Structure reference
- Adobe Firefly API — Style image reference
- Adobe Firefly API — Structure image reference