京东WWW'25多模态驱动广告图片生成:高点击率广告图不靠颜值!
你有没有过这种经历?刷淘宝或京东时,有的广告图明明模特精致、色调高级,你却连半秒都不想多停;但有的图看起来平平无奇——比如一双运动鞋摆在户外徒步路上,或者一支口红搁在化妆台的晨光里——你却忍不住点进去看看。其实这背后藏着一个电商圈的“老大难”问题:广告图的“颜值”和“点击率(CTR)”往往不挂钩。
最近读到一篇WWW'25刚发布的论文,提出了一个叫CAIG的新方法,专门解决“美而无效”的广告图困境。作为研究AI在电商领域应用多年的人,我得说,这篇论文的思路戳中了行业痛点——它没把重点只放在“怎么生成好看的图”,而是教会AI“怎么生成让用户愿意点的图”。这篇文章会帮你搞懂这个技术到底牛在哪,以及它未来能帮我们少看多少无效广告。
我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识
先聊个扎心的问题:为啥传统广告图总“抓不住人”?
在讲新技术之前,我们得先搞懂:过去做电商广告图,问题出在哪?
其实不管是人工设计还是早期AI生成,都绕不开两个坑:

第一个坑是“设计师凭感觉,AI凭审美”。比如商家要推一款无线耳机,设计师可能会选黑色科技感背景,觉得“高级”;AI可能会根据颜色搭配算法,生成蓝紫渐变背景,觉得“好看”。但用户会不会点?没人能打包票——也许用户更想看到耳机在通勤包里的实际场景,或者和手机搭配使用的样子,这些“实用感”比“好看”更能打动他们。
第二个坑是“只看绝对点击率,不接地气”。比如有人会说“把CTR做到5%就算成功”,但这毫无意义——手机广告的平均CTR本来就比袜子高,拿5%的标准要求所有品类,就像让短跑运动员和举重运动员比速度,根本不现实。
我们团队之前也试过AI生成广告图,当时最大的挫败感是:生成的图拿给设计师看,评分都很高,但放到电商平台上,点击率却惨不忍睹。直到读了这篇论文我们才明白,核心问题是我们只训练AI“画得好”,却没教它“懂用户”。
新方法CAIG:给AI装了“电商大脑”+“用户雷达”
这篇论文提出的CAIG(CTR驱动广告图生成)方法,本质上是给AI做了两件事:先让它成为“懂电商的专家”,再让它成为“懂用户点击偏好的裁判”,最后通过优化,让它能生成“既贴合产品、又能抓用户”的广告图。

你可以把CAIG想象成一个“电商广告设计师培养计划”:第一步是让学徒(AI)先学透电商知识(比如耳机属于电子产品,要突出便携、音质;口红属于美妆,要突出色号、质地);第二步是让学徒跟着用户反馈学(比如用户更喜欢看口红的试色图,不是单独摆拍);第三步是让学徒练习时不跑偏(比如别给耳机配美食背景,再好看也不相关)。

整个流程分三大核心步骤,我一个个给你拆解开讲。
第一步:给AI上“电商专业课”——预训练
要让AI生成好的广告图,首先得让它“懂产品”。就像设计师要先了解产品卖点,才能设计出针对性的图,AI也需要先学透电商领域的知识。

论文里用了一个120万样本的电商数据集(涵盖各大平台的产品图、标题、价格、评分等),给AI做“岗前培训”,还设计了三个具体任务,帮AI打好基础:
1. “看图说话”任务:让AI描述产品或背景。比如给一张无线耳机图,AI要能说出“这是黑色无线蓝牙耳机,耳机仓呈长方体”——这就像让学徒先学会“观察产品”,知道自己要设计的是什么。
2. “信息整合”任务:让AI根据多维度信息(标题、品类、标签)写产品背景或标题。比如给“标题:无线蓝牙耳buds,品类:电子产品,价格:49.99美元,评分:4.5星”,AI要能生成“高评分平价无线耳机,适合日常通勤”——这相当于让学徒学会“提炼卖点”,知道用户关心什么。
3. “写提示词”任务:让AI根据产品信息,生成或修改“作图指导”。比如针对上面的耳机,AI要能写出“生成户外通勤场景的耳机广告图,背景为地铁站,突出耳机的便携性”——这直接为后续生成广告图打基础,相当于让学徒学会“给画师提需求”。
这里有个很巧妙的设计:他们专门做了个“指令整合函数”,把产品的零散信息(标题、价格、评分等)打包成一句清晰的“任务指令”。就像你跟设计师说“我要给49.99美元、4.5星的无线耳机做广告,背景要显便携,别抢产品风头”,设计师能快速get重点,AI也一样。
我们觉得这一步的价值在于:它没让AI从零开始学,而是直接给了它“电商领域的专业知识”。就像一个新人进公司,先参加岗前培训再上岗,比直接摸索效率高太多。
第二步:给AI配“用户口味裁判”——奖励模型(RM)
学会了“懂产品”,下一步要让AI“懂用户”——知道什么样的图用户会点。这就需要一个“裁判”,告诉AI“这张图比那张图更可能被点击”,这个裁判就是“奖励模型(RM)”。

过去很多方法会让AI直接预测“这张图的CTR是多少”,但论文里反其道而行之,做了个更接地气的设计:不让AI算“绝对点击率”,而是让它比“相对好坏”。
为什么要这么做?举个例子:手机广告的平均CTR可能是8%,袜子的可能是3%,如果直接比“8% vs 3%”,AI会误以为所有袜子广告都“不好”,但其实3%在袜子品类里可能已经是顶尖水平。而“相对对比”就像在同一个班级里比成绩——只拿同一产品的两张图比“哪张更可能被点”,比如给同一双袜子,比“白底摆拍图”和“模特上脚图”哪个点击率高,这样判断才公平。
这个奖励模型是怎么训练的?论文里用了用户的真实点击数据,把同一产品的两张广告图做成“对比题”,让AI学“判断哪张更优”。同时,为了让AI判断更准,他们还加了个“辅助任务”:让AI顺便预测两张图各自的大致CTR。就像裁判不仅要知道“A比B跑得快”,还要大概知道A和B的具体速度,这样判断更全面。
我们觉得这个设计特别懂电商的实际场景——很多技术论文会追求“数学上的完美”,但这篇论文更关注“实际能不能用”。用“相对对比”代替“绝对CTR”,看似简单,却解决了跨品类比较的大难题。
第三步:防止AI“跑偏”——产品中心偏好优化(PCPO)
现在AI既懂产品,又懂用户偏好了,接下来就是让它练习生成高点击率的图。但这里有个新问题:如果只追求点击率,AI可能会“走火入魔”——比如给无线耳机配个美食背景(美食图点击率高),虽然可能吸引点击,但用户点进去发现是耳机,反而会反感,这就是“标题党”式的广告图。

为了避免这个问题,论文提出了“产品中心偏好优化(PCPO)”,简单说就是:让AI在追求点击率的同时,必须紧扣产品本身,不能跑题。
具体怎么做?他们给AI设计了“对比练习”:
1. 先让AI给一个产品(比如耳机)生成两个背景描述,再用这两个描述生成两张广告图;
2. 用前面的奖励模型(RM)判断哪张图点击率更高,把高的叫“好描述(y+)”,低的叫“差描述(y-)”;
3. 关键一步:给“好描述(y+)”配两个“产品信息”——一个是正确的(耳机的标题、图),一个是错误的(比如换成口红的标题、图),然后让AI学“只有当y+配正确产品信息时,才是真的好”。

比如AI生成了“户外通勤场景”这个好描述(y+),如果给它配耳机的信息,AI要知道“这是对的”;如果给它配口红的信息,AI要知道“这是错的,口红不适合户外通勤场景”。
为了让练习更有挑战性,他们还设计了两种“错题”:一种是把产品图遮掉75%(让AI靠剩下的信息判断),另一种是把产品文字信息换成其他品类的(比如把耳机的“电子产品”标签换成“美妆”)。这就像老师故意出“易错题”,让学生在纠错中更深刻地理解“什么是对的”。
这里要提一下,他们用了Stable Diffusion生成背景,还用ControlNet把产品“嵌”进背景——你可以理解成给产品加了个“定位锚”,让AI知道“耳机要放在通勤包的侧兜,光线要和背景一致”,不会像后期P图那样生硬。
我们觉得PCPO是这篇论文最亮眼的创新点——它解决了“好看不相关”的核心矛盾。很多AI生成技术只顾“吸引眼球”,却忘了广告的本质是“推广产品”,而PCPO正好给AI套了个“产品锚点”,让它既会“抓用户”,又不会“丢产品”。
效果怎么样,线上实验来说话
为验证 CAIG 提升广告图点击率的实际效果,作者在电商平台开展了为期一周的测试。测试覆盖范围显著优于同类研究 —— 不仅包含 44 个日常消费品类(远超其他方法仅测试 5 个品类的局限),还为每个产品搭配不同方法生成的两张广告图,最终累计收集到超 1000 万次用户浏览数据,庞大的数据量确保了结果的可靠性。同时,为避免影响用户体验,作者还引入专业广告设计师进行审核,确保所有展示的广告图均满足 “产品与背景匹配、无跑偏” 的基础要求。
测试结果主要围绕 “整体效果” 与 “品类差异” 两大维度展开。从整体数据来看,相较于未优化的基础 AI 模型(baseline),CAIG 使全品类广告图点击率平均提升 7.4%。这一提升幅度具有重要商业意义 —— 在电商场景中,点击率每增加 1%,往往意味着商家销量的显著增长。

细分到具体品类,CAIG 的优势呈现差异化但均表现亮眼:美妆品类(如口红、粉底液)提升最为突出,达 9.5%;时尚品类(服装、鞋履等)提升 7.6%;家电品类(冰箱、洗衣机等)提升 7.8%;电脑品类提升 5.4%;数码品类(耳机、相机等)提升 3.2%。即便提升幅度最小的数码品类,其效果也优于此前主流优化方法。
在与同类方法的对比中,CAIG 的优势进一步凸显:此前专注于广告图点击率优化的 VAM、CG4CTR 方法,全品类平均提升仅为 3.9%、3.7%;近年热门的 DPO 优化方法,平均提升也仅 5.7%,均远低于 CAIG 的 7.4%。这一结果印证了作者设计的 “奖励模型”(即判断用户点击偏好的 “裁判机制”)的有效性 —— 该模型能更精准捕捉用户需求,引导 AI 生成高点击潜力的广告图。
此外,作者还开展了规模更大的 “混合测试”:将 CAIG 生成的广告图融入平台原有广告资源池,在超 6 亿次浏览量的场景下,整体点击率仍额外提升 2%。这一测试进一步证明,CAIG 的效果并非局限于小范围场景,而是能在海量用户的真实环境中持续发挥作用。
最后:一点思考和邀请互动
读完这篇论文,我最大的感受是:AI生成模型在电商领域的应用,终于从“炫技”走向了“实用”。过去很多AI生成技术追求“画得像照片一样”,但忽略了商业场景的核心需求——比如广告图的核心是“点击率”,不是“艺术感”。

CAIG的本质,是让AI学会“站在用户的角度想问题”:用户为什么会点这张图?是因为场景贴近需求,还是因为突出了产品卖点?这种“用户视角”的训练思路,不仅适用于广告图生成,还能用到电商的其他领域——比如商品标题生成、详情页设计等。
最后想问问你:你平时刷电商时,最容易被哪种广告图吸引?是真实的使用场景(比如瑜伽垫铺在客厅),还是突出优惠信息(比如“买一送一”大字),或者是产品细节特写(比如耳机的降噪孔)?欢迎在评论区聊聊你的“点击习惯”——其实这些习惯,未来都可能被AI学去,变成更懂你的广告。
参考资料
• 标题:CTR-Driven Advertising Image Generation with Multimodal Large Language Models
• 作者:Xingye Chen, Wei Feng, Zhenbang Du, Weizhen Wang, Yanyin Chen, Haohan Wang, Linkai Liu, Yaoyu Li, Jinyuan Zhao, Yu Li, Zheng Zhang, Jingjing Lv, Junjie Shen, Zhangang Lin, Jingping Shao, Yuanjie Shao, Xinge You, Changxin Gao, Nong Sang
• 链接:https://arxiv.org/pdf/2502.06823