当AI试图假装自己是一个逛淘宝的人

你有没有想过,一个购物软件的推荐算法,到底是怎么被测试好坏的?

正常情况下,公司得把新算法真的放到线上,让成千上万的真实用户去点、去逛、去买,然后看数据。这个过程贵,慢,还有风险,万一新算法把用户体验搞砸了,公司损失的是实打实的订单和口碑。所以工程师们一直有个念想:能不能造一个假的用户,让它在电脑里模拟真实人类的购物行为,这样就能在上线之前先跑一遍看看效果?

这个念想听起来简单,做起来却出奇地难。阿里巴巴和几所高校的研究者们最近发了一篇论文,叫做RecVerse,专门来啃这块硬骨头。他们发现,之前所有试图模拟人类购物行为的AI,都存在两个说不出口的毛病,一个是记性问题,一个是学习方式问题。这篇文章我们就来聊聊,这两个毛病到底是什么,RecVerse又是怎么治的。

先搞清楚,这件事到底难在哪

想象你现在要开发一个AI,让它假装是一个刷淘宝的人。它得先"看到"手机屏幕上的商品图片,然后做出决定:往下滑一滑?点开这件衣服看看详情?加入购物车?还是直接下单?

这事儿如果只做一步两步,其实不难,市面上已经有不少AI客服和购物助手能干这个。真正麻烦的是,一次真实的购物过程往往要经过几十次操作,滑动、点击、返回、比较、犹豫、再点击,前前后后可能要看几十张页面。AI要模拟的不是一次点击,而是一整段连贯的、有逻辑的、甚至有点"人情味"的浏览旅程。

在这篇论文之前,业内大概有三条技术路线在尝试解决这个问题。第一条路是很老派的规则模型,工程师们提前设定好一套数学公式,描述用户可能怎么反应,但这套公式面对现在电商App五花八门的界面设计,简直是刻舟求剑,规则写得再细也跟不上真实世界的复杂程度。第二条路是用大语言模型,也就是那些能聊天、能写文章的AI,让它读一段商品的文字描述,然后猜用户会怎么选。这条路的问题也很明显:真实购物很大程度上是被图片、颜色、页面布局这些视觉信息影响的,你把商品简化成一段文字介绍,等于抹掉了用户决策时最关键的那部分信息。第三条路,也是最新的方向,让AI直接"看"手机截图,就像人眼睛看到的那样。这条路方向是对的,但研究者们发现,现有的方案要么严重依赖人工写好的提示词,没有真正针对任务训练过;要么虽然训练了,但训练的方式本身有问题。

这个"训练方式有问题"是什么意思?这就要说到本文真正想解决的两个核心矛盾了。

记忆的两难:记多了噎着,记少了失忆

第一个矛盾,论文里称为"记忆挑战"。

设想一下,一次购物会话,AI要连续看几十张页面截图。如果每看一张就往AI的"大脑"里塞一张,看到第三十张的时候,前面二十九张全部堆在那儿,这就是所谓的"全部拼接"策略。问题来了:AI处理信息是有一个容量上限的,这个上限在技术里叫做"上下文窗口"。

上下文窗口:AI一次能同时处理和记住的信息总量,好比一个人短期记忆能装下的东西是有限的,超过这个量,前面记的东西就开始模糊甚至被挤掉。

论文里做了个实验很说明问题,见下面这张图的描述:他们让AI在对话里逐步加入视觉记忆片段,从0个加到8个,同时观察准确率和消耗的计算资源(论文里用"Token"计量,可以理解成AI处理信息花费的"字数成本")。结果发现,加到3到5个片段的时候,准确率涨得最快;再往上加,准确率几乎不再提升,甚至在超过5个之后开始轻微下滑,而计算成本却一路往上涨了11%。

这组数据背后藏着一个很反直觉的结论:给AI喂更多历史记录,不代表它会表现得更像真实用户,超过某个点之后,多余的信息反而成了噪音,拖累判断力,还白白烧钱。

这就好比你让一个朋友帮你回忆昨天逛街的经过,如果你只给他看最近三张照片,他能说出个大概;但如果你把三十张照片一股脑全甩给他,让他一边翻一边讲,他反而会因为信息过载而语无伦次,把重点全说岔了。人脑处理信息从来不是"记得越多越聪明",超载之后反而会顾此失彼。这不是一个装饰性的比喻,这恰恰是论文里那张图想说明的技术真相:如果不对记忆做取舍,硬塞给AI全部历史,结果就是准确率不升反降,计算成本却持续攀升,这是实打实的代价,而不是理论上的担忧。

那反过来,另一个极端做法是什么呢?干脆不记了,或者只留最粗暴的几条规则做筛选,把大部分历史直接丢掉。这样确实省了计算资源,但AI就成了"金鱼记忆",看不到几步之前用户到底比较过哪些商品、纠结过什么,很多购物决策其实是"回头账",比如用户在第五页看中了一件衬衫,滑了十几页之后又划回去点了它,这种跨页面的关联,一旦历史被砍掉,AI根本无从判断。

研究者们的思路是,与其在"全记"和"全忘"之间二选一,不如学学人脑的记忆分层机制。人的大脑其实有好几套记忆系统在同时工作,从转瞬即逝的视觉印象,到这次逛街过程中发生的具体事件,再到长期沉淀下来的稳定偏好。这三层记忆的抽象程度不一样,越往后越精炼,占用的"空间"也越小。

于是RecVerse设计了三层记忆结构。第一层叫工作记忆,只保留最近几步的原始视觉画面和当时的心理状态,用完即弃,容量固定,新的进来旧的自动挤出去,像一个先进先出的小盒子。第二层叫情景记忆,把工作记忆里那些值得留下的操作事件,转成文字记录下来,比如"用户点开了一件红色连衣裙的详情页",这样即使原始画面被清掉了,这件事本身还留着痕迹。第三层叫偏好记忆,是最抽象的一层,专门提炼用户到底喜欢什么风格、什么价位、什么品类,比如总结出"这个用户偏爱高性价比的厨房小物件"这种更高层次的判断。

工作记忆、情景记忆、偏好记忆:分别对应短期视觉印象、会话内的行为轨迹记录、跨会话的高层用户兴趣,三者共同构成AI的"认知记忆系统",越往后信息越精炼,占用空间越小。

这个设计巧妙的地方在于,它并没有用固定规则规定"什么时候该往情景记忆和偏好记忆里写东西",而是把"要不要写、写什么"这件事也变成了AI自己要学习决策的一个动作,跟点击、滑动这些购物操作放在同一个决策框架里训练。这样AI会慢慢学会,只有在真正值得记住的时刻,才动笔记录,比如用户加购、下单、或者仔细看了商品详情页,这些强烈信号出现时才更新偏好记忆,而不是每一步都瞎记一通。

训练方式的两难:只盯着每一步对不对,反而学不像人

第二个矛盾更隐蔽一点,论文管它叫"优化挑战"。

这里要先解释一下之前的训练思路是怎么做的。市面上大多数模拟购物行为的AI,用的都是一种叫模仿学习的方法。

模仿学习:让AI去模仿一份真实用户操作记录,每一步都尽量预测和真实用户完全一样的动作,本质上是"抄作业"式的训练。

模仿学习听起来很合理,你想啊,既然有真实用户的操作日志,那就让AI一步步照着学不就行了?但问题恰恰出在"一步步"这三个字上。

真实用户逛淘宝的时候,行为其实是很"脏"的,会有大量偶然性的小动作,比如手滑多划了两下又立刻划回来,这种噪音动作被模仿学习模型原样吃进去之后,AI会误以为"多划两下再划回来"是一种有意义的模式,反而搞乱了它对用户真实意图的理解。更麻烦的是,这种一步一步对答案的训练方式,完全没有机制去约束整段购物过程"看起来像不像一个正常人"。举个例子,如果AI学出来的毛病是极度爱点击,动不动就点开商品详情页,而真实用户平均点击率明明很低,单看每一步的对错,可能都没什么大错,但整段会话拼起来一看,画风完全不对,行为频率和真实用户天差地别。

这就好比教一个新员工写周报,如果你只批改他每一句话的语法对不对,从来不看整篇周报读起来通不通顺、逻辑对不对,那这个新员工很可能写出一篇每句话都语法正确,但整体逻辑混乱、废话连篇的报告。只纠正局部错误,管不住整体走样,这正是模仿学习加上"一步一奖励"训练方式的死穴,单步正确率可能都不低,但拼成一整段行为轨迹后,跟真实用户完全不是一回事。

那怎么办?RecVerse的答案是,别只盯着每一步对不对,要站在整段购物旅程的高度去打分,这就是论文里说的"轨迹级强化学习"。

强化学习:一种让AI通过尝试和获得奖励反馈来学习的训练方式,不同于模仿学习那种照抄答案的模式,AI会自己探索不同的操作方式,然后根据最终获得的奖励高低调整策略。

具体来说,RecVerse设计了两把尺子,从两个维度给整段模拟出来的购物旅程打分。第一把尺子叫宏观奖励,它不管AI具体点了哪个商品,只看整段会话里,点击、加购、下单这几类动作发生的总次数和比例,跟真实用户的统计数据像不像。如果AI表现得过度活跃,动不动就点、动不动就买,或者相反表现得特别被动,很少互动,这把尺子都会给它打低分。第二把尺子叫微观奖励,专门衡量AI点进去、买下的那些具体商品,跟真实用户当时真正感兴趣的商品,在类别上匹不匹配。

这里有个细节值得单独说一下。研究者一开始设计微观奖励的时候,本可以用最严格的方式,只有AI选中的商品和用户当时买的那件商品完全一模一样,才算对。但他们后来改用了一种更宽松的类目匹配方式,用商品的层级分类体系,比如"服装-鞋子-凉鞋"这样三层结构,来判断两件商品有多相似,哪怕不是同一件商品,只要类目接近,也能拿到部分分数。论文里专门做了对比实验,结果显示,用宽松的类目匹配训练出来的AI,各项指标全面超过严格的完全匹配版本,命中率从6.51%提升到10.45%,综合匹配度从27.41%提升到32.64%。这说明在强化学习里,如果奖励信号设得太苛刻,AI大概率什么正反馈都拿不到,学习效率会大打折扣,而宽松一点的打分标准反而给了AI更密集、更容易捕捉的学习信号。

这就好比训练一个新手厨师做菜,如果评委只认"必须做出跟米其林大厨一模一样的摆盘"才给分,学生大概率次次拿零分,根本不知道自己哪里做对了;但如果评委说"只要味道方向对,摆盘接近就给部分分",厨师才能一点点摸索出规律。奖励信号太严苛,学习者根本收不到有效反馈,这不是纪律问题,是信息密度的问题。

记忆和奖励怎么拧成一股绳

把前面两部分捏合起来看,RecVerse整个工作流程其实是这样的:AI每走一步,先看当前页面的截图,同时翻看自己积累下来的三层记忆,工作记忆、情景记忆、偏好记忆,然后同时输出三样东西,一个是它当下的"心理活动"描述(比如"这件衣服价格合适,想加购"),一个是它接下来要执行的具体操作(滑动、点击、购买等等),还有一个是它要不要更新情景记忆或偏好记忆。

训练分两个阶段。第一阶段是热身,用真实用户的操作记录先教AI一遍基本套路,这一步用的还是前面提到的模仿学习,目的是给AI一个还算靠谱的初始状态,不至于强化学习一开始就瞎撞。第二阶段才是重头戏,用轨迹级强化学习,让AI自己在环境里跑很多遍完整的购物过程,每跑完一整段就用宏观奖励和微观奖励综合打分,再根据打分结果调整策略。这个过程还搭配了一个基础的格式检查奖励,确保AI输出的内容格式规范、动作在当前页面确实可执行,毕竟AI乱输出一通格式错误的东西,前面说的那些精妙设计全都没法落地。

没有数据集,那就自己造一个

做完方法设计,研究团队还遇到一个很现实的问题:市面上根本没有一个足够好的数据集,能同时提供真实的页面截图、丰富的操作类型、用户画像信息,还支持AI在里面反复试错、进行强化学习训练。

于是他们自己动手,从东亚某大型电商平台收集数据,构建了一个叫USB(User Simulation Benchmark,用户模拟基准)的数据集。这个数据集包含5274条完整的浏览轨迹,覆盖滑动、点击、进详情页、返回、加购、购买、终止等8种操作类型,商品按照三级分类体系组织,共41个一级类目、517个二级类目、2256个三级类目。每个用户还配有画像信息,包括年龄、性别等基本属性,以及最近的点击和购买历史。

USB最与众不同的地方,是它不只是一份静态的操作日志,而是一个能真正交互的环境。研究团队从后台日志里还原出了每次会话当时页面上展示的完整商品集合和界面布局,这样AI在里面探索的时候,不必被死死限定只能重复真实用户当年做过的操作,它可以选择任何一个当时页面上可执行的动作,系统会实时返回对应的真实页面画面作为反馈。这个特性听起来技术含量不高,但它恰恰是让强化学习真正跑起来的关键前提。此前最接近的两个数据集,一个叫STA,只能回放固定的单次会话记录,AI一旦偏离真实用户当年的操作,系统就没法给出后续真实反馈,训练只能退化成对着静态日志做逐步预测;另一个叫A/B Agent,是用MovieLens和亚马逊服装数据合成的模拟界面,画面本身就不是真实用户看到过的东西,跟真实场景存在天然的隔阂。

结果到底怎么样

论文里做了大量对比实验,把RecVerse跟一堆现有方法放在一起比较,既有基于纯文字的方法,比如RecAgent、Agent4Rec、OPeRA、AlignUSER、Shop-R1、Customer-R1,也有同样基于图片截图的方法,比如A/B Agent和STA。

评估分两条主线,一条看行为像不像真人,比如平均操作步数、点击率、加购率、转化率这些统计指标是不是跟真实用户接近;另一条看意图准不准,比如AI点进去、买下的商品,跟真实用户当时真正想要的东西是不是同一类。

这里有个很有意思的发现。有些方法,比如RecAgent和Agent4Rec,在"意图准不准"这个维度上得分看起来还不错,但仔细一看它们的行为统计数据,加购率、转化率、详情页浏览率都远远高于真实用户平均水平,说白了就是这些AI变得过度活跃,什么都点、什么都买,靠着这种"疯狂互动"策略,碰运气也能撞中不少真实用户感兴趣的商品。这种表现是虚假的高分,它不是因为模型真的理解了用户意图,而是靠数量堆出来的巧合。

相比之下,RecVerse在两个维度上都表现均衡。跟同类GUI方法里表现最强的STA相比,RecVerse把商品级别的匹配分数(F1指标)从4.27提升到7.19,命中率从5.92%提升到10.45%,类目匹配的综合得分从23.11提升到32.64。同时它的操作行为统计,比如平均步数、点击率这些,也更接近真实用户的水平,没有滑向过度活跃或者过度消极的两个极端。

论文还专门找了真人来做主观评价,让评审员在不知道哪个是AI生成、哪个是真人操作的情况下,两两比较不同来源的浏览轨迹,判断哪个更像真人所为。结果显示,评审员在74%的对比中还是能分辨出RecVerse生成的轨迹和真人轨迹的区别,说明目前的AI模拟还没到以假乱真的地步。但作为对照,同样场景下面对STA这个基线方法,评审员有高达98%的把握认出哪个是AI,这个差距说明RecVerse相比之前的方法确实往"像真人"这个方向迈进了一大步。而当评审员直接把RecVerse和STA两两对比,不涉及真人参照的时候,92%的情况下更偏爱RecVerse生成的轨迹。这组数字合在一起说明一件事:RecVerse离完美复刻真人还有距离,但它比之前所有的尝试都更接近这个目标。

论文作者还做了拆解实验,验证到底是记忆系统起作用了,还是奖励设计起作用了,或者两者都功不可没。结果显示,如果去掉偏好记忆,只留工作记忆,各项指标全面下滑,说明短期视觉印象撑不起对用户购物意图的连贯理解;如果去掉微观奖励,只留宏观奖励,商品和类目层面的匹配度损失最严重,说明单纯控制行为频率没法保证AI真的理解用户想买什么。这两组消融实验分别印证了前面提到的两个核心设计,分层记忆和双层奖励,都是缺一不可的。

Q&A

Q1:RecVerse是什么?

A:RecVerse是阿里巴巴联合多所高校提出的一款电商购物行为模拟AI,它能通过看手机页面截图,模拟真实用户滑动、点击、加购、购买等一整套连贯的购物操作过程,主要用于电商推荐系统的离线测试和强化学习训练。

Q2:RecVerse解决了什么核心问题?

A:它主要解决两个问题,一是AI在长时间购物过程中容易"记性不好"或"记性过载"的矛盾,二是传统训练方式只盯着单步操作对错,导致整体购物行为看起来不像真人。RecVerse用三层记忆系统和轨迹级强化学习分别应对这两个问题。

Q3:USB数据集和以前的电商数据集有什么不同?

A:USB是一个真正可交互的环境,AI可以在里面自由尝试各种操作并获得真实页面反馈,而不是像以前的数据集那样只能被动回放固定的历史记录。它还同时具备真实截图、多样操作类型和用户画像信息,是首个支持多轮强化学习训练的电商行为模拟基准。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询