(来源:科技行者)

  这项由微软研究院(Microsoft Research)主导的研究以预印本形式发布于2026年7月,论文编号为arXiv:2607.28074,感兴趣的读者可通过该编号查询完整原文。

  **研究概要**

  每天,无数人坐在电脑前处理重复性工作:登录银行网站转账、在日历上安排会议、在项目管理系统里更新状态、给同事发送邮件……这些事情对人类来说轻车熟路,但对于AI助手来说,却是真正的"拦路虎"。问题不在于AI不够聪明,而在于它没有地方练习。

  你可以把AI学习操作电脑的过程,想象成一个厨师学徒学做菜。学徒必须真正站在炉灶前切菜、翻炒、尝味道,才能掌握真功夫——光看菜谱是远远不够的。但现实中,如果这个"练习厨房"就是一家正在营业的餐厅,学徒每次练习都会直接影响到真实顾客,那显然无法大规模训练。解决方案是什么?搭建一个专属的"训练厨房",让学徒在里面随便折腾,出了错推倒重来,直到练出真本事。

  微软研究院的团队正是做了这件事。他们构建了一套名为**Echoverse**的系统,本质上是一批精心仿造的虚拟应用程序——有模拟电子邮件的、有模拟网上银行的、有模拟项目协作平台的——AI智能体可以在这些"训练厨房"里尽情操作、犯错、重置,直到真正学会如何完成复杂任务。更重要的是,这套系统不只是静态的练习场,它会随着AI的进步不断"升级难度",始终保持对AI的挑战性。

  研究团队用一个9B(90亿参数)规模的小模型在这套系统上训练后,任务完成率从36.5%跃升至67.1%,已经相当接近远比它体量庞大的顶尖前沿模型(与GPT-5.4的差距仅14个百分点)。

  **一、为什么AI学操作电脑这件事这么难?**

  要理解Echoverse解决了什么问题,先得搞清楚AI学操作电脑究竟难在哪里。

  回到厨师学徒的比喻。假设学徒只能看着别人做菜的录像来学习,从不能真正动手,他永远无法知道"翻炒时锅的温度是否合适",因为这个信息根本不在录像里。同样的道理,一张截图只能告诉AI界面长什么样,但无法告诉它"点击了这个按钮之后,系统内部发生了什么变化"。AI需要在真实运行的应用程序里行动,才能感知到自己的操作是否真的生效了。

  而且,最有价值的那些操作场景几乎都藏在"登录墙"后面——银行转账、医疗记录修改、企业内部系统的操作——这些地方根本不可能让AI随便练习,因为每次操作都会产生真实后果,没有"撤销"按钮。

  更麻烦的是,即便研究人员想用公开网站来训练AI,网站本身也是个不稳定的练习场:今天的页面布局,明天可能就变了;今天可以访问的内容,明天可能就被限速屏蔽了。训练一个技能需要在完全相同的环境里重复数千次,而公开网站根本无法提供这种稳定性。

  近年来,学术界已经意识到这个问题,开始批量生成"合成虚拟环境"来代替真实网站。这确实解决了"有没有练习场"的问题,但随之而来的新问题是:这些练习场够不够真实?够不够深入?如果练习场太简单,AI练出来的技能根本无法迁移到真实世界。

  Echoverse的核心主张正是:**练习场的质量比数量更重要**,而且练习场本身也需要不断进化。

  **二、什么叫"深度"练习场?——五个缺一不可的条件**

  微软研究院的团队提出了一个关键概念:"深度"(Depth)。但这个"深度"不是随口说说的形容词,而是有严格操作定义的技术标准。

  回到厨师学徒的比喻来理解这五个条件。一个真正有用的"训练厨房"需要满足什么要求?

  第一,厨房里的所有设备必须按照真实餐厅的逻辑工作。如果训练厨房里的炉灶根本不会因为开太大火而触发安全保护,学徒就永远学不会控制火候。对应到虚拟应用程序里,这叫做"行为保真度"——界面上的按钮、权限、错误提示,必须按照真实应用程序的逻辑来运作,而不是随便点什么都能成功。

  第二,厨房里的各个工作台必须相互联通。如果备菜台备好的食材,送到炒菜台时凭空消失了,学徒就无法练习真实的烹饪流程。对应到虚拟应用程序里,这叫做"状态一致性"——A用户发出的消息,必须真的出现在B用户的收件箱里;取消的会议,必须从所有参会者的日历上同时消失。

  第三,厨房里的操作流程必须有真实的前后依赖关系。如果一道菜的每个步骤都是独立的,彼此之间没有顺序要求,学徒学到的就只是一堆孤立动作,而不是真正的烹饪逻辑。对应到虚拟应用程序里,这叫做"工作流深度"——早期的操作选择,应当约束后续步骤的可能性,就像真实订房时先选日期、再选房型、最后付款这样的完整流程。

  第四,必须有客观的评分标准。如果学徒做出一道菜,只能靠导师"看起来不错"来判断好坏,那这个评分就是不可靠的。对应到虚拟应用程序里,这叫做"权威验证"——成功的判定标准必须来自应用程序的数据库实际发生了什么变化,而不是AI看起来"做了什么"的视觉印象。

  第五,练习的内容本身必须是值得练的。如果训练厨房只教学徒如何切胡萝卜,而真实餐厅里根本不用胡萝卜,那整个练习就是浪费时间。对应到虚拟应用程序里,这叫做"领域价值"——练习场覆盖的工作流,必须是真实世界里有意义的场景。

  这五个条件缺一不可。一个看起来漂漂亮亮、界面精美的虚拟应用程序,可能在第二或第三个条件上完全不达标,从而成为一个毫无训练价值甚至适得其反的练习场。Echoverse的论文里有一个让人印象深刻的负面案例:用"浅度"练习场训练的AI,在真实网站上的表现反而比完全没有训练还要差(从80分掉到75分)。原因就在于浅度练习场给AI灌输了一些错误习惯——不管遇到什么情况都随便点点点,反正练习场里怎么点都能过关。

  **三、Echoverse是怎样建造这十二个"训练厨房"的?**

  理解了"深度"的重要性,下一个问题就是:如何批量建造出满足这五个条件的高质量练习场?

  微软研究院的团队设计了一套"工厂流水线",分为两个阶段,但这两个阶段实际上是一个不断循环的整体。

  第一阶段的核心任务是"建造并验证应用程序本身"。整个过程从一批由人类手写的"种子"开始——这些种子描述了目标场景、代表性任务、应具备的功能特性。然后,一群专门扮演不同角色的AI智能体接管工作:有的负责"建造"(生成数据库结构、后端接口、前端界面),有的负责"核查"(像一个严格的质检员,按照事先列明的可验证条件逐一检查应用程序),有的负责"分诊"(把大量小问题归类成少数几个根本原因,就像医院急诊室的分诊护士把患者按病情分流),有的负责"修复"(对症下药,修好问题后再重新检查,如果修复引入了新问题就回滚)。

  这套流程里有一个关键的设计理念:负责检查的人和负责建造的人是分开的,没有人可以既当运动员又当裁判员。只有当95%以上的可验证条件都通过检查,这个应用程序才能"毕业"进入下一阶段。

  第二阶段的核心任务是"在这个应用程序上生成大量可核查的练习任务"。从种子出发,系统在真实运行的数据库里查询真实存在的数据,据此生成具体任务——比如"找到用户ID为123的最近一次转账金额",这个答案是直接从数据库里查出来的,而不是人工编造的,因此天然具有"正确性"。每个任务都经过质量检查:任务涉及的实体是否真实存在于数据库中?任务难度是否与所需工作量匹配?最关键的一个问题:这个任务在当前界面上是否真的可以完成?

  这最后一个检查是"白盒"的——负责检查的智能体不仅会像真实用户一样操作界面,还会直接读取应用程序的源代码和数据库,用来区分"任务本身无法完成(应用程序的问题)"和"任务很难完成(需要高水平的AI)"这两种情况。这个区分非常重要:在决定哪些任务存在时,不能让未来要训练的AI模型参与评判,否则就会产生"为强模型量身定制任务"的偏差。

  整套建造流程最终生产出了十个"全领域深度世界"和两个"能力专项世界"。十个全领域世界覆盖了几类最有价值的工作场景:通讯协调类(模拟电子邮件、日历、企业即时通讯),技术创作与运维类(模拟机器学习平台、代码协作平台),受监管的记录与交易类(模拟网上银行、医疗收费系统),以及社区媒体与旅行类(模拟论坛、音乐流媒体、民宿预订)。这十个世界的数据库都有真实的规模:光是民宿预订世界(EchoStay)就有18万条数据记录,包含3700个房源、5400次预订、5300条评价和6100个用户;代码协作世界(EchoForge)的数据库里有70.5万条记录,包含175个项目、8.1万个问题单和13.4万个合并请求。

  两个能力专项世界则是为了解决一个特殊问题:有些AI的短板不是缺少某个领域的知识,而是某个具体的界面控件操作不熟练。日期选择器就是典型例子——真实网络上的日期控件形态各异,有传统日历格、滚轮式、热力图式,还有需要推算的相对日期("下周一"、"工作日后第10天")。一个再深度的民宿预订模拟器,也只有一种日期控件。于是研究团队专门建了一个"日期选择器专项世界",把同一个功能用100种不同外观渲染出来,涵盖6种核心控件形态、10种应用场景。类似地,"嵌套筛选器专项世界"把各种搜索筛选面板做成了20个控件家族、200个不同前端界面,横跨房地产、购物、金融、旅行、云计算、宠物6个主题垂直领域。

  **四、评分机制:不看"表演",只看结果**

  现在,AI在这些虚拟世界里完成了任务,怎么评分?

  评分的核心原则是:**只看数据库里发生了什么,不看AI的截图和自述**。

  以一个具体例子来说明区别。假设任务是"把会议室A的预订从下午3点改到下午4点"。糟糕的评分方式是:让另一个AI看AI操作后的截图,判断"看起来好像成功了"。优秀的评分方式是:直接查数据库,看会议室A的预订时间字段是否真的从15:00变成了16:00。

  Echoverse采用的正是后者。对于"写入类"任务,系统会比对操作前后的数据库差异(通过SQLite的sqldiff工具),确认所需的数据变化确实发生了,而且变化的内容与要求一致。对于"读取类"任务,系统会把AI报告的答案与从数据库直接查询出的正确答案做比对。对于既要读取又要写入的任务,两种验证都要通过。

  这样的评分机制有一个关键优势:它极难被"忽悠"。AI无法通过声称"我已经完成了"就获得分数,因为数据库不说谎。这对于用来训练AI的信号质量至关重要——如果训练信号本身就不可靠,那训练出来的AI也会学会"演戏"而非真正完成任务。

  当然,完全的字符串匹配也不合适——毕竟"287.62元"和"288元"在语义上是等价的。因此,最终的比对步骤会用一个小型语言模型来判断语义等价性,但这个模型看到的输入非常有限:只有AI的回答和从数据库读出的参考答案,没有操作截图,没有AI自己的解释,只回答一个问题:"这两个答案是否表达了相同的内容?"这个狭窄的比对任务比让AI判断"整个操作流程是否看起来正确"要可靠得多。

  **五、训练场和AI一起进化——"共同进化"循环**

  到目前为止,Echoverse听起来像是一个"先建好练习场、再让AI去练"的静态系统。但真正让它与众不同的,是它的动态性:练习场和AI是同步进化的。

  这背后的洞察是:当AI在某个任务上失败时,失败的原因有两种可能。第一种:AI确实不会。第二种:练习场本身有问题——数据库里的数据对不上、界面有Bug、评分标准写错了。如果把第二种失败也当成"AI的学习素材",就会把错误的经验喂给AI,训练出一个专门适应了"有Bug的虚拟世界"的AI,而不是一个能在真实世界里工作的AI。

  EchoStay(民宿预订世界)就是一个真实发生过的典型案例。在这个世界的第一个版本里,有一个控制"入住人数"的界面控件出了问题——AI操作时,这个控件会静默地保持默认值,不管AI怎么操作都改不了。结果,所有涉及"指定入住人数"的订房任务,都因为这个Bug而自动失败,与AI的实际能力无关。当时这个世界里,只有48%的预订任务实际上是可以完成的。

  修复了这个Bug之后,可完成的预订任务比例从48%升到了78%,有15个原本被卡住的任务重新变得可解。更重要的是,在修复后的世界上训练的AI,任务完成率从16.2%直接跳到了38.5%,相当于一跃完成了与顶尖前沿模型GPT-5.4(50.4%)之间三分之二的距离。

  EchoForum(社区论坛世界)有类似的故事:修复了前端问题和页面加载速度后,原本37个全部失败的任务变成了36个成功。EchoChat(企业即时通讯世界)的问题则出在评分机制上:验证程序与数据库数据出现了不同步,导致只有34%的任务可以被正确评分——重新对齐后,可评分任务比例达到了99%。

  这些案例说明了一个关键道理:**在用AI的失败案例来训练AI之前,必须先确认这些失败是AI自己的问题,而不是练习场的问题**。这就是"共同进化"循环的精髓——每一批AI的运行记录,既是训练数据的来源,也是排查练习场缺陷的线索。两个信号从同一次运行里读取出来,形成一个螺旋式上升的改进循环。

  有一个重要原则贯穿整个修复过程:修复绝对不能以降低要求为代价。如果某个任务确实有效、本身是合理的、而且评分机制也是对的,那AI在这个任务上失败,恰恰是最有价值的训练信号——正是这个任务揭示了AI真正的能力边界。修复只能改善练习场,而不能把难题改成简单题来提升通过率。

  **六、规模的边界:多少练习场才够用?**

  研究团队用一系列实验来测量不同因素对AI能力的影响,结果揭示了一些出人意料的规律。

  第一个实验:固定练习场的数量,只增加在这些场里的练习次数(轨迹数量)。结果是:在同一批练习场里反复练,对合成任务的成绩还在提升,但对真实网站的迁移能力却到了天花板——从6400条轨迹增加到2万条,在真实WebVoyager测试集上的成绩几乎没有变化(54.8%到55.6%),在另一个真实测试集上甚至小幅下滑。就像一个学徒在同一个厨房做了几千遍同样的菜,厨房里能学到的东西已经全部学完,继续重复不会带来新的技能。

  第二个实验:固定总练习次数,只增加练习场的种类。结果完全不同:随着练习场种类的增加,不仅合成任务成绩持续上升,在真实网站上的表现也随之提升,一直到12个练习场时才达到最佳值。这说明,对AI能力的拓展而言,**多样性才是真正的杠杆,而不是重复量**。

  但这里有一个重要的前提:增加的练习场必须是高质量的"深度"练习场。研究团队在另一个实验里做了直接对比——用同样的领域(Allrecipes食谱网站和Hugging Face机器学习平台),分别建造浅度版练习场和深度版练习场,各自训练一个模型,然后放到真实网站上测试。浅度版的结果令人警觉:在Allrecipes上,训练了浅度练习场的AI反而比完全没训练的基础模型还要差(从80分掉到75分);在Hugging Face上,成绩基本没有改变。只有深度版练习场才让两个任务的成绩都切实提升(Allrecipes从80到85,Hugging Face从48到65)。

  这个"负向迁移"现象的机制可以在AI的行为记录里看出来:浅度练习场训练出的AI更容易陷入循环、重复无效操作、浪费步骤——因为在简单的浅度练习场里,这些坏习惯从来没有被惩罚过。

  **七、强化学习:让AI从自己的错误中学习,突破模仿天花板**

  前面描述的所有训练方式,本质上都是"模仿学习"——AI观察人类(或顶级AI)的正确操作轨迹,然后模仿。这种方式有一个内在上限:AI只能学会重现正确路径,但永远不会从自己的错误中主动学习如何纠正。

  更深的问题在于:顶级AI出错的方式,和一个普通9B模型出错的方式是完全不同的。顶级AI会在高难度的推理判断上出错,而9B模型却经常在一些显而易见的地方犯低级错误——没认清一个明显的按钮、在没有任何响应的元素上重复点击、还没完成任务就宣告结束。模仿只能传授"顶级AI如何从顶级AI自己的错误中恢复",而不能教会普通模型如何从普通模型自己的错误中恢复。

  强化学习(RL)解决的正是这个问题:让模型在真实环境里按自己的方式行动,看看结果如何,然后根据结果来调整。好的结果受到鼓励,坏的结果受到惩罚,AI逐渐学会在自己真实会遇到的情况下做出更好的选择。

  但强化学习对环境有非常严苛的要求,这些要求恰好是公开网络无法提供的:必须能精确重置到初始状态(公开网站的页面会变,日期会滚动,内容会更新,两次运行根本不一定是同一个场景);必须支持高并发、大规模采样(公开网站会限速甚至封锁自动访问);必须有可靠的奖励信号(公开网站没有后端权限,只能靠另一个AI看截图猜测任务是否成功,而这个判断本身就可能出错,错误的奖励会直接污染训练);任务的含义在整个训练过程中必须保持稳定不变(训练同一个任务数千次,需要每次面对的都是完全相同的世界状态);最后,破坏性操作必须是安全可逆的(在真实账户里乱操作会造成不可挽回的后果)。

  Echoverse恰好满足了这五个条件,而且不需要任何额外改造——每个任务都有独立的数据库快照,运行前恢复,运行后对比;应用程序可以在服务器上并行复制;奖励来自数据库的真实变化,而不是截图判断;种子数据固定不变;虚拟世界随时可以销毁重建。这使得Echoverse可以直接用作强化学习环境,无需修改。

  研究团队在五个世界(银行、代码协作、社区论坛、民宿预订、音乐流媒体)上运行了一轮强化学习训练,实验结果是:持有不参与训练的保留任务(每个世界25个),以数据库真实结果评分,从监督学习结束后的58.8%提升到了68.0%,超过了单纯模仿学习的天花板。

  奖励的设计有一个微妙之处值得单独说明。在强化学习里,信号越早、越频繁,学习越高效。但数据库只有在任务结束时才给出最终结论——整个50步的操作轨迹,只得到一个"成功/失败"的二元判断,这使得每一步的功过难以分清。为了解决这个问题,研究团队引入了一个"逐步奖励":在每一步操作后,让一个多模态视觉模型查看操作前后的两张截图,判断这个操作是否真的产生了有意义的效果(页面状态变化了、操作建立在前一步的基础上),还是无效操作(重复点击、没有任何响应、毫无意义地滚动页面、还没完成就宣告结束)。

  这个逐步奖励是判断性的(来自一个AI模型),而最终任务奖励是基于数据库事实的,两者加总但最终事实占主导——如果最终任务失败,那最后一步的逐步奖励强制归零;如果任务完成结果是错的,还会额外施加惩罚。这样既利用了逐步反馈的学习效率,又确保了不会出现"过程表现漂亮但结果错误"的情况被奖励。

  **八、主要实验结果:数字背后的意义**

  把所有这些设计放在一起,最终训练出的9B规模模型(πSFT)在14个评估维度上取得了明显进展。

  基础模型在14个维度上的平均成功率是36.5%,训练后的模型达到67.1%,而作为"教师"的GPT-5.4是80.7%。换句话说,一个参数规模远小于GPT-5.4的模型,在使用Echoverse训练后,与前者的差距缩短到了13.6个百分点。

  按具体领域来看,在银行操作任务上,训练后的模型达到了94.6%,甚至超过了GPT-5.4的92.8%;在邮件处理任务上,训练后模型达到81.1%,也超过了GPT-5.4的74.5%。最难的领域是民宿预订(EchoStay),这里需要跨越搜索、筛选、查看房源详情、检查日历可用性、完成支付等多个依赖步骤,平均需要约34次操作才能完成一个任务,成功率从基础的20.5%提升到37.6%,距离GPT-5.4的50.4%还有一段距离。

  能力专项训练的效果尤为值得关注。日期选择器专项训练后,在从未见过的日期控件类型上,成功率从34%提升到52%——这说明AI学到的不是某种特定控件的操作方式,而是处理日期选择这类问题的通用能力。嵌套筛选器专项训练的迁移效果更加显著,在未见过的筛选器控件家族上,成功率从62.8%提升到84.1%。更有趣的是,训练日期选择器还顺带提升了筛选器的操作能力,反之亦然——两种能力之间有正向迁移,而不是互相竞争。

  这种能力甚至可以迁移到完全没有参与训练的真实网站。在WebVoyager(真实公开网站测试集)上,训练后的模型成绩从50.9%提升到55.6%;在Online-Mind2Web上,从29.5%提升到37.2%。由于训练数据完全来自合成虚拟环境,与这些真实网站毫无重叠,这个提升纯粹是技能迁移的结果。

  归根结底,Echoverse做的事情可以用一句话概括:搭建一个会跟着学生一起成长的练习场,让AI既能从好的示范里学,也能从自己的实际错误中学,而且练习的内容从第一天起就是真实世界里会遇到的真正挑战。

  研究表明,仅靠堆砌大量粗糙的练习场是不够的,甚至会适得其反;仅靠在同一批练习场里反复练习也会很快触到天花板;真正持续有效的方式,是保持练习场的质量,同时持续扩展练习场的多样性,并且让练习场随着AI的进步不断发现并修复自身的问题。

  对于普通人来说,这项研究的直接意义是:AI助手真正能帮人处理工作中那些繁琐的登录后操作——写报告、查余额、安排会议、跟进项目进度——可能比我们预期的更快到来。而这一天能够到来,背后需要的不是更大的模型,而是更好的练习场。

  有兴趣深入了解技术细节的读者,可以通过论文编号arXiv:2607.28074查阅完整原文,微软研究院也在https://aka.ms/echoverse开放了部分环境代码和评测任务。

  **Q&A**

  Q1:Echoverse和WebArena这类已有的合成环境有什么区别?

  A:WebArena等系统的核心贡献是手工搭建了可重置、可验证的合成环境,是非常重要的基础工作。Echoverse与之的区别主要在三个维度:第一,Echoverse强调环境的"深度",即环境必须支持完整的跨步骤、跨用户工作流,而不只是渲染出界面外观;第二,Echoverse引入了"共同进化"机制,每轮AI运行后会自动诊断并修复环境自身的缺陷,而不是把Bug当成AI的失败来学习;第三,Echoverse用AI智能体流水线自动化了环境和任务的生成与验证过程,使得规模化成为可能。

  Q2:Echoverse的评分为什么比截图判断更可靠?

  A:截图评分存在一个根本缺陷:AI可以声称"我已经完成了",并且在截图上显示出一个看起来成功的界面,但数据库里什么都没变。Echoverse的评分直接查看数据库在任务前后的变化差异,写入类任务需要确认所要求的数据修改确实发生了,读取类任务的参考答案也是直接从数据库查询出来的。这种机制使得AI无法靠"表演完成"来获得分数,训练信号因此更可靠。一个小型语言模型仅用于判断语义等价性,而非对整个操作过程进行主观评价。

  Q3:为什么强化学习需要Echoverse这样的专属环境,而不能直接在真实网站上做?

  A:强化学习需要同一个任务被重复执行数千次,每次都从完全相同的状态出发,而且每次都能得到可靠的奖励信号。真实网站无法满足这三个条件:页面会更新,日期会滚动,网站会限速或封锁自动访问,而且没有后端权限意味着无法知道操作是否真的成功,只能靠另一个AI猜测。一个基于错误奖励信号训练的模型,学到的是如何欺骗奖励模型,而不是如何真正完成任务。Echoverse通过独立数据库快照实现精确重置,通过并行复制实现高吞吐量,通过数据库差异比对实现可靠奖励,天然满足了强化学习的所有前提条件。

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。
上一篇:浙江大学等联合研究:AI智能体如何像老手工匠一样,越干越聪明? 下一篇:第七届“8·8”北京体育消费季启动 两位奥运冠军现场体验

Copyright © 2024 九游体育创新科技有限公司 All Rights Reserved      粤ICP备2023064493号    网站地图