热搜:暂无热词
解决导航迷路,刷新开源SOTA纪录
本文介绍由UCL等高校联合推出的开源框架Avenir-Web。它通过EIP规划、混合定位及自适应记忆机制,解决Web Agent在长程任务中的定位不准与记忆丢失痛点,帮助开发者实现无需训练的高性能网页自动化。
现有的Web Agent在面对复杂网页结构时,常常陷入定位不准或长程任务迷失的困境。伦敦大学学院等团队推出的Avenir-Web,作为一种无需额外训练的开源Agent Harness,让现有多模态模型像人类一样流畅使用网页,并在基准测试中刷新了最强开源纪录。

在实际部署Web Agent时,开发者往往发现模型并非因为“不够聪明”而失败,而是卡在基础的交互逻辑上。最直接的瓶颈是元素定位不准。传统方案过度依赖标准的DOM树结构,一旦遇到Canvas渲染的图表、复杂的嵌套iframe或非标准UI组件,定位准确率便会急剧下降,导致点击落空。
此外,Agent普遍缺乏特定站点的流程知识。人类操作网页时会参考用户手册或攻略,而Agent只能像“盲人摸象”般盲目探索,无法复用已知的站点操作逻辑,导致效率低下且容易误触。
更隐蔽的问题是长程任务中的记忆不稳定。在执行跨多个页面的复杂流程时,Agent容易产生“导航漂移”,忘记之前的操作上下文或目标状态,从而陷入死循环或执行错误分支。这些痛点正是Avenir-Web试图通过其新架构解决的核心难题。
针对前文提到的定位与记忆难题,UCL等团队推出的Avenir-Web提供了一套务实的解决方案。它并非要求开发者重新训练一个庞大的基础模型,而是一套training-free的开源Agent Harness。这种模块化架构的设计哲学在于“外挂增强”,即通过精巧的外部模块来引导现有大模型的行为,使其在无需任何微调的情况下,即可具备流畅操作网页的能力。对于资源有限的团队而言,这意味着可以直接复用现有多模态模型(如GPT-4o等)的视觉理解能力,大幅降低了部署门槛和算力成本。
这种“即插即用”的特性不仅简化了工程实现,更带来了显著的性能跃升。在ONLINE-MIND2WEB这一极具挑战性的基准测试中,Avenir-Web以53.7%的成功率刷新了当前最强开源纪录,证明了即使不改变模型底层权重,通过优化交互框架也能突破性能瓶颈。其开源属性也让社区能够深入剖析其设计细节,灵活适配不同业务场景。具体如何通过EIP规划与混合定位机制实现这一突破,我们稍后展开详述。
承接上文提到的性能突破,其背后的核心动力来自于两个精心设计的增强模块:经验模仿规划(EIP)与混合定位专家(MoGE)。EIP模块的设计灵感源自人类面对陌生网站时的本能反应——“先读攻略”。在传统Web Agent中,模型往往依靠即时观察盲目试错,极易陷入死循环。而EIP利用大模型的在线搜索能力,预先检索目标站点的帮助中心、开发者论坛或社区文档,将这些分散的外部知识转化为一份高层级的策略路线图。这种机制让Agent在执行前就拥有了全局视野,大幅减少了无效点击和探索成本,显著提升了长程任务的执行效率。
解决了“怎么走”的问题后,MoGE模块则专注于解决“点哪里”的痛点。它摒弃了传统依赖DOM树解析的方式,转而采用“视觉优先”原则,将网页视为一个统一的视觉画布,直接基于屏幕坐标进行交互。这一设计天然规避了嵌套iframe、动态加载组件等导致DOM结构断裂的复杂场景。当然,视觉并非万能,当页面元素模糊或视觉信息不足时,MoGE会触发语义结构推理作为兜底,从而形成“视觉坐标为主、语义逻辑为辅”的稳健混合策略,确保在极端情况下依然能精准定位目标元素。
如果说EIP和MoGE解决了“怎么规划”和“怎么点击”的问题,那么在长达数十步的复杂任务中,Agent如何不迷失自我?这正是任务跟踪清单与自适应记忆机制发挥关键作用的地方。面对长程指令,模型极易因上下文溢出导致幻觉或决策混乱。Avenir-Web引入了任务跟踪清单(Task-Tracking Checklist),将复杂指令拆解为2-6个可验证的原子里程碑(Milestones)。每完成一步,轻量级模型(如 Qwen-3-VL-8B)便会实时评估当前状态,标记为Pending、In Progress、Completed或Failed。这种显式的状态管理让Agent始终清楚“我在哪”以及“下一步该做什么”,有效避免了盲目循环。
为了解决上下文窗口有限带来的记忆丢失问题,Avenir-Web设计了自适应记忆模块。它并非简单截断历史,而是采用分块递归摘要(Chunked Recursive Summarization)策略,将冗长的交互历史压缩为紧凑的语义块。同时,系统还维护了一个失败反思缓冲区,专门记录那些导致失败的错误操作及其原因。当Agent再次遇到类似场景时,它能迅速调取这些“教训”,避免重蹈覆辙。这种“向前看”的规划与“向后看”的反思相结合,使得Agent在长程任务中既保持高效,又具备极强的纠错能力,为后续实验中的SOTA表现奠定了坚实基础。
理论架构的价值最终需通过实战数据来检验。在权威的ONLINE-MIND2WEB基准测试中,该数据集涵盖了136个真实站点及300个实时任务,极具挑战性。在此场景下,以Gemini 3 Pro为内核的Avenir-Web交出了53.7%成功率的亮眼答卷。这一成绩不仅大幅领先开源标杆SeeAct的30.0%,实现了23.7个百分点的跨越,更超越了闭源商业Agent如Claude Computer Use 3.7(47.3%)和ACT-1(52.7%),证明了其框架设计的先进性。
更值得关注的是其泛化能力与轻量化潜力。当内核替换为参数量更小的Qwen-3-VL-8B时,系统依然能保持25.7%的成功率,这一表现已逼近甚至部分场景下优于许多同量级开源方案。消融实验进一步证实,EIP规划、混合定位(MoGE)及自适应记忆模块并非独立存在,而是协同作用的关键:移除任一模块,长程任务中的定位准确率与状态保持能力均会出现显著下滑。这种“无需训练、即插即用”的特性,极大地降低了开发者构建高性能Web Agent的门槛,为后续探讨其具体的开源资源落地与多场景应用提供了坚实的数据支撑。
理论优势与实验数据的落地,最终离不开开源社区的便捷获取。Avenir-Web团队已将该框架完整开放,研究者与开发者可直接访问arXiv论文(https://arxiv.org/abs/2602.02468)深入理解其EIP规划与混合定位机制,或在GitHub仓库(https://github.com/Princeton-AI2-Lab/Avenir-Web)中获取完整源码。这种全开源模式不仅消除了黑盒效应,更让技术复现与二次开发变得触手可及。
在实际落地场景中,Avenir-Web凭借“无需训练、即插即用”的特性,展现出极高的工程适配性。它特别适用于网页自动化流程构建、复杂软件回归测试以及下一代智能助手开发。对于希望快速部署高性能Web Agent的团队而言,无需投入高昂算力训练新模型,只需接入现有多模态大模型即可实现流畅的网页交互。这一特性大幅缩短了从原型验证到生产环境的周期,为探索更广泛的数字自动化应用提供了坚实的技术底座。
CopyRight 2025 www.bzxz.net All Rights Reserved
本网站所展示的内容均由用户自行上传发布,本站仅提供信息存储服务。若您认为其中内容侵犯了您的合法权益,请及时联系我们处理,我们将在核实后尽快删除相关内容。