UCL × Holistic AI Showcase · 2026-09-16
什么时候值得为更昂贵的感知付费?
测试更丰富的 Web-Agent 表征什么时候真的有用,以及这种价值能不能被低成本预测。
Jiaming Wei · Supervisors: María Pérez-Ortiz · Zekun Wu

POSTER CASE STUDY同一任务,不同视图
同一个编辑商品任务,两种表征从同一点出发。
两个结果在独立 rerun 中都复现。这里展示的是行为差异,不是宣称 text-only 普遍更强。
01
Showcase 上真正想传达的六件事
没有一种视图处处获胜
DOM / SoM / vision 的优势依任务而变,单一表征不能覆盖所有成功集合。
它们解决的是不同任务子集
成功集合有重叠,但并不重合;这是真实 routing headroom 的来源。
行为轨迹也不同
视觉模式在这组分析里滚动约 4× 更多,表征变化会改变 agent 的行动动力学。
失败方式也不同
text-only 更偏早期 give-up;image-only 更偏 stalled progress。
有 routing 价值,不等于 router 学得会
learned routers 往往需要花更多成本才能买到成功,只有 hindsight oracle 稳定进入真正的 win region。
越有上行空间,监督信号反而越稀
核心边界是 value–learnability gap:最值得动态选择的地方,往往正是标签最稀、最难提前预测的地方。
02
研究材料
03
公开边界
最终 poster/showcase 的研究结论可以公开;公司内部材料、客户数据和私有实现不在这个页面里。