UCL × Holistic AI Showcase · 2026-09-16

什么时候值得为更昂贵的感知付费?

测试更丰富的 Web-Agent 表征什么时候真的有用,以及这种价值能不能被低成本预测。

Jiaming Wei · Supervisors: María Pérez-Ortiz · Zekun Wu

研究海报:When Is Expensive Perception Worth Paying For?
2026-09-16 展示的原版海报。点击打开 PDF。
POSTER CASE STUDY同一任务,不同视图

同一个编辑商品任务,两种表征从同一点出发。

READ · text only12 steps · 8 pages · $0.09完成
LOOK · screenshot only26 steps · 9 pages · $0.10放弃 / 循环

两个结果在独立 rerun 中都复现。这里展示的是行为差异,不是宣称 text-only 普遍更强。

01

Showcase 上真正想传达的六件事

01

没有一种视图处处获胜

DOM / SoM / vision 的优势依任务而变,单一表征不能覆盖所有成功集合。

02

它们解决的是不同任务子集

成功集合有重叠,但并不重合;这是真实 routing headroom 的来源。

03

行为轨迹也不同

视觉模式在这组分析里滚动约 4× 更多,表征变化会改变 agent 的行动动力学。

04

失败方式也不同

text-only 更偏早期 give-up;image-only 更偏 stalled progress。

05

有 routing 价值,不等于 router 学得会

learned routers 往往需要花更多成本才能买到成功,只有 hindsight oracle 稳定进入真正的 win region。

06

越有上行空间,监督信号反而越稀

核心边界是 value–learnability gap:最值得动态选择的地方,往往正是标签最稀、最难提前预测的地方。

02

研究材料

4-PAGE RESEARCH PORTFOLIO

比 dissertation 更适合招聘者快速读

问题、实验设计、负结果、机制诊断和工程系统放在同一条视觉叙事里。

打开 PDF ↗
WEB-AGENT DEMO

让失败轨迹本身成为证据

研究仓库保留公开 demo,用来展示 agent 怎样观察、行动、卡住和恢复,而不是只展示最终 success rate。

研究仓库 ↗
03

公开边界

最终 poster/showcase 的研究结论可以公开;公司内部材料、客户数据和私有实现不在这个页面里。

Showcase poster 已于 2026-09-16 展示,原版 PDF 见页首。这个网页重建公开研究证据,不把私有公司材料伪装成 portfolio asset。