RESEARCH ENGINEER · 2026–27

Jiaming Wei

AI Evaluation · Red Teaming · Agent Reliability

模型和 Agent 会出问题。
更麻烦的是,用来评估它们的那套标准本身也可能不可靠。

我研究并构建可靠的 AI evaluation systems:从 Web / Computer-Use Agent、red teaming 和 judge calibration,到 post-training evaluation、benchmark provenance 与可复现实验基础设施。核心问题一直是同一个:一个分数或失败到底意味着什么,产生它的 measurement chain 能不能信。

01

经历与研究

先看真实交付

Holistic AI

Research Intern · London · 2026.06–09 · 已完成

把 evaluation 当作系统,而不是一个分数:从 attack generation、target execution 和 grader audit,一直做到后期的可执行审计 pipeline 与 live delivery。

  • 独立 owner 端到端 red-team / evaluation measurement line,并把 target behavior、provider-side filtering 与 grader outcome 从一个模糊的二元结果里拆开。
  • 用独立 labels 审计 judge / grader 的 FP/FN 与 failure modes,再把测量逻辑接入实际平台。
  • 后期构建 NYC Local Law 144 审计 pipeline:把规则转成确定性的 Python decision logic、evidence/logging 与可复核报告,并在真实数据上验证、完成最终 live demo。
EvaluationRed TeamingJudge ReliabilityAudit SystemsPython

UCL Computer Science

MSc Artificial Intelligence for Sustainable Development · 2025–2026

研究 Web / Computer-Use Agent 的 representation choice 与 routing:先测有没有真实价值,再问这种价值能不能被可靠预测。

  • 论文《Routing Is Least Learnable Where It Is Most Valuable》已被 EMNLP 2026 Workshop REALM 录用。
  • 研究包含预注册、受控表征比较、task-level failure analysis、representation probes 与可恢复的异构算力实验系统。
Web AgentsComputer UseEvaluationRepresentation RoutingResearch Systems

Xi’an Jiaotong University

BEng Automation · 2021–2025

自动化与机器学习背景;后续逐步把研究重心收敛到可靠 AI evaluation、agent systems 与实验方法。

AutomationMachine Learning
02

研究与系统

5 项
UCL MSc Dissertation / REALM ’26 ACCEPTED

Web Agent 表征路由:价值最高的地方,反而最难学

预注册 · OSF3 模型族 × 6 表征REALM ’26 已录用

DOM、SoM、视觉等表征之间确实存在互补价值;但“事后知道哪个表征更值钱”并不意味着 router 能在执行前学会选对。研究把 representation value 与 routing learnability 拆开测量,并把这个负结果变成可解释的边界。

  • 受控比较 DOM / SoM / vision 与 phantom representations,先预注册,再跑实验。
  • 主结论是 routing value–learnability gap:value ≠ learnability。
  • 追 task-level failure 与 representation difference,并用 activation patching / linear probes 定位表征差异。
  • 大型可复现实验系统支持异构算力编排、自动恢复与 1K+ research tests。

Python · PyTorch · Playwright · VisualWebArena · SGE/HPC

GitHub →

六种观测模式的账单成本 / episode

$0.08classifieds 站点
$0.064 — $0.073六种模式几乎持平

成本差异不是这项研究最难的部分。真正困难的是:什么时候该看什么,以及这个判断到底能不能被学出来。

PUBLIC RED-TEAM MEASUREMENT STACK / APACHE-2.0

redteam-under-test

公开可审计103 个已验证 pluginJudge 校准
redteam-under-test cockpit:风险图、攻击面、成本与运行趋势

同一套系统里看攻击面,也看自己的判官是否可信。

攻击跑出来了,不等于攻击真的成功了。

把 target、execution harness、provider behavior、judge 与独立 gold labels 放在同一条 measurement chain 上。系统不仅问“模型有没有被攻破”,也问“负责判定这件事的工具自己靠不靠谱”。

  • 166 个 plugin 映射到本地生成机制,其中 103 个通过端到端验证后启用。
  • 攻击按目标动态生成;zero-egress 路径可以把生成、攻击与判定留在本机。
  • 同一 probe 上曾发现 upstream refusal shortcut 漏掉 16 个 breach 中的 8 个。

JavaScript · Node · Postgres · TanStack Start · SST / Lambda

GitHub →
AGENT SECURITY / READ-ONLY MCP

Agent Red-Team Lab

Tool-use securityRead-only MCP574 tests

一边诱导 Agent 越界,一边确保它真越界时留下可重放证据。

攻击侧研究 replay / model-hop / 调用预算;防守侧把 tool-call trace analyzer 做成 read-only MCP,只分析轨迹,不替 Agent 执行真实动作。

  • 检测 trust-boundary crossing、敏感数据外传、destructive action、confused-deputy 与缺失授权。
  • 规则采用“降级不压制”:调用方自报已审批,也不能一句话把已发现的风险抹掉。

Python · MCP / JSON-RPC · Agent Security

GitHub →
同一条方法论 / measurement chain

一个分数出来之前,我先检查这四层

model → system → judge → evidence
01

Target / Agent

模型真正做了什么?任务成功、拒答,还是已经越过边界?

behavior · task success
02

Execution / Harness

这个结果来自模型,还是 observation、tool、provider filter、scaffold 或环境?

trajectory · environment
03

Judge / Grader

负责打分的工具自己靠谱吗?rubric、阈值、shortcut 和 FP/FN 会不会改写结论?

FP / FN · calibration
04

Gold / Evidence

结论最终靠什么兜底?能否回到独立标签、统计检验、来源和可重放证据?

labels · provenance

Web-Agent routing、Holistic、redteam-under-test、FinQA 和 Model Observatory 看起来是不同项目,但都在追问:这个结果究竟意味着什么,产生它的测量链到底能不能信?

POST-TRAINING ATTRIBUTION / CONTROLLED MATRIX

FinQA

Qwen3 0.6B→14B5×4 受控矩阵SFT / GRPO

模型涨了 20 分,先别急着说训练有效。

把 protocol、answer-format SFT、显式思考与 RLVR 分开控制,追问分数变化究竟来自能力、协议还是 reward exploitation。

  • 只切回正确 native chat protocol,部分大模型即可恢复约 +20–30 分。
  • 4B answer-only SFT 没有显著净增益;paired McNemar 把“感觉涨了”变成可检验问题。
  • GRPO/RLVR 出现明显 reward exploitation,任务准确率反而下降。

Python · PyTorch · Qwen3 · TRL · LoRA / SFT / GRPO

GitHub →
BENCHMARK PROVENANCE / LIVE

AI Model Observatory

Live data productPer-observation provenance自动 drift checks
AI Model Observatory 首页与模型比较界面

实时数字留在实时产品里;个人主页不再手工复制会漂移的 observation 数。

我最不想做的,就是再造一个解释不清的“万能总分”。

不同来源、harness 与 benchmark 语义分开保存;缺失就是 N/A,agent-system 成绩不伪装成纯模型能力。上游 live boards 自动重抓并做 drift checks。

  • 每条 observation 保留来源、版本、日期、harness、reasoning effort 与 tool setting。
  • 把 capability、agent systems、coding systems、human preference、speed 与 price 分开。

TypeScript · Next.js · Data Provenance · EdgeOne Pages

进入观测台 →
03

研究证据

论文 · Portfolio · Poster · Repo
04

能力图

能力必须有证据对得上
Evaluation / Research

LLM & Agent evaluation · benchmark design · red teaming · judge / grader calibration · failure taxonomy · paired tests / bootstrap · preregistration

Agents

Web / Computer-Use Agent · VisualWebArena · DOM / SoM / vision representations · tool use · MCP · trajectory analysis · recovery

Model / Post-training

PyTorch · Hugging Face · TRL · LoRA / SFT · GRPO / RLVR analysis · protocol attribution · reward-failure analysis

Evaluation Systems

Python · TypeScript · Postgres · Playwright · Docker · GitHub Actions · Linux · AWS / SST · structured logging · data provenance · reproducible harnesses

05

Personal Lab

选出的旁支项目

我想继续做一件事:把模型和 Agent 的“看起来不错”,变成真正经得住检查的结果。

主要关注 AI Evaluation / Red Teaming / Agent Reliability,以及 Web / Computer-Use Agent 与 model/post-training evaluation 的研究工程岗位。