张宇轩,University of British Columbia 博士在读。研究方向包括 LLM、Agent 评测和 Agent Harness Engineering。
AI Agent 正在影响我们的生活,但能否可靠地完成订餐、订机票、求职投递、活动报名、写评论等我们生活中常用的网页操作?现有的评测大多基于静态网页或离线沙盒,难以覆盖真实网站的动态交互和高风险写操作。
ClawBench 是一个运行在生产环境真实网站上的 Agent 评测基准:V1 + V2 共 283 个任务,覆盖 163 个活跃平台和 15 个生活类目;通过记录录屏、Agent 动作、HTTP 流量、Agent 消息和截图,并用 “HTTP 请求拦截 + LLM Jude” 打分。我们的codebase支持绝大多数前沿模型 × 8 种 Agent 框架。我们的实验发现,最强的Agent 也只能完成约 33% 的任务,明显低于其在 OSWorld、WebArena 上的表现。