ClawBench: Can AI Agents Complete Everyday Online Tasks?

858
0
2026-05-22 17:00:00
16
4
27
5
张宇轩,University of British Columbia 博士在读。研究方向包括 LLM、Agent 评测和 Agent Harness Engineering。 AI Agent 正在影响我们的生活,但能否可靠地完成订餐、订机票、求职投递、活动报名、写评论等我们生活中常用的网页操作?现有的评测大多基于静态网页或离线沙盒,难以覆盖真实网站的动态交互和高风险写操作。 ClawBench 是一个运行在生产环境真实网站上的 Agent 评测基准:V1 + V2 共 283 个任务,覆盖 163 个活跃平台和 15 个生活类目;通过记录录屏、Agent 动作、HTTP 流量、Agent 消息和截图,并用 “HTTP 请求拦截 + LLM Jude” 打分。我们的codebase支持绝大多数前沿模型 × 8 种 Agent 框架。我们的实验发现,最强的Agent 也只能完成约 33% 的任务,明显低于其在 OSWorld、WebArena 上的表现。
发扬科学思辨精神,链接全球AI 爱好者
客服
顶部
赛事库 课堂 2021拜年纪