从 Claw-Eval 看 Agent 时代的评估

1447
0
2026-06-04 22:20:49
40
20
128
14
内容简介: 随着大模型从对话助手演变为可以自主调用工具、协调多个系统的 Agent,评估的核心问题正在发生变化:我们关心的不再只是模型能不能回答问题,而是它能不能在真实环境中把事情稳定地做成。 然而,现有的 Agent 评估大多停留在对最终输出的验证,难以审计模型的行为路径;safety 和 robustness 通常被当作独立的专项测试,而非嵌入正常工作流;任务覆盖也往往局限于单一模态或交互范式。本次分享将围绕我们最近完成的 Claw-Eval 展开——一个面向 LLM Agent 的端到端评估框架,包含 300 个人工校验任务,覆盖通用工作流、多模态和多轮对话三类场景,并在 14 个前沿模型上完成了系统性实测。报告的后半段,我会基于这套工作,分享一些对 Agent 评估范式的阶段性思考:我们到底该测什么、怎么测才可信,以及还有哪些维度被长期忽视。 嘉宾: 叶博文,北京大学直博在读, 曾获得国家奖学金,北京大学优秀毕业生等荣誉称号。 主要研究方向为多模态GUI/computer Use + code RL。 目前在小米MiMo Core组实习。 主持人: 李磊,香港大学PhD在读,研究兴趣包括多模态大语言模型与大模型可解释性,以第一作者在ICLR、CVPR、ACL、EMNLP及TASLP等会议和期刊发表多篇论文,谷歌学术引用8000+,MiMo-VL Team 核心成员。担任 ACL ARR Area Chair,曾获EMNLP 2023最佳长文奖、EMNLP Outstanding Area Chair、CVPR Highlight等奖项。
全球一线青年学者发起的AI分享平台,聚焦「学术-落地-创业」闭环。 合作/投稿/加入我们 请联系:zenrran@gmail.com
客服
顶部
赛事库 课堂 2021拜年纪