内容简介:
随着大模型从对话助手演变为可以自主调用工具、协调多个系统的 Agent,评估的核心问题正在发生变化:我们关心的不再只是模型能不能回答问题,而是它能不能在真实环境中把事情稳定地做成。 然而,现有的 Agent 评估大多停留在对最终输出的验证,难以审计模型的行为路径;safety 和 robustness 通常被当作独立的专项测试,而非嵌入正常工作流;任务覆盖也往往局限于单一模态或交互范式。本次分享将围绕我们最近完成的 Claw-Eval 展开——一个面向 LLM Agent 的端到端评估框架,包含 300 个人工校验任务,覆盖通用工作流、多模态和多轮对话三类场景,并在 14 个前沿模型上完成了系统性实测。报告的后半段,我会基于这套工作,分享一些对 Agent 评估范式的阶段性思考:我们到底该测什么、怎么测才可信,以及还有哪些维度被长期忽视。
嘉宾:
叶博文,北京大学直博在读, 曾获得国家奖学金,北京大学优秀毕业生等荣誉称号。 主要研究方向为多模态GUI/computer Use + code RL。 目前在小米MiMo Core组实习。
主持人:
李磊,香港大学PhD在读,研究兴趣包括多模态大语言模型与大模型可解释性,以第一作者在ICLR、CVPR、ACL、EMNLP及TASLP等会议和期刊发表多篇论文,谷歌学术引用8000+,MiMo-VL Team 核心成员。担任 ACL ARR Area Chair,曾获EMNLP 2023最佳长文奖、EMNLP Outstanding Area Chair、CVPR Highlight等奖项。