内容介绍:
随着 MCP、Agent Skills 以及各类 Harness 的快速演进,大模型已经可以轻松调用成百上千种外部工具。然而,在多工具协同、状态复杂、长程交互的真实任务面前,智能体仍然短板明显。为弥合这一差距,业界陆续提出多种环境扩展方法,试图复刻订票系统、外卖平台、Notion 等真实世界的交互环境。但这些尝试始终受限于两道天花板:
环境扩展侧:人工搭建环境难以兼顾规模,覆盖面有限;自动环境合成则存在真实性不足
训练算法侧:训练环境再多,一旦智能体面对全新场景,若缺乏持续学习的能力,泛化性依然堪忧。
为打破这一困局,来自中国人民大学和字节跳动的研究团队给出了一个极具开创性的答案:Agent-World,一个面向通用智能体的训练场,首次将“智能体环境探索”与“持续自进化训练”深度耦合,构建起智能体与环境协同进化的闭环。
嘉宾:
董冠霆,中国人民大学高瓴人工智能学院博士二年级,主要研究方向为通用智能体训练。以第一/共同第一作者身份在 ICLR、NeurIPS、ACL 等国际顶级会议发表论文 10 余篇;其代表工作包括 Agent-World、ARPO、AUTOIF、Search-o1、Webthinker、FlashRAG 等,受到国内外研究者的广泛关注。谷歌学术引用量 1 万余次,个人 GitHub 项目累计获得星标超 8000 余枚,并在字节跳动 Seed、阿里通义千问、快手快意大模型等核心基座大模型团队实习。曾获首届腾讯青云奖学金,国家奖学金、北京市优秀毕业生等荣誉,并入选国家自然科学基金青年学生基础研究项目 (博士生)、中国科协青年人才托举工程博士生专项计划资助。个人主页:https://dongguanting.github.io/。
主持人:
薛博阳,香港中文大学四年级博士生,研究方向包括可信大模型/智能体,对话系统,贝叶斯学习,语音识别等,分别于苏黎世联邦理工学院和伦敦大学学院进行学术交流,以一作身份在 ACL, EMNLP, TASLP 等人工智能顶级会议期刊发表多篇论文,并担任相关会议期刊审稿人。当前主要致力于提高大模型的可靠性。个人主页:https://amourwaltz.github.io/。