Agent 如何学会训练模型?从数据研究到可验证的自我进化

1052
1
2026-08-08 22:51:30
35
10
66
11
内容介绍: 当 Agent 不再只是完成任务,而是开始分析模型为何失败、设计训练数据、运行实验并决定下一轮方向,我们该如何判断它究竟是在“做研究”,还是只是在反复调用训练工具?现有自动后训练系统往往同时改变数据、超参数、推理配置与评测流程,分数上涨后很难解释真正的改进来自哪里。RSIBench-Data 将训练、推理与评测服务化,只把数据研究决策交给 Agent,尝试把递归自我改进中最关键的一段闭环变成可测量、可复现、可审计的研究问题。本次分享将介绍这一受控框架、24 条完整研究轨迹,以及当前前沿 Agent 距离稳定自我改进还有多远。 真正的 RSI,不是让模型反复训练自己,而是让它从失败中设计出更好的下一次实验。 嘉宾: 孟繁青,新加坡国立大学(NUS)博士生、Evolvent AI 联合创始人,研究方向涵盖大语言模型、多模态大模型与 AI Agent。博士前两年,他已发表 20 余篇论文,其中 6 篇以第一作者身份发表于 ICLR、NeurIPS、ICML 等人工智能顶级会议,谷歌学术引用超过 2,500 次。 他主导开发了开源项目 MM-Eureka,该项目已获得超过 1,000 个 GitHub Stars,相关论文引用超过 400 次;同时也是 Kimi Linear 和 Kimi K2.5 的贡献者。 他的研究主要聚焦三个方向:以 MM-Eureka、CPGD 和 ChartAssistant 为代表的通用推理模型;以 MCPMark 和 ClawMark 为代表的 Agent 评测与奖励建模;以及以 Kimi Linear 和 Kimi K2.5 为代表的 Agent 强化学习基础设施。 主持人: 周恩宇,复旦大学博士生,研究方向为 Agentic AI, Responsible AI,LLM Alignment。
全球一线青年学者发起的AI分享平台,聚焦「学术-落地-创业」闭环。 合作/投稿/加入我们 请联系:zenrran@gmail.com
客服
顶部
赛事库 课堂 2021拜年纪