Uni-Agent:大规模训练 Agent 的统一框架

704
0
2026-07-07 22:31:03
13
投币
54
8
内容介绍: Coding Agent 正在重塑软件开发,而强化学习(RL)是把 Agent 能力推向更高水平的关键路径。然而支持大规模训练的Agent强化学习框架还比较有限。本次分享围绕三件事展开: 其一,白盒框架。 提供一个可改、可扩展的白盒框架,让用户自由构建、定制 Agent,并在黑盒 Harness 还未触及的地方做扩展,比如让 Agent 感知更多模态(Desktop、GUI、Audio…)、做 Multi-Agent 系统编排等。 其二,Agent Gateway。 用Agent Gateway无缝接入 Claude Code、Codex 等黑盒 Harness,做到“训练即部署”,从根上消除“训练 Harness ≠ 推理 Harness”带来的性能损失。 其三,Agentic RL 优化。 长程、高频工具调用的 RL(128K 上下文、数百轮交互)在效率、资源、奖励与稳定性上都极具挑战;我们用系统性方案把它训得又快又稳,并在 SWE-Bench Verified 上取得可观提升(如 22.0 → 35.8, 47.6 → 54.6)。 嘉宾: 丁誉洋,苏州大学博士生,研究方向为智能体强化学习(Agentic RL)与鲁棒优化,以第一作者在 ICLR、NeurIPS、ACL 等顶级会议发表多篇论文;热衷开源,现为 veRL 核心贡献者与维护者、Uni-Agent 项目 Project Leader。个人主页:https://yyding1.github.io/。 主持人: 周睿文,新加坡国立大学博士生,研究方向为 LLM 智能体及多智能体系统中的强化学习和检索增强方法,特别关注在真实世界复杂场景中的应用。个人主页:https://skyriver-2000.github.io/。
全球一线青年学者发起的AI分享平台,聚焦「学术-落地-创业」闭环。 合作/投稿/加入我们 请联系:zenrran@gmail.com
客服
顶部
赛事库 课堂 2021拜年纪