内容介绍:
Coding Agent 正在重塑软件开发,而强化学习(RL)是把 Agent 能力推向更高水平的关键路径。然而支持大规模训练的Agent强化学习框架还比较有限。本次分享围绕三件事展开:
其一,白盒框架。 提供一个可改、可扩展的白盒框架,让用户自由构建、定制 Agent,并在黑盒 Harness 还未触及的地方做扩展,比如让 Agent 感知更多模态(Desktop、GUI、Audio…)、做 Multi-Agent 系统编排等。
其二,Agent Gateway。 用Agent Gateway无缝接入 Claude Code、Codex 等黑盒 Harness,做到“训练即部署”,从根上消除“训练 Harness ≠ 推理 Harness”带来的性能损失。
其三,Agentic RL 优化。 长程、高频工具调用的 RL(128K 上下文、数百轮交互)在效率、资源、奖励与稳定性上都极具挑战;我们用系统性方案把它训得又快又稳,并在 SWE-Bench Verified 上取得可观提升(如 22.0 → 35.8, 47.6 → 54.6)。
嘉宾:
丁誉洋,苏州大学博士生,研究方向为智能体强化学习(Agentic RL)与鲁棒优化,以第一作者在 ICLR、NeurIPS、ACL 等顶级会议发表多篇论文;热衷开源,现为 veRL 核心贡献者与维护者、Uni-Agent 项目 Project Leader。个人主页:https://yyding1.github.io/。
主持人:
周睿文,新加坡国立大学博士生,研究方向为 LLM 智能体及多智能体系统中的强化学习和检索增强方法,特别关注在真实世界复杂场景中的应用。个人主页:https://skyriver-2000.github.io/。