不止于可验证奖励:面向开放式任务的 Rubric

1633
5
2026-08-07 14:15:15
51
39
120
27
内容介绍: 随着大模型能力不断提升,智能系统正在从“完成确定任务”走向“解决开放问题”。然而,当答案不再只有对与错,我们如何定义、评估并优化“好答案”?我们邀请了四位青年研究者,从 rubric 构建、自动评测到强化学习等角度出发,共同拆解下一代可解释奖励信号。 嘉宾: 刘文涵,中国人民大学高瓴人工智能学院博士生,研究方向聚焦大模型智能体与 AI 搜索,以第一作者身份发表 CCF-A/B 类论文 7 篇,曾在 ACL、WWW 等国际会议进行 Oral Presentation。现于阿里巴巴通义千问基座模型团队实习。 李高棠,伊利诺伊大学厄巴纳-香槟分校博士生,主要研究方向为语言模型训练,致力于提升模型的推理能力,以及模型在自主规划、工具使用和长程任务执行等场景中的表现。 张启源,香港城市大学计算机科学系博士生,研究方向聚焦 LLM-as-a-Judge、奖励模型与 RLHF 后训练技术,曾在腾讯混元和阿里巴巴通义千问团队实习。 周阳,浙江大学 ACES 实验室硕士生,研究方向聚焦强化学习、大模型智能体与模型后训练。目前于卓驭科技实习,曾在理想汽车和字节跳动 Seed 团队实习。 主持人: 梁小波,苏州大学副教授,研究方向是大模型对齐和奖励建模,曾在微软亚洲研究院、百度文心、西湖大学等知名机构开展访问研究。近五年以第一作者身份在 NeurIPS、TPAMI、ACL 等会议和期刊发表数十篇论文。
全球一线青年学者发起的AI分享平台,聚焦「学术-落地-创业」闭环。 合作/投稿/加入我们 请联系:zenrran@gmail.com
视频选集
(1/6)
开场
01:58
刘文涵 | A Survey of Rubrics for Large Language Models
38:50
李高棠 | Towards Training Open-Ended Deep Research Agents Beyond Verifiable Rewards
38:40
张启源 | RubricBench: Aligning Model-Generated Rubrics with Human Standards
34:35
周阳 | How to Generate and Effectively Use High-Quality Rubrics
33:03
PANEL
31:59
客服
顶部
赛事库 课堂 2021拜年纪