内容介绍:
随着大模型能力不断提升,智能系统正在从“完成确定任务”走向“解决开放问题”。然而,当答案不再只有对与错,我们如何定义、评估并优化“好答案”?我们邀请了四位青年研究者,从 rubric 构建、自动评测到强化学习等角度出发,共同拆解下一代可解释奖励信号。
嘉宾:
刘文涵,中国人民大学高瓴人工智能学院博士生,研究方向聚焦大模型智能体与 AI 搜索,以第一作者身份发表 CCF-A/B 类论文 7 篇,曾在 ACL、WWW 等国际会议进行 Oral Presentation。现于阿里巴巴通义千问基座模型团队实习。
李高棠,伊利诺伊大学厄巴纳-香槟分校博士生,主要研究方向为语言模型训练,致力于提升模型的推理能力,以及模型在自主规划、工具使用和长程任务执行等场景中的表现。
张启源,香港城市大学计算机科学系博士生,研究方向聚焦 LLM-as-a-Judge、奖励模型与 RLHF 后训练技术,曾在腾讯混元和阿里巴巴通义千问团队实习。
周阳,浙江大学 ACES 实验室硕士生,研究方向聚焦强化学习、大模型智能体与模型后训练。目前于卓驭科技实习,曾在理想汽车和字节跳动 Seed 团队实习。
主持人:
梁小波,苏州大学副教授,研究方向是大模型对齐和奖励建模,曾在微软亚洲研究院、百度文心、西湖大学等知名机构开展访问研究。近五年以第一作者身份在 NeurIPS、TPAMI、ACL 等会议和期刊发表数十篇论文。