5 月 30 日晚 8 点,#青稞 AMA 第 3 期:OPD 专题!
嘉宾阵容:
(主持人)傅宇千
自动化所深度强化学习团队博士生,导师为赵冬斌研究员与朱圆恒副研究员。研究方向为强化学习、大语言模型与智能体后训练。
Tianzhu
SRA GenAI组researcher,关注foundation model以及self-improving AI。OPCD、OEL、GAD 一作。
顾煜贤
清华大学计算机系五年级博士生,Google Scholar 引用4500+,已发表 20 余篇高水平论文,一作和共同一作论文共 7 篇,均发表在 TH-CPL A 类会议 ACL,EMNLP,ICLR,NeurIPS 等,多次进行口头报告,其中 MiniLLM: Knowledge distillation of large language models 论文两年半被引 970 次,技术被国内外多家公司实用。他曾获清华大学研究生特等奖学金、计算机系钟士模奖学金、国家奖学金、苹果学者奖学金、蚂蚁 In-Tech 奖学金等荣誉。
何秉翔
清华大学计算机系二年级博士生,导师为刘知远教授。研究方向为大模型对齐与强化学习,曾在 ACL、ICML、ICLR、NeurIPS 等人工智能国际顶级会议发表多篇论文,谷歌学术引用量超1900次。
杨晨旭
信息工程研究所六室自然语言处理小组博士生,导师为林政研究员,研究兴趣主要是多模态理解、大模型后训练。
黎亚轩
上海科技大学大三计算机专业本科生,THUNLP实验室实习生,Rethinking OPD一作。