内容介绍:
本次分享将围绕我们关于大语言模型内生可解释性(intrinsic interpretability)的综述展开。与传统在模型训练完成后再进行分析的事后解释(post-hoc interpretability)不同,内生可解释性关注如何在模型结构、训练目标和信息流路径中直接引入可解释性,使解释与模型真实计算过程更加一致。
报告将首先结合事后解释与内生解释的对比,介绍这一研究视角的出发点;随后系统梳理该方向的五类主要设计范式,包括功能透明性、概念对齐、表征可分解性、显式模块化和潜在稀疏性诱导,并讨论代表工作、核心挑战及其对未来大模型设计的启发。
嘉宾:
孟庆霖,普渡大学计算机系博士四年级学生,研究方向包括机器学习理论、强化学习、多臂老虎机以及大语言模型,近期研究兴趣也包括大语言模型的可解释性。个人主页:https://qlmeng2025.github.io/。
主持人:
王梦如,浙江大学博士生,研究方向是 Interpretability and LLM Safety,在 NeurPIS,ACL,EMNLP 等顶级会议发表过论文。