为大模型写一部原生语法:从表征几何到模型电路

806
0
2026-07-19 21:09:18
24
13
50
8
内容介绍: 本期分享将介绍"LLM 原生语法"(LLM-Native Grammar):一套立足于模型实际行为、而非人类语言学框架的描述体系。 一、旧范畴为什么不管用? 以“知识神经元”为例:关掉一个神经元,模型的语法数一致性确实会乱(ICLR 2024 Spotlight)。但深挖下去就会发现,所谓"知识"和词元共现、句法信息缠在一起,根本分不开;建立在这一假设上的模型编辑方法(如 ROME)也远没有想象中稳健。不是方法不够精巧,而是描述单位从一开始就借错了地方。 二、模型的激活空间里长出了什么? 用有监督多维缩放(TMLR 2026)打开隐藏状态,能看到一批出乎意料的几何结构:日期绕成圆环,时长排成对数直线,历史事件呈半环分布,四季聚作四簇。这些结构在 3B 到 70B 的各种模型上反复出现,而且是真正"干活"的:沿识别出的子空间做扰动,任务准确率直接掉 36%;换成随机子空间,几乎纹丝不动。 三、从神经元、注意力头到回路和 sheaf。 ACL 2025 杰出论文(top 0.3%)发现了"语境夹带"(contextual entrainment)现象:凡是上文出现过的词元,哪怕是随机塞进去的,模型都会不由自主地抬高它的概率,而假信息的干扰比真信息更强。通过可微掩码,这一效应被定位到约 36 个注意力头上,关掉它们,干扰随之消失。再往上一层,DiscoGP(EMNLP 2025)只用约 2% 的权重就保住 100% 的任务性能,找出的回路还能拆开重组;ICML 2026 的新工作则发现,同一个功能可以由几条几乎互不重叠的回路分别实现。描述模型的正确单位到底是什么?这个问题比想象中更开放。 四、描述之后,是控制。 原生语法不止于描述:看懂了结构,就能动手改。反过来说,认真研究这第二种语言系统,或许也能帮我们重新认识第一种,也就是人类自己的语言。 嘉宾: 牛靖程,德国达姆施塔特工业大学(TU Darmstadt)UKP 实验室博士后,博士毕业于多伦多大学计算语言学组。主要研究方向为大语言模型可解释性,关注如何把对模型内部机制的理解转化为提升模型可靠性、可控性与效率的具体手段,包括缓解干扰与幻觉、引导推理、在源头直接编辑模型行为等。曾获 ACL 2025 杰出论文奖(top 0.3%)等奖项。个人主页:https://frankniujc.github.io/。
全球一线青年学者发起的AI分享平台,聚焦「学术-落地-创业」闭环。 合作/投稿/加入我们 请联系:zenrran@gmail.com
接下来播放
自动连播
客服
顶部
赛事库 课堂 2021拜年纪