[闲聊] 港城新进助理教授:我可不是个push的老板(摊手)| FAI-Chat 马梓业
[FAI] MIT 杨松琳 | 可扩展线性RNN的进展:DeltaNet及其变体
[FAI] 清华大学 陆伊炀 | 单步生成模型的近期进展
[FAI] 清华 温凯越 | Transformer不能被单元方法解释 NeurIPS 23'
[FAI] 清华大学 陈乐偲 | 基于“懒”Hessian技术的快速牛顿算法 ICLR 25' Oral
[FAI] 北京大学 李柄辉 | 理解大模型预训练动力学:从泛函尺度律视角
[FAI] MIT 刘子鸣 | 智能从饥饿中诞生
[FAI] 清华 陈焕然 | 扩散模型即为(可证明的)鲁棒分类器
[FAI*] 清华 张景昭老师 | knn算法的两阶段扩展定律 (scaling law)
[FAI] 普林斯顿 蔡天乐 | 让大语言模型自己创造工具
[FAI] 北大 李柄辉 | 深入理解深度学习中的对抗样本现象:从模型表达能力与训练动力学视角
[FAI] 同济大学 汪子乔 | f-散度在现代学习理论中的统一视角:从领域自适应到弱到强泛化
[FAI] MIT 戴言 | 如何给各怀鬼胎的用户分配资源,还能满足预算限制?
[FAI] 清华大学 温浩东 | Adam优化器隐式偏差:极小值流形附近的理论分析
[FAI] 港中深 张雨舜 | 浅谈神经网络Hessian矩阵的特殊结构
[FAI] 北大 张博航 | 基于子图的图神经网络表达能力探究 ICML 23'
[FAI] 上财 孙卓| 用扩散策略优化,把世界模型规模化
[FAI] NeurIPS25' Best Paper 清华 邱子涵 | 大语言模型,预训练,机制可解释性
[FAI] MIT 王一飞 | LLM的长文本困境:NTP任务与Transformer架构的内在偏差
[FAI] UPenn 马鉴昊 | Muon 中谱正交化的预条件优势