
最近注意力机制与因果推断的融合研究持续升温,各大期刊会议纷纷收录相关成果,凭借两者互补优势打破了单一模型的局限——注意力机制擅长动态聚焦核心信息、挖掘数据关联,却易受混淆因子影响,缺乏因果可解释性;因果推断能有效排除数据偏见、构建反事实推理框架,却难以适配高维度复杂数据的特征提取需求。目前该融合方向已在视觉推理、推荐系统、多模态分析等领域实现突破,因果流注意力、生成式注意力融合模型等,显著提升了模型的鲁棒性与可解释性,部分模型在真实数据集上的性能远超传统单一方法。
对于深耕该方向的论文党来说,因果注意力掩码、反事实特征建模、数据去偏等都是优质选题,我已整理好相关顶会论文及复现代码(部分),想快速上手的同学扫码回复 因果注意力 领取

文章解析
本文深入研究了大语言模型(LLM)在多项选择题问答中对提示词顺序的敏感性,发现将上下文置于问题和选项之前(CQO)显著优于相反顺序(QOC)。通过排除训练数据偏差和选项遗忘假说,作者证实核心原因是因果注意力机制:在QOC顺序中,因果掩码阻断了选项对上下文的注意力,导致信息瓶颈。文章进一步提出了针对性的干预措施以缓解这一问题。
创新点
提出了上下文-问题-选项(CQO)顺序优于问题-选项-上下文(QOC)的实证发现,并揭示了其背后的架构性原因。
通过架构对比实验,证明了因果掩码是导致QOC性能下降的核心机制,而非数据分布或记忆衰减。
设计了注意力剪枝、激活修补和选项重复等干预手段,从因果路径的角度验证了模型利用上下文信息的具体机制。
研究方法
采用控制变量法,在LogiQA、SciQ等4个数据集上对比CQO与QOC两种提示结构在21个Decoder-only模型上的表现。
进行了跨架构对比实验,引入Encoder-only(BERT)和Encoder-Decoder(T5)模型,利用双向注意力特性验证因果掩码的影响。
运用归因分析(Gradient×Input)和因果干预技术(如注意力掩码修剪和隐藏状态修补),量化上下文对选项的贡献及路径依赖。
研究结论
因果注意力掩码导致了QOC结构中的信息瓶颈,模型无法利用后续的上下文信息来区分选项,导致性能大幅下降。
这种顺序敏感性并非源于训练数据的分布偏差或长上下文中的中间信息丢失,而是Decoder架构的固有局限。
通过修补选项的隐藏状态或重复选项(QOCO),可以绕过因果掩码限制,显著提升QOC结构下的模型准确率。

文章解析
本文针对检索增强生成(RAG)系统面临的语料库知识投毒攻击,提出了稀疏文档注意力RAG(SDAG)防御方法。作者指出标准因果注意力机制允许检索到的文档间进行交叉注意力计算,导致有害信息传播。SDAG通过块稀疏注意力机制,禁止不同文档间的交叉注意力,仅允许文档内部的因果注意力。该方法仅需在推理时修改注意力掩码,无需微调或架构更改。实验表明,SDAG在单文档攻击场景下显著优于现有防御方法,并能与现有方法结合提升多文档攻击下的防御效果。
创新点
提出了稀疏文档注意力(SDAG)机制,通过禁止不同检索文档间的交叉注意力,从架构层面阻断攻击路径。
证明了标准因果注意力机制是RAG易受投毒攻击的关键因素,揭示了跨文档注意力导致的有害信息传播问题。
提供了一种免训练、即插即用的防御方案,可无缝集成到现有RAG系统中,并能与检索后过滤类防御方法结合使用。
研究方法
采用理论分析与对比实验,论证了因果注意力机制在处理检索文档时的局限性,确立了块稀疏注意力的必要性。
在Llama-8B、Qwen-7B和Mistral-7B等模型上实施SDAG,通过修改注意力掩码矩阵实现文档间的注意力隔离。
在HotpotQA、TriviaQA和NQ数据集上,利用PoisonedRAG框架生成对抗样本,评估了SDAG在单文档及多文档攻击场景下的性能。
研究结论
SDAG在单对抗文档攻击场景下显著优于现有防御基线,有效降低了攻击成功率(ASR)并保持了较高的问答准确率。
在多对抗文档攻击场景下,SDAG与现有防御方法(如RAGDefender)结合后,建立了新的防御性能上限。
攻击效果与对抗文档在嵌入空间中的位置密切相关,距离良性文档集群越远,攻击越容易被SDAG抑制。
