摘要:
大型语言模型(LLM)在文本分析任务中表现出的性别偏见已被广泛讨论,但既有研究多集中于偏见的“存在与否”,较少关注偏见的触发条件与逻辑机制。
本研究通过一个严格的双轮A/B对照实验,揭示了当前主流对话式LLM中存在的一种“逻辑选择性失调”现象。
实验以一段包含“一个是格斗运动员,一个是MIT硕士”的并列分配结构的虚构文本为材料。其中两个核心特质——格斗运动员与MIT硕士——分别属于一女一男两个角色。
在实验组A的十五个独立窗口中,实验样本设置为男性是MIT硕士,女性是格斗运动员。模型系统性地无视该并列句法,将两项特质同时错误地归于男性角色,即男性即是格斗运动员又是MIT硕士。
在实验组B的十五个独立窗口中,实验样本设置为女性是MIT硕士,男性是格斗运动员。模型则全部完成了正确的特质分配。
在三十次实验、十五组对照中,这一“正像全错、镜像全对”的结果,排除了偶然失误与纯粹语法解析能力不足的解释,指向一种情境依赖的偏见机制:
模型的逻辑解析能力在分析结果符合性别刻板印象时正常运作,当分析结果挑战刻板印象时则被系统性地凌驾。
本研究据此提出“偏见激活开关”概念,认为此类LLM的性别偏见并非均匀分布的技术缺陷,而是一种有选择性的认知接管——它以牺牲语法逻辑为代价,强制执行“性别刻板印象”的叙事默认模板。
论文进一步讨论了这一机制对女性用户在认知层面构成的系统性伤害,包括特质非法转移、认知围栏效应以及以“理性”为伪装的不可反驳的压迫,为AI偏见研究从“存不存在”走向“何时触发、如何运作”提供了新的实证路径与理论切口。
关键词:大型语言模型;性别偏见;逻辑选择性失调;偏见激活开关;A/B对照实验;算法公平