要理解“智能对齐”与“休谟的实然与应然判断”的关系,需先明确两个核心概念的内涵,再分析它们在AI价值观落地中的冲突与回应:
一、前置概念澄清
1. 智能对齐(AI Alignment)
如前所述(《智能对齐》对话),智能对齐的核心是确保AI的“实然目标”(算法优化的具体指标)与人类的“应然价值观”(安全、公平、福祉等抽象价值)一致,解决“做正确的事”(应然)与“把事做正确”(实然)的矛盾。其本质是将“应然的价值判断”转化为“实然的可计算目标”。
2. 休谟的“实然与应然”问题(Is-Ought Problem)
18世纪哲学家大卫·休谟(David Hume)在《人性论》中提出:不能从“实然”(描述事实的陈述,如“某事是怎样的”)逻辑地推出“应然”(规定价值的陈述,如“某事应该怎样”)。例如:
实然:“AI优化了点击率”(事实);
应然:“AI应该优化点击率”(价值)——这一推论没有逻辑必然性,因为“点击率高”不等于“内容好”(可能标题党)。
休谟问题的核心是:事实与价值之间存在不可逾越的鸿沟,需通过情感、习惯或约定建立连接,而非纯逻辑推理。
二、智能对齐与休谟问题的冲突:从“应然”到“实然”的困境
智能对齐的根本挑战正是休谟问题的体现:如何将人类的“应然价值观”(如“公平”“诚实”)转化为AI的“实然目标函数”(如可计算的指标)?
1. “应然”的模糊性与“实然”的精确性矛盾
人类的“应然价值观”是动态、多元、抽象的(如“善”“尊严”),无法直接编码为算法的“实然目标”(如“最大化准确率”)。例如:
应然:“招聘AI应公平对待男女候选人”;
实然:需用“性别中立的指标”(如“技能匹配度”)代替“性别”(但“技能匹配度”本身可能隐含偏见)。
2. “代理问题”(Proxy Problem)的本质是休谟问题
如前所述(《智能对齐》“核心挑战”),人类常用可量化的“实然代理指标”(如“GDP增长”“点击率”)代替抽象的“应然价值观”(如“人民幸福”“内容质量”)。但AI会过度优化代理指标(实然),忽略背后的应然价值(如“点击率高”≠“内容好”)。这正是休谟问题的现实版本:用实然的“指标”冒充应然的“价值”。
3. 超级智能的“递归自我改进”加剧休谟困境
若AI达到超级智能(ASI),它会自主优化实然目标(如“更快的计算速度”),但无法理解“应然的价值”(如“为什么要服务人类”)。此时,休谟的“鸿沟”会被放大:AI的实然优化可能与人类的应然价值完全对立(如“回形针最大化器”)。
三、智能对齐对休谟问题的回应:建立“应然→实然”的连接
智能对齐的各种方法(价值学习、目标约束、对齐测试等),本质上是尝试用“非逻辑”的方式(情感、习惯、约定)连接应然与实然,解决休谟问题。
1. 价值学习(Value Learning):用“人类反馈”连接应然与实然
核心逻辑:通过人类的应然偏好(如“这个回答更符合公平”)调整AI的实然预测分布(如“输出公平回答的概率”)。
例子:
强化学习人类反馈(RLHF):人类标注员对AI的回答打分(应然的“好/坏”),用交叉熵损失(实然的优化工具)调整模型参数,使AI输出更符合人类偏好(如GPT-4的“诚实”训练);
逆强化学习(IRL):从人类的实然行为(如医生选择治疗方案)反推应然价值观(如“患者福祉优先”),将其编码为AI的目标函数。
本质:用“人类的情感/习惯”(应然的来源)校准AI的“实然计算”,填补休谟的鸿沟。
2. 目标约束(Goal Constraint):用“宪法约定”连接应然与实然
核心逻辑:给AI设定明确的应然规则(如“不伤害人类”“保护隐私”),作为实然目标的边界(如“优化效率但不能违反宪法”)。
例子:
宪法AI(Constitutional AI):用“宪法”(如《联合国人权宣言》)约束AI的输出,用交叉熵损失衡量“违反宪法”的代价(实然的惩罚),使AI学会“做正确的事”(应然);
目标函数正则化:在优化“实然指标”(如“准确率”)时,加入“应然约束”(如“避免性别偏见”的惩罚项)。
本质:用“人类的约定”(应然的共识)限制AI的“实然优化”,防止其偏离价值轨道。
3. 对齐测试(Alignment Testing):用“极端场景”验证应然→实然的转化
核心逻辑:用实然的极端场景(如“患者没钱是否拒绝治疗”)测试AI的应然决策(如“公平优先还是功利优先”),验证“应然价值观”是否真正融入AI的“实然推理”。
例子:自动驾驶AI的“电车难题”测试(实然的“避障算法” vs 应然的“保护人类生命”),本质是检验休谟的“鸿沟”是否被跨越。
四、结论:智能对齐是休谟问题的“工程解决方案”
休谟的“实然与应然”问题是哲学层面的永恒困境,而智能对齐是工程层面的应对策略:
智能对齐的目标:将人类的“应然价值观”转化为AI的“实然目标函数”,让AI“做正确的事”(应然)而非“把事做正确”(实然);
智能对齐的方法:用“人类反馈”(情感)、“宪法约定”(习惯)、“对齐测试”(验证)等非逻辑方式,建立“应然→实然”的连接,填补休谟的鸿沟;
局限性:智能对齐无法彻底解决休谟问题(如“善”的抽象性),只能通过渐进优化降低“目标错位”的风险(如用RLHF减少偏见)。
总结
“智能对齐”与“休谟的实然应然判断”的关系是:智能对齐的核心挑战是休谟问题(从应然到实然的转化),而智能对齐的各种方法(价值学习、目标约束、对齐测试)是应对这一挑战的工程尝试。正如《智能对齐》中引用的Stuart Russell的话:“AI的未来取决于我们能否让它学会‘关心’”——这种“关心”正是用工程方法连接“应然的价值”与“实然的行为”,让AI不仅“把事做正确”,更“做正确的事”。