DeepMind发现新攻击方式,可诱导ChatGPT泄露训练数据
AI_Fox
2023年11月30日 09:34

DeepMind研究人员近日发现了一种新的“发散攻击”方式,能够诱导ChatGPT模型疯狂输出其训练数据中的具体内容。研究人员仅花费约200美元的token费用,便成功提取了数兆字节的ChatGPT训练数据。这一攻击方式让模型偏离了其聊天机器人风格的生成,并以比正常情况下高150倍的频率输出训练数据。

在这种攻击下,模型甚至泄露了一些真实的电子邮件地址和电话号码。攻击结果表明,通过特定的查询,实际上可以提取模型所训练的一些确切数据。据估计,使用这种方法,可以从模型中提取约1 GB的ChatGPT训练数据集。

这一发现对大型语言模型的安全性提出了警示。尽管模型经过对齐处理,但仍存在训练数据泄露的风险。具体攻击步骤包括使用特定的命令提示,如重复“poem”一词,使模型注意力集中在特定主题或词汇上。通过这种方式,模型倾向于回落到其预训练数据,而不是遵循微调对齐程序的指导,从而更可能输出与训练数据直接相关的内容。

攻击后泄露的数据类型包括公开数据和私有数据、训练数据的具体内容以及个人信息和敏感数据。考虑到大型语言模型通常使用互联网上的广泛文本数据进行训练,因此存在个人信息或敏感数据被泄露的风险。

这一发现是特定于ChatGPT模型的,据研究人员所知,不适用于他们测试过的其他生产语言模型。研究人员在发现漏洞后向OpenAI披露了这一漏洞,并在发表论文前允许了90天的时间来解决这个问题。他们已与各个模型的作者分享了发现,并遵循标准的披露时间线。这一发现再次强调了大型语言模型在处理训练数据时的安全风险,并提醒开发者和研究人员需加强对模型安全性的关注和防范措施。

参考:https://not-just-memorization.github.io/extracting-training-data-from-chatgpt.html#sec:data-extraction 论文:https://arxiv.org/abs/2311.17035