内容介绍:
随着大型语言模型逐渐成为 AI 应用的重要基础设施,大多数用户都是通过云端 API 来使用这些模型。然而,在这种黑盒服务模式下,用户很难验证服务提供商是否真的运行了所承诺的模型,或者是否如实报告了实际使用的 token 数量。
在本次报告中,我将介绍 IMMACULATE,一个轻量级的 LLM 服务审计框架,使用户能够在 不访问模型内部结构的情况下验证黑盒 LLM API 的执行完整性。该框架通过对少量请求进行随机审计,并利用 可验证计算(Verifiable Computation) 来证明推理过程的正确性,从而大幅降低审计成本。
为了应对 GPU 推理过程中固有的数值非确定性,我们提出了 Logit Distance Distribution (LDD) 这一统计指标,用于刻画实际执行与参考模型之间的偏差,并能够有效识别诸如 模型替换、过度量化以及 token 过度计费 等潜在的经济动机型违规行为。
实验结果表明,该方法能够在 不到 1% 的额外系统开销 下可靠地检测恶意部署,为提升商业 LLM 服务的 透明性、可信度与问责性 提供了一种可行方案。
嘉宾:
郭衍培,新加坡国立大学二年级博士生,研究方向主要是应用密码学和AI安全,在Usenix Security, S&P, ICSE等顶会发表多篇成果。
主持人:
赵皓东,上海交通大学博士生,研究方向包括大模型智能体安全、可信机器学习等,于新加坡国立大学Prof. Bingsheng He团队访问,曾获得上海市优秀毕业生等荣誉。个人主页:https://dongdongzhaoup.github.io/。