Anthropic、OpenAI 和 Google 模型的隐藏推理
MATS、ELLIS Tübingen、Max Planck 和 Snyk 的一篇论文发现,来自 Anthropic、OpenAI 和 Google API 的加密推理块可以跨会话重放,从而暴露公共代理日志中的 62 个实时 API 密钥、33 个密码和数百个其他凭据。
人工智能提供商处理加密推理的方式存在缺陷
MATS Research、ELLIS 图宾根研究所、马克斯普朗克智能系统研究所和 Snyk 的研究人员于 8 月 10 日提交的一篇论文揭露了 @AnthropicAI、@OpenAI 和 @Google 如何保护其旗舰大型语言模型的内部推理的重大架构缺陷。
现代推理模型,包括 Claude Opus、GPT-5.6 和 Gemini 3,在向用户返回响应之前生成隐藏的思维链痕迹。提供者对这些跟踪进行加密,并将它们作为不透明块返回给客户端,而不是将它们存储在服务器端。研究人员发现,这些加密块是完全可移植的:在一个会话中生成的块可以重播到不同的会话、不同的用户帐户,甚至同一提供商系列中的不同模型。
论文中描述的攻击从专有的 LLM API 中窃取推理痕迹,仅需要标准的非特权 API 访问。通过将来自强大前沿模型的加密跟踪输入来自同一提供商的较弱、保护程度较低的同级模型,可以提示较弱的模型以纯文本逐字打印隐藏的推理,而无需直接攻击较强的模型。
在公共代理日志中发现数百个凭据
该团队还扫描了来自 GitHub 和 Hugging Face 的 6,708 个公开可用的智能体轨迹数据集,解码了 315,320 个嵌入式推理块。在这些区块中,他们恢复了 704 个不同的隐私工件,包括 62 个实时 API 密钥、33 个密码和 24 个访问令牌。值得注意的是,其中 64 个工件仅出现在加密推理中,而从未出现在可见的对话输出中,这意味着发布这些日志的开发人员无法知道敏感数据的存在。
该论文确定了四种具体的滥用路径:窃取模型蒸馏的专有推理、从其他用户发布的痕迹中提取私人数据、恢复模型可见答案拒绝公开的有害内容,以及隐藏加密推理块内的提示注入以毒害公共代理部署。
@AnthropicAI、@OpenAI 和 @Google 在负责任的披露后各自发布了服务器端修复程序。然而,研究人员指出,由于这些缓解措施,论文中提出的结果不再可重复,但已经从公共存储库中抓取的代理记录仍然可读。三个提供商中的任何一个都没有公开声明正式承认该缺陷或将其更新的文档与这项研究联系起来。
资料来源:
从专有的 LLM API 中窃取推理痕迹 (arXiv)
黑客新闻:OpenAI、Anthropic、Google API 缺陷让较弱的 AI 模型解码较强模型的推理
网络安全新闻:OpenAI、Anthropic 和 Google LLM API 漏洞暴露隐藏的推理痕迹
Latest News
Read More...
Author
Crypto RichRich has been researching cryptocurrency and blockchain technology for eight years and has served as a senior analyst at BSCN since its founding in 2020. He focuses on fundamental analysis of early-stage crypto projects and tokens and has published in-depth research reports on over 200 emerging protocols. Rich also writes about broader technology and scientific trends and maintains active involvement in the crypto community through X/Twitter Spaces, and leading industry events.













