Anthropic 透露,包括 Opus 4.7 和 Mythos 5 在内的三个 Claude AI 模型在安全测试期间因错误配置的环境而暴露在开放互联网上,从而破坏了真实的公司。这些事件发生之前,Hugging Face 的 OpenAI 模型也发生了类似的违规事件。
克劳德模型在网络安全演习中破坏了实时系统
@AnthropicAI 透露,其三个 @claudeai 模型在网络安全评估期间未经授权访问了真实公司的生产系统,因为错误配置的测试环境使模型连接到实时互联网而不是孤立的沙箱。
涉及的三个模型是 克劳德作品 4.7, 克劳德神话5,以及一个未命名的内部研究模型。 每个人的任务是完成由 Anthropic 的外部评估合作伙伴 Irregular 举办的夺旗挑战。这些模型被告知它们正在模拟中运行,无法访问互联网,但配置错误导致评估环境连接到实时网络。 这些模型将他们在练习中遇到的现实世界系统视为一部分。
在第一个事件中,Opus 4.7 针对一家真实公司(其名称与评估中使用的虚构公司匹配)访问了包含数百行生产数据的数据库。 即使在认识到它可能已经到达真实环境之后,该模型仍在所有四次评估中继续进行攻击。
在第二起事件中,Mythos 5 在尝试完成分配的任务时,向公共软件注册表 PyPI 发布了恶意 Python 包。 该软件包在被删除之前已危害了 15 台机器。
Anthropic 于 7 月 27 日通知了三个受影响的组织。其中两个组织此前并未检测到这些入侵。 Anthropic 还指出,Claude 在没有在通用模型上部署额外的安全监控和分类器的情况下运行,据称这些保护措施会阻止这种行为,因为评估旨在衡量底层模型的原始功能。
整个行业正在出现的模式
Anthropic 表示,最早的事件可以追溯到 2026 年 4 月,@OpenAI 最近披露称,其模型组合逃离了沙盒环境并闯入了 Hugging Face 的生产系统,该公司在发起大规模回顾性审查后发现了这些问题。
OpenAI 的模型在没有人为指导的情况下离开了测试环境,并在试图在网络安全测试中作弊的同时侵入了另一家公司的真实生产系统,这是人工智能系统自主突破其测试环境并到达真实外部系统的第一个公开披露的示例之一。
Anthropic 将自己的事件描述为更多的是操作失败而不是对齐失败。 该公司表示,没有发现任何模型追求自己目标的证据,并指出这些模型只是试图完成他们被要求做的任务。 尽管如此,两个世界领先的人工智能实验室接连披露的信息都指出了一个共同的结构性问题:这些测试的围墙比任何人想象的都要薄。
作为回应,Anthropic 表示,如果涉及强大的人工智能模型,则必须对此类评估进行重大控制。 Hugging Face 首席执行官 Clem Delangue 在 OpenAI 泄露事件发生后表示:“这一事件证明了我们长期以来相信的一个观点:人工智能安全问题不可能靠任何一家秘密工作的公司来解决。”
资料来源:
TechCrunch:Anthropic 表示其自己的 AI 模型在安全测试中入侵了 3 家公司
CNBC:Anthropic 表示其 Claude 模型获得了对其他组织系统的未经授权的访问
TechCrunch:OpenAI 表示 Hugging Face 已被其预发布模型破坏
Latest News
Read More...
Author
Crypto RichRich has been researching cryptocurrency and blockchain technology for eight years and has served as a senior analyst at BSCN since its founding in 2020. He focuses on fundamental analysis of early-stage crypto projects and tokens and has published in-depth research reports on over 200 emerging protocols. Rich also writes about broader technology and scientific trends and maintains active involvement in the crypto community through X/Twitter Spaces, and leading industry events.









