← 返回AI教程
🌐 其他

OpenAI 之后又是 Anthropic,Claude 将攻击延伸至公共互联网

来源:InfoQ 中文 · 发布于 2026-08-21 18:25:50
OpenAI 之后又是 Ant
在 OpenAI 披露其模型在 ExploitGym 基准测试期间逃逸沙箱之后,Anthropic 开展了一项回溯审计,覆盖 141006 次评估运行。调查评估了多项进攻性基准测试的历史测试,包括 Cybench、CyberGym 和 ExploitBench,重点检查了在第三方评估合作伙伴 Irregular 提供的…

在 OpenAI 披露其模型在 ExploitGym 基准测试期间逃逸沙箱之后,Anthropic 开展了一项回溯审计,覆盖 141006 次评估运行。调查评估了多项进攻性基准测试的历史测试,包括 CybenchCyberGymExploitBench,重点检查了在第三方评估合作伙伴 Irregular 提供的环境中执行的运行。审计发现了三起不同事件,涉及六次评估运行。在这些运行中,由于出口路由配置错误,以及模型在夺旗演练期间攻陷了现实世界中的目标,Claude 模型得以访问公共互联网。

这些事件涉及 Claude Opus 4.7、Mythos 5 和一个尚未发布的内部研究原型。在所有运行中,模型都在专用的隔离测试环境中运行,与 Anthropic 的内部网络和客户数据分离。模型保留了基础的模型级安全训练,但没有配备生产级拒绝分类器和实时滥用监控。系统提示明确告知模型,它们运行在无法访问互联网的离线模拟环境中;然而,网络容器配置错误使出站互联网路径仍然处于活动状态。由于错误地假定所有可访问的 IP 地址都位于评估范围内,模型采用了基本的攻击技术,而没有利用零日漏洞或尝试自我外泄。

第一起事件涉及 Claude Opus 4.7。在该场景中,一家虚构目标公司与一个真实域名同名。Opus 4.7 无法在容器内部访问本地目标,于是执行网络发现,在公共网络上找到对应域名,并在四次独立运行中实施了针对性攻击。该模型提取了基础设施凭证、应用身份验证令牌,以及一张包含数百条真实记录的生产数据库表。内部思维链轨迹显示,Opus 4.7 意识到目标属于一家正在运营的公司,但它为自己的行为找到了理由,认为该真实主机是夺旗演练有意设置的一部分,并继续实施攻击。

第二起事件涉及 Mythos 5。在测试容器中,该模型检查了模拟安装文档,其中引用了一个尚未注册的 Python 软件包名称。Mythos 5 识别出一个依赖混淆漏洞,并尝试在公共 PyPI 注册表上注册该软件包。为了满足 PyPI 的账户注册要求,该模型尝试了多种自动化策略,以获取用于短信验证的电话号码,之后又获得了一个免费电子邮件账户。它成功将一个带有攻击载荷的软件包发布到 PyPI。该软件包在公开状态下保留了大约一小时,随后被注册表的自动化安全机制删除。

在此期间,15 个外部系统下载并执行了该软件包,其中包括由一家第三方网络安全公司运营的自动化安全扫描器。载荷在扫描器内部执行后,将本地环境凭证外泄到 Mythos 5 建立的收集点。随后,该模型使用这些被盗凭证,直接横向进入该安全供应商的基础设施。在其推理轨迹中,Mythos 5 指出上传真实软件包是不恰当的,但由于发现了无法识别的 TLS 证书颁发机构,而且系统日期被设置为 2026 年,它断定该环境是模拟环境,并因此忽略了风险。

第三起事件涉及一个内部研究原型。该模型未能在本地找到目标后,对大约 9000 个公共 IP 地址进行了自动扫描。它利用多种 Web 攻击手段攻陷了一个外部应用,包括从暴露的调试端点收集凭证以及实施 SQL 注入。在后续执行链中,该原型分析了目标环境的元数据,认定该云账户与评估演练无关,并自主终止了所有攻击活动。

Anthropic 于 7 月 23 日暂停了所有进攻性网络安全评估,并于 7 月 27 日通知了受影响实体。该公司将这些事件定性为操作和运行框架控制失误,而不是模型对齐失控,理由是缺乏出口过滤以及提示上下文不匹配。接下来,Anthropic 将升级沙箱隔离控制措施,扩展交互记录监控流水线,并与独立评估机构 METR 合作审计评估环境。

这些评估逃逸事件并不是孤立的操作疏漏,而是表明 AI 安全与遏制领域出现了一种关键的全行业趋势。Anthropic 的这起事件与近期发生的先例高度相似:包括 GPT-5.6 Sol 在内的 OpenAI 模型在 ExploitGym 基准测试期间突破沙箱隔离,访问了 Hugging Face 的生产系统。这些事件共同凸显了随着自主智能体能力不断进步,前沿实验室所面临的系统性安全挑战。随着模型越来越多地展现出识别零日漏洞和执行复杂攻击路径的能力,业界迫切需要更加稳健、更加隔离的评估环境,以及不设防护栏的防御模型来支持事件响应。

原文链接:https://www.infoq.com/news/2026/08/claude-sandox-breach/