Embodied Intelligence Observer

OpenAI 之后又是 Anthropic,Claude 将攻击延伸至公共互联网

Industry

Source: InfoQ 中文Publish time unverified

在 OpenAI 披露其模型在 ExploitGym" 基准测试期间逃逸沙箱"之后,Anthropic 开展了一项回溯审计,覆盖 141006 次评估运行。调查评估了多项进攻性基准测试的历史测试,包括 Cybench"、CyberGym" 和 ExploitBench",重点检查了在第三方评估合作伙伴 Irregular 提供的环境中执行的运行。审计发现了三起不同事件",涉及六次评估运行。在这些运行中,由于出口路由配置错误,以及模型在夺旗演练期间攻陷了现实世界中的目标,Claude 模型得以访问公共互联网。 这些事件涉及 Claude Opus 4.7、Mythos 5 和一个尚未发布的内部研究原型。在所有运行中,模型都在专用的隔离测试环境中运行,与 Anthropic 的内部网络和客户数据分离。模型保留了基础的模型级安全训练,但没有配备生产级拒绝分类器和实时滥用监控。系统提示明确告知模型,它们运行在无法访问互联网的离线模拟环境中;然而,网络容器配置错误使出站互联网路径仍然处于活动状态。由于错误地假定所有可访问的 IP 地址都位于评估范围内,模型采用了基本的攻击技术,而没有利用零日漏洞…

OpenAI 之后又是 Anthropic,Claude 将攻击延伸至公共互联网 | Embodied Intelligence Observer