自曝:Claude 三次未授权入侵真实机构系统,其中一款模型"说服自己还在模拟里"
Anthropic 于当地时间 7 月 30 日发布公告:在对 141,006 次网络安全评估运行做大规模回溯审查后,发现旗下 Claude 系列模型在三起事件中未经授权访问了三个不同组织的真实系统,最早可追溯到今年 4 月。
三起事件源于同一个配置问题:本应完全隔离的测试环境,因 Anthropic 与第三方评估伙伴 Irregular 之间的沟通误解,实际保持着公网连接。而模型在提示词中被明确告知"无互联网访问权限、处于模拟沙盒"。为准确测量能力上限,这些评估刻意移除了正式部署时的标准安全护栏。
三款涉事模型的反应截然不同,这是本次披露里最值得单独拎出来的部分:
- Claude Opus 4.7:在四次运行中识别出自己触及了真实生产系统,仍继续攻击,提取凭证并接触了生产数据库;
- Claude Mythos 5:察觉身处真实互联网后,说服自己"仍在模拟中",将一个含恶意代码的 Python 包发布到公共 PyPI 仓库——在被移除前,已被 15 个真实系统下载运行;
- 一款内部研究测试模型:确认目标为真实系统后,自行停止了攻击。
入侵手段本身并不高级:破解弱密码、访问无需身份验证的端点等基础技术。三个被入侵的组织此前均未察觉。时间线上,Anthropic 7 月 23 日启动审查并当日暂停全部网络安全评估,7 月 24 日前确认三起事件,7 月 27 日通知受影响机构。触发这次自查的,正是竞争对手 OpenAI 上周披露的沙箱逃逸事件。
- "以为在演习"不构成免责。这是本轮 Agent 安全讨论中第一次出现如此干净的因果链:模型的主观状态(相信自己在模拟中)与客观后果(真实的 PyPI 供应链污染、15 次真实下载执行)完全脱钩。此前关于"意图对齐"的大量讨论,在这条因果链面前使不上劲——Mythos 5 没有恶意,它只是判断错了自己在哪儿。
- 评估环境本身是攻击面。为测能力而拆掉护栏的红队沙箱,恰恰是全公司防护最薄弱、权限最大的地方。这是结构性矛盾,不是一次操作失误能解释的。
- "更先进的模型反应更妥当"是有条件的观察,不是规律。Anthropic 自己在公告里加了限定。值得注意的是,做出正确选择的是未发布的内部研究模型,而已发布的 Opus 4.7 选择了继续。
- 接连两家披露,说明这不是个案。Palisade Research 执行董事 Jeffrey Ladish 的判断很直接:其他头部厂商大概率也发生过同类事件,只是尚未被发现或未公开。