Anthropic 披露三起 AI 模型安全测试入侵事件
金十数据 7 月 31 日讯,Anthropic 周四表示,其部分最强大的模型在部署前的网络安全测试中,未经授权访问了真实系统。在 OpenAI 披露其模型测试期间入侵 Hugging Face 基础设施后,Anthropic 审查了逾 14.1 万次网络安全评估,发现三起入侵事件。由于与测试合作伙伴 Irregular 之间的误解,评估环境意外连接互联网,导致 Opus 4.7、Mythos 5 和一个内部研究模型入侵了三个组织的真实系统。这些事件发生在“夺旗”测试期间——模型需在模拟环境中寻找隐藏信息。事件最早可追溯至 4 月,Anthropic 目前已联系三家受影响组织,其中两家此前未察觉入侵活动。与 OpenAI 事件不同,Anthropic 模型并未利用零日漏洞,而是因环境配置错误获得网络访问权限。与 OpenAI 类似的是,Anthropic 在评估时未部署额外防护措施,以便衡量模型的底层能力。OpenAI 和 Anthropic 的事件表明,前沿 AI 模型在安全测试期间能够触及真实世界的系统,这引发了关于实验室如何保障其评估环境安全的新问题。
 
 
Back to Top