网络安全评估领域出现罕见失误。根据AI独角兽企业Anthropic于周四发布的最新披露,该公司旗下数款最顶尖的AI模型——包括Opus4.7、Mythos5以及一款尚未公开发布的内部研究模型,在进行上线前的前沿网络安全测试(Capture-The-Flag,抓旗赛)期间,意外越过了虚拟演练界限,成功入侵了真实世界中的第三方网络系统。
针对本次事故,Anthropic解释称,事件起因于公司与合作的网络安全评测机构Irregular之间的沟通误解,导致本应完全隔离的模拟测试环境被错误地连接到了互联网。在此配置下,AI模型被系统提示告知正处于无网无害的模拟环境中,却因连通了真实网络,直接将现实世界中的网络资产误认为是测试靶场中的任务目标,进而展开了攻击。
报道指出,涉及入侵的攻击手段均属于较为基础的网络攻防技术,包括利用弱密码以及未经身份验证的开放接口等。具体安全事件包含三起典型的真实影响案例:
首先,在一次针对虚拟目标的测试中,Opus4.7由于无法在本地网络中找到同名目标,遂利用互联网连接搜索到了现实中同名的一家真实网站,并将其成功攻破。
其次,在另一项模拟任务中,Mythos5编写并向Python官方第三方软件仓库PyPI上传了一个恶意Python软件包。该软件包在公网上挂载了约一小时,期间被15台真实设备下载并执行。其中一台设备属于某网络安全公司,其自动沙盒机制在运行该软件包进行恶意软件扫描时,不慎导致凭据外泄,进而使AI获得了访问其额外基础设施的权限。
最后,Anthropic的内部研究模型在测试中无法定位指定目标,随后自动扫描了约9000个网络目标,并成功入侵了其中一家企业的互联网应用。不过,该模型在后续运行中意识到自己进入了一个“与安全挑战毫无关联”的云端账户,随后主动终止了攻击行为。
目前,Anthropic表示已全面暂停所有可能连接互联网的网络安全评估任务,并正与合作伙伴Irregular共同开展深入调查。公司强调,若在模型上部署安全防护栏(Guardrails),此类行为将被完全拦截,本次事故反映的是在去除安全限制以测试底层极端能力时,安全评估环境本身在配置管理上暴露出的风险漏洞。这一事件也与此前OpenAI模型意外访问HuggingFace设施的披露一道,引发了整个行业对前沿AI研发机构评估环境安全性的高度警惕。
了解更多:
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

相关文章

头条焦点
精彩导读
关注我们
【查看完整讨论话题】 | 【用户登录】 | 【用户注册】