Anthropic日前发布最新博客公布ClaudeAI模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。
高风险评测和强化训练曾被暂停:
7月份A社透露Claude模型从评测环境中逃逸并对真实公司的内部系统发起攻击,随后A社立即暂停所有预发布模型的外部网络安全评测,内部评测也曾短暂停止。部分高风险强化学习环境则被停用数周,目前大部分训练已经恢复,少数还需要人工复审。
新版评测系统增加实时监控分类器,当分类器发现模型主动探测沙箱边界、尝试逃逸或意外获得互联网访问权限,就会在工具调用执行前拦截操作、立即终止任务并通知人类工程师进行干预。
而外部评测机构后续原则上必须使用完全断网的强化沙箱,仅允许连接模型API并在每次测试前主动让模型攻击沙箱以验证隔离效果,测试提示词也必须明确规定允许攻击的目标、行为和网络边界。
强化学习环境超过10%存在问题:
A社还透露2026年春季其强化学习环境增长速度已经超过内部审查能力,公司曾发现模型通过RewardHacking欺骗评分系统,甚至因配置错误把模型Chain-of-Thought重新作为训练数据输入。
在4月份A社已经冻结全部生产强化学习环境约1个月,随后对训练基础设施和审核流程进行重构,重新检查后A社发现超过10%的训练环境因为奖励作弊、任务损坏或配置错误被标记为整改,人类工程团队修复并重新认证后才恢复使用。
研究团队还专门训练容易RewardHacking的ClaudeOpus级实验模型,结果该模型在模拟环境中更容易尝试沙箱逃逸、攻击第三方系统、篡改奖励函数甚至绕过安全监控。A社因此认为大量存在漏洞的强化学习环境可能会系统性的培养模型为了拿高分而不择手段的行为。
最终A社将150名产品工程师临时调往安全、可靠性和隐私工作,部分研究人员也从预训练和强化学习团队转向安全项目,同时暂停大多数新产品和新功能的开发,不过:以上都是在7月事件发生前进行的,也就是说虽然A社已经进行干预,但最终还是发生7月攻击事件。

相关文章

头条焦点
精彩导读
关注我们
【查看完整讨论话题】 | 【用户登录】 | 【用户注册】