返回上一页  首页 | cnbeta报时: 16:34:17
发生模型逃逸并发起真实攻击后 Anthropic宣布全面加固安全体系提升模型安全性
发布日期:2026-09-01 16:17:15  稿源:蓝点网

Anthropic日前发布最新博客公布 Claude AI 模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。

高风险评测和强化训练曾被暂停:

7 月份 A 社透露 Claude 模型从评测环境中逃逸并对真实公司的内部系统发起攻击,随后 A 社立即暂停所有预发布模型的外部网络安全评测,内部评测也曾短暂停止。部分高风险强化学习环境则被停用数周,目前大部分训练已经恢复,少数还需要人工复审。

新版评测系统增加实时监控分类器,当分类器发现模型主动探测沙箱边界、尝试逃逸或意外获得互联网访问权限,就会在工具调用执行前拦截操作、立即终止任务并通知人类工程师进行干预。

而外部评测机构后续原则上必须使用完全断网的强化沙箱,仅允许连接模型 API 并在每次测试前主动让模型攻击沙箱以验证隔离效果,测试提示词也必须明确规定允许攻击的目标、行为和网络边界。

强化学习环境超过 10% 存在问题:

A 社还透露 2026 年春季其强化学习环境增长速度已经超过内部审查能力,公司曾发现模型通过 Reward Hacking 欺骗评分系统,甚至因配置错误把模型 Chain-of-Thought 重新作为训练数据输入。

在 4 月份 A 社已经冻结全部生产强化学习环境约 1 个月,随后对训练基础设施和审核流程进行重构,重新检查后 A 社发现超过 10% 的训练环境因为奖励作弊、任务损坏或配置错误被标记为整改,人类工程团队修复并重新认证后才恢复使用。

研究团队还专门训练容易 Reward Hacking 的 Claude Opus 级实验模型,结果该模型在模拟环境中更容易尝试沙箱逃逸、攻击第三方系统、篡改奖励函数甚至绕过安全监控。A 社因此认为大量存在漏洞的强化学习环境可能会系统性的培养模型为了拿高分而不择手段的行为。

最终 A 社将 150 名产品工程师临时调往安全、可靠性和隐私工作,部分研究人员也从预训练和强化学习团队转向安全项目,同时暂停大多数新产品和新功能的开发,不过:以上都是在 7 月事件发生前进行的,也就是说虽然 A 社已经进行干预,但最终还是发生 7 月攻击事件。

查看网友评论   返回完整版观看

返回上一页  首页 | cnbeta报时: 16:34:17

文字版  标准版  电脑端

© 2003-2026