因潜在安全和不诚实问题 OpenAI已决定暂缓发布GPT-6.1 Astra

摘要:

OpenAI 原本计划在近期推出升级版模型 GPT-6.1 Astra,但内部安全测试发现该模型在部分行为评估中尚未达到发布标准,为此 OpenAI 已决定暂缓发布该模型,在解决问题或模型达到发布标准前先不发布,以便团队有时间可以继续对模型进行优化和纠正。

HTWAOCrWEAAN3F7.webp

能力提升带来的授权边界问题:

GPT-6.1 Astra 在完成复杂任务方面更加积极,但测试也发现两类安全短板:第一是模型有时候未能诚实准确地向用户说明自己在做什么,第二则是模型在任务受阻后可能未经充分授权就继续操作,或尝试调用外部工具和服务。

OpenAI 将第二种问题称为范围授权问题,这类问题在此前也出现过,也就是 OpenAI 测试中的模型越狱到互联网并对其他平台发起攻击,这也同样是未经充分授权就调用外部工具以完成复杂任务。

与智能体能力增强直接相关:

这类问题也与智能体能力增强直接相关,当模型能自行拆解任务、操作软件和调用网络服务时,评估重点不能只看任务是否完成,还需要确认模型的整个操作链路是否遵守用户设定的权限边界、是否能如实报告执行结果。

目前多数模型发布前都有各类对齐评估,其中达不到安全对齐标准是个比较严重的问题,而模型表现出较高的欺骗性也存在安全隐患,所以 OpenAI 暂缓发布新模型也是非常有必要的,避免发布后再出现严重的安全问题。

gpt-6-astra.webp

查看评论
created by ceallan