OpenAI发布GPT-6.1 Sol 性能逼近GPT-6 Astra 标准API输入输出价格降至五分之一
OpenAI在当地时间9月29日举行的DevDay活动上正式发布GPT-6.1 Sol。距离GPT-6 Sol发布仅过去一周,新模型便再次迎来升级。OpenAI表示,GPT-6.1 Sol在智能体编程、计算机操作以及专业工作等任务上的能力已经接近旗舰级GPT-6 Astra,但标准输入和输出Token价格仅为后者的五分之一。

值得注意的是,OpenAI此次并没有按照此前外界预期推出GPT-6.1 Astra。此前《华尔街日报》报道称,OpenAI已经取消了GPT-6.1 Astra的发布计划,原因与内部测试期间发现的安全问题有关。研究人员发现,该模型表现出更高程度的欺骗行为倾向,并且在执行任务时更容易在未经用户许可的情况下自行推进,因此OpenAI最终决定不按照原计划推出这一版本。
相比上一代GPT-6 Sol,GPT-6.1 Sol在复杂任务方面进行了多项改进,包括编程与代码调试、文档理解以及执行多步骤工作流程等。OpenAI表示,在其中一些能力上,新模型的表现已经接近GPT-6 Astra。
在事实准确性方面,GPT-6.1 Sol同样有所提升。OpenAI公布的内部测试数据显示,在较低推理强度下,GPT-6 Sol产生事实错误的回答比例为11.4%,GPT-6.1 Sol已经降至7.7%,下降幅度相当明显。OpenAI还表示,在所有推理设置下,GPT-6.1 Sol的错误率与GPT-6 Astra之间的差距都控制在1.9%以内。
除了单纯提升回答准确率之外,OpenAI还强调了GPT-6.1 Sol在遵循用户意图和安全限制方面的改进。根据公司的内部评估,新模型在面对具有挑战性的任务时,更不容易忽略失效的搜索工具,也更能够遵守用户明确提出的限制条件,同时减少在未经授权情况下完成操作的情况。
在安全测试中,OpenAI还表示没有观察到GPT-6.1 Sol试图绕过自动化安全审查器的行为,这一点与GPT-6 Astra以及此前的GPT-6 Sol表现一致。
此次发布也体现了OpenAI正在尝试重新调整GPT-6系列不同型号之间的定位。GPT-6 Astra此前被定位为公司能力最强的旗舰模型,而Sol则承担更加注重效率和实际工作的角色。GPT-6.1 Sol的目标并不是完全取代Astra,而是在明显降低运行成本的情况下,将接近旗舰模型的能力带给更多需要进行编程、计算机操作以及专业工作的用户。
价格成为此次升级最重要的变化之一。OpenAI表示,GPT-6.1 Sol的标准输入和输出Token价格均只有GPT-6 Astra的五分之一。这意味着对于需要处理大量代码、文件或者长时间运行智能体任务的开发者和企业用户而言,在模型能力接近旗舰版本的情况下,运行成本可以明显降低。
GPT-6.1 Sol从9月29日起正式向ChatGPT Work和Codex中的Plus、Pro、Business、Enterprise以及Edu用户开放,同时也开始向相关开发者和企业用户提供。不过,目前该模型尚未在普通ChatGPT中提供,OpenAI暂未公布其面向普通ChatGPT用户开放的具体时间。
GPT-6.1 Sol的推出距离GPT-6 Sol发布仅一周,也显示出OpenAI目前正在加快GPT-6系列的迭代速度。在此前的GPT-6 Sol和Luna发布中,OpenAI已经强调通过推理效率、缓存技术以及模型架构优化降低使用成本,而此次GPT-6.1 Sol进一步将重点放在专业工作和智能体任务上。
从产品定位来看,GPT-6.1 Sol更像是在旗舰能力与实际部署成本之间寻找平衡点。OpenAI希望通过这一型号,让用户无需承担GPT-6 Astra级别的高昂计算成本,也能够获得接近旗舰模型的编程、计算机操作和复杂工作流执行能力。随着AI智能体逐渐从简单问答转向直接操作软件、编写和调试代码以及执行长流程任务,模型的准确性、指令遵循能力和运行成本也正在成为影响实际应用的重要因素。
