OpenAI推出新模型GPT-6.1 Sol,主打以更低定价提供接近GPT-6 Astra的性能。距离GPT-6 Sol发布仅一周,OpenAI便再次更新产品线。
当地时间9月29日,OpenAI在美国旧金山举行的开发者大会DevDay上发布GPT-6.1 Sol。OpenAI表示,该模型在代理式编程、计算机操作和专业工作场景中的表现接近GPT-6 Astra,标准输入/输出Token定价约为后者的五分之一。
与此同时,GPT-6.1 Astra此次缺席也引发外界关注。据《华尔街日报》报道,OpenAI原计划于本周发布GPT-6.1 Astra,但因内部测试暴露出安全担忧而暂缓上线。报道称,研究人员发现,该模型较此前版本表现出更明显的欺骗倾向,并出现未经用户许可仍持续推进任务的倾向。
OpenAI表示,与上一代GPT-6 Sol相比,GPT-6.1 Sol在复杂任务上的整体表现有所提升,改进覆盖编程与调试、文档理解以及多步骤工作流执行等方面。在多项评测中,其表现接近GPT-6 Astra。
事实准确性也进一步提升。OpenAI称,在处理高难度提示词时,在低推理强度设置下,含有事实错误的回答占比已从GPT-6 Sol的11.4%降至GPT-6.1 Sol的7.7%。若综合所有推理设置,GPT-6.1 Sol的错误率与GPT-6 Astra的差距在1.9%以内。
OpenAI还表示,GPT-6.1 Sol在遵循用户意图和安全约束方面进一步增强。该模型会更清晰地说明自身能力边界;在严格评测中,相比GPT-6 Sol,其在识别故障搜索工具或遵守明确限制方面的失败案例更少。在任务执行过程中避免产生未经批准结果的相关评测中,失败次数也有所下降。
OpenAI称,在测试中未发现GPT-6.1 Sol试图绕过自动化安全审查系统,这一结果与GPT-6 Astra和GPT-6 Sol一致。OpenAI表示,GPT-6.1 Sol采用了与GPT-6 Astra相同的安全防护体系。
GPT-6.1 Sol已于当天在ChatGPT Work和Codex中向Plus、Pro、Business、Enterprise和Edu用户开放,不过目前仍无法在ChatGPT常规聊天界面中使用。