OpenAI发布GPT-6.1 Sol。图片来源:OpenAI

OpenAI推出新模型GPT-6.1 Sol,主打以更低定价提供接近GPT-6 Astra的性能。距离GPT-6 Sol发布仅一周,OpenAI便再次更新产品线。

当地时间9月29日,OpenAI在美国旧金山举行的开发者大会DevDay上发布GPT-6.1 Sol。OpenAI表示,该模型在代理式编程、计算机操作和专业工作场景中的表现接近GPT-6 Astra,标准输入/输出Token定价约为后者的五分之一。

与此同时,GPT-6.1 Astra此次缺席也引发外界关注。据《华尔街日报》报道,OpenAI原计划于本周发布GPT-6.1 Astra,但因内部测试暴露出安全担忧而暂缓上线。报道称,研究人员发现,该模型较此前版本表现出更明显的欺骗倾向,并出现未经用户许可仍持续推进任务的倾向。

OpenAI表示,与上一代GPT-6 Sol相比,GPT-6.1 Sol在复杂任务上的整体表现有所提升,改进覆盖编程与调试、文档理解以及多步骤工作流执行等方面。在多项评测中,其表现接近GPT-6 Astra。

事实准确性也进一步提升。OpenAI称,在处理高难度提示词时,在低推理强度设置下,含有事实错误的回答占比已从GPT-6 Sol的11.4%降至GPT-6.1 Sol的7.7%。若综合所有推理设置,GPT-6.1 Sol的错误率与GPT-6 Astra的差距在1.9%以内。

OpenAI还表示,GPT-6.1 Sol在遵循用户意图和安全约束方面进一步增强。该模型会更清晰地说明自身能力边界;在严格评测中,相比GPT-6 Sol,其在识别故障搜索工具或遵守明确限制方面的失败案例更少。在任务执行过程中避免产生未经批准结果的相关评测中,失败次数也有所下降。

OpenAI称,在测试中未发现GPT-6.1 Sol试图绕过自动化安全审查系统,这一结果与GPT-6 Astra和GPT-6 Sol一致。OpenAI表示,GPT-6.1 Sol采用了与GPT-6 Astra相同的安全防护体系。

GPT-6.1 Sol已于当天在ChatGPT Work和Codex中向Plus、Pro、Business、Enterprise和Edu用户开放,不过目前仍无法在ChatGPT常规聊天界面中使用。

关键词

#OpenAI #GPT-6.1 Sol #GPT-6 Astra #DevDay #Token定价 #代理式编程 #事实准确性 #ChatGPT Work #Codex
版权所有 © DigitalToday。未经授权禁止转载或传播。