模型竞争的比较维度正从单一性能扩展至定价机制和可用性。图片来源:Reve AI

OpenAI发布GPT-5.6系列模型Sol、Terra和Luna后,市场对其与Anthropic旗舰模型Fable 5的比较迅速升温。从现有测试结果看,GPT-5.6高配版本Sol在代码能力上更占优势,而Fable 5在写作和日常对话场景中仍有明显竞争力。在双方整体性能差距不大的情况下,价格和可用性正在成为用户决策的关键因素。

据Decrypt 18日报道(以下均为当地时间),此次比较的焦点主要集中在GPT-5.6系列中的Sol与Fable 5之间的正面较量。

先看价格。Sol按每100万Token计费,输入价格为5美元,输出价格为30美元;Fable 5对应价格分别为10美元和50美元,整体约为前者的两倍。定位更低一档的Luna,输入和输出价格分别为1美元和6美元,在部分测试中其代码表现也超过了Anthropic的Opus 4.8。另据报道,Fable 5计划自19日起恢复按用量计费的Credit模式,成本压力可能进一步上升。

除价格外,Fable 5近期在访问规则上的频繁调整,也影响了其可用性表现。报道指出,美国政府今年6月表示,亚马逊研究人员通过“越狱”方式发现该模型可能被意外用于漏洞扫描后,已将其列入禁用范围。此后,Anthropic曾在全球暂停Fable 5服务19天,并在引入新的安全分类器后于7月1日恢复服务。与此同时,该模型在付费订阅方案中的停售时间也一再推迟,先后从7日延至12日、19日。Anthropic同时表示,将继续维持Claude Code周使用上限上调50%的安排。

从基准测试看,Sol在编码领域领先。在AI编程代理评测中,Sol得分80分,高于Fable 5的77.2分;同时,Sol消耗的Token约为后者的一半,处理时间也不到后者的一半。在涵盖55项专业任务的“Agents Last Exam”中,Sol得分为53.6%,明显高于Fable 5的40.5%;在TerminalBench 2.1最高性能模式下,Sol得分为91.9%,Fable 5为83.1%。不过,在汇总9项基准测试的“综合智能指数”中,Fable 5反而高出GPT-5.6 1分,显示双方整体差距并不大。

实际使用测试中,两款模型各有侧重。在以时间旅行悖论为主题的创意写作任务中,Fable 5在文化背景铺陈和因果衔接方面更自然,整体评价更高;相比之下,Sol更倾向于直接交代故事结构。在要求使用隐喻表达的提示测试中,Fable 5的象征性表达更突出,而Sol则更强调把含义解释清楚。

在逻辑题测试中,两款模型则出现了相同失误。在“四人共用一支火把过桥”的经典变体题中,二者都给出“17分钟”的答案,但正确答案应是由最慢者决定的“10分钟”。Decrypt认为,这反映出模型在解题时仍倾向于套用既有范式。

在一项要求制作浏览器端打字射击游戏的编程测试中,Fable 5的完成度更高。Sol提出了更具原创性的思路,但画面和视觉效果相对简洁;Fable 5则加入了音乐与音效、动画、每分钟打字数显示以及Power-up等元素,最终成品更为完整。

Decrypt指出,如果用户更看重编码基准表现和成本效率,GPT-5.6 Sol是更有利的选择;但在日常对话、写作和创意类任务上,Fable 5依然具备竞争力。考虑到双方性能差距有限,加之Fable 5恢复按用量计费,而GPT-5.6的Sol、Terra和Luna均纳入ChatGPT付费方案,未来用户选择模型时,价格和可用性的重要性很可能将超过单纯的性能比较。

关键词

#OpenAI #GPT-5.6 #Sol #Terra #Luna #Anthropic #Fable 5 #按Token计费 #AI编程 #可用性
版权所有 © DigitalToday。未经授权禁止转载或传播。