DeepSeek资料图。图片来源:Shutterstock

中国AI公司DeepSeek已将主力模型更新为V4 Pro 0813正式版。由于此前公开的性能评测大多基于预览版,0813正式版上线后,模型实际表现仍需等待外部测试进一步验证。

据区块链媒体Decrypt当地时间12日报道,DeepSeek并未就此次更新单独发布公告或博文,而是直接在API价格页面将模型名称调整为“DeepSeek-V4-Pro-0813”。

V4 Pro自今年4月以来一直以预览版形式提供。此次切换至正式版后,API价格未作调整:每100万token输入收费0.435美元,每100万token输出收费0.87美元,缓存输入价格为每100万token 0.003625美元。

此次更新的重点不在价格,而在于模型权重已完成切换。DeepSeek在7月31日正式发布V4-Flash时曾表示,V4 Pro API“仍未变化”,并预告正式版将很快跟进。

不过,Hugging Face上的模型卡片目前仍将V4系列标注为预览版。因此,0813正式版与此前版本之间究竟存在多大差异,仍需通过外部测试确认。

从DeepSeek公布的基准结果看,其与美国头部AI模型之间的性能差距已相对有限。DeepSeek披露了10项Agent基准测试结果,其中在双方均公布成绩的9项指标中,Anthropic的“Claude Fable 5”平均领先5.3%。

与此同时,DeepSeek在其中2项测试中取得领先。若剔除差距较大的个别项目,其余项目的平均差距可收窄至约2.8%。

相比性能差距,价格优势更加明显。Claude Fable 5的API定价为:每100万token输入10美元、每100万token输出50美元;按输入与输出混合费率测算约为30美元。相比之下,V4 Pro的混合费率约为0.65美元,价格约为前者的1/46。

若按实际任务单位计算,双方成本差距还可能进一步拉大,因为Claude Fable 5往往需要更长的推理时间,并生成更多输出内容。

Artificial Analysis统计的单个基准任务成本显示,V4-Flash约为0.03美元,Claude Fable 5约为3.15美元。Hugging Face CEO Clement Delangue也曾提到,单任务成本差距可能扩大至约31美元对0.04美元。不过,基于V4 Pro 0813正式版的单任务成本数据目前尚未披露。

需要注意的是,上述基准结果本身也存在一定局限。此次对比成绩由DeepSeek自行测得,且尚未公开具体测试基础设施。DeepSeek在7月的公告中表示,将很快公开其自测环境“DeepSeek Harness minimal mode”。

此外,10项基准测试中的DSBench-FullStack和DSBench-Hard属于内部测试集,缺乏外部排行榜作为参照。因此,仅凭当前已公开结果,仍难以据此确认V4 Pro的实际性能优势。

即便如此,0813正式版的推出,仍可能进一步凸显中国开源模型在价格端的竞争力。随着中国AI研究机构与美国头部模型之间的性能差距缩小至个位数区间,同时报价显著更低,AI模型市场的定价结构也可能随之发生变化。

DeepSeek已根据MIT许可证在Hugging Face公开模型权重,后续外部开发者和研究人员有望开展更直接的验证,从而更清晰地判断V4 Pro 0813正式版的真实表现,以及其与预览版之间的差异。

Anthropic内部产品之间的竞争同样是一个变量。据称,“Claude Opus 5”在多项基准测试中优于Claude Fable 5,同时定价约为后者的一半。

整体来看,围绕V4 Pro 0813的竞争已不只是单纯的跑分比拼。高价旗舰模型与低价开源模型正在性能与成本效率两个维度正面竞争,企业与开发者的选型标准也可能从追求“最高性能”转向更看重“性价比”。

关键词

#DeepSeek #V4 Pro 0813 #API定价 #AI大模型 #Claude Fable 5 #Hugging Face #基准测试 #模型权重 #MIT许可证
版权所有 © DigitalToday。未经授权禁止转载或传播。