开源权重AI模型正在迅速追赶美国科技巨头的顶级闭源模型,企业部署AI的思路也随之发生变化。越来越多公司开始将日常、重复性任务交给成本更低的开源模型,只在高难度任务上使用价格更高的闭源模型。
据IT媒体Ars Technica当地时间15日报道,Mozilla在最新报告中指出,开源权重模型与顶级闭源模型之间的性能差距,已缩短至约4.4个月。
报告强调,核心不只是绝对性能,更是成本效益。Moonshot AI的开源权重模型Kimi K3在综合性能指标上仅落后于Anthropic旗下顶级闭源模型Fable 5 3分,但成本仅为后者的约30%。
Mozilla首席技术官Rafi Krikorian表示,闭源模型优势更明显的领域主要集中在专家级任务、高强度搜索以及长上下文处理。他认为,企业没有必要在所有任务上都使用昂贵的闭源模型,而应根据任务需求和成本,选择更合适的模型。
Mozilla还以“人类专家完成同类任务所需时间”作为参照,对两类模型的差距进行了说明。按照这一口径,目前最强闭源模型可稳定处理的任务时长,约为最强开源模型的1.7倍。换言之,如果开源模型能够完成需要7小时的任务,那么闭源模型可进一步覆盖约12小时的任务。
不过,这一差距仍在快速缩小。Mozilla预计,再过约4个月,开源模型有望达到当前闭源模型所能完成的任务水平。
从企业应用角度看,真正必须依赖闭源模型的区间,可能比市场想象得更窄。以人类专家的任务时长为基准,8小时以内的任务基本都在两类模型的能力范围内,企业因此有更大空间选择价格更低的开源模型;而在约8至12小时的高难度任务中,闭源模型的性能优势才更有可能支撑其额外成本。
企业端的落地案例已经出现。外卖平台DoorDash将重复性任务交给Kimi K3处理,把更复杂的任务交由Fable完成,采用分工使用的方式。在开源模型性能尚未完全追平之前,公司仅在必须尽快产出结果的任务上使用闭源模型。
其他评测也得出了类似结论。在Vals AI的Terminal-Bench 2.1测试中,Z.ai的开源权重模型GLM 5.2与Anthropic的Claude Opus 4.7和4.8仅相差1分,而单项任务成本约为闭源模型的五分之一。
模型使用结构也在发生变化。根据OpenRouter发布的2026年8月token使用量数据,使用量排名前10的模型中,有8个为开源权重模型。不过从营收结构来看,市场仍由闭源模型主导。Linux Foundation一篇论文显示,2025年5月至9月期间,开源模型营收占比仅为4%,闭源模型则高达96%。
Mozilla同时指出,开源模型生态仍存在地区集中问题。由于当前主流开源模型中,相当一部分具有中国背景,美国和欧洲研究机构也有必要加大对开源模型研发的投入。报告提出的可选路径包括提供公共算力支持,以及由中立基金会、企业和慈善资金共同参与的资助模式。
整体来看,企业选择AI模型的逻辑正从“追逐单一最强模型”转向“按任务分工”。在日常业务中,成本效益更高的开源模型正成为优先选项;而在对性能要求更高的复杂任务中,闭源模型仍保有优势。随着开源模型持续缩小差距,企业为闭源模型支付的性能溢价也可能进一步下降。