有分析指出,中国AI模型正迅速缩小与西方头部模型的性能差距,同时将推理成本压低至最低1/100,这一变化正在重塑AI市场的竞争逻辑。行业关注点也正从“谁的模型最强”,转向“谁能以更低成本、大规模提供高性能AI能力”。
TechRadar当地时间7月28日报道称,未来胜出的未必还是单一性能最强的模型,而更可能是那些能够以低成本大规模部署高性能AI,并围绕其构建生态体系的企业。该分析比较了15家AI厂商推出的33款模型,评估维度包括推理表现、运营成本和部署方式等。
在衡量科学推理能力的GPQA Diamond基准测试中,美国厂商仍然领先。Anthropic的Claude Mythos 5以94.4%位居第一,Google Gemini 3.1 Pro为94.3%,Claude Fable 5为94.0%。
不过,中国模型的追赶速度同样明显。Alibaba Qwen 3.7 Max得分为92.4%,GLM-5.2为91.2%,DeepSeek V4 Pro为90.1%,整体上已逼近头部模型水平。
TechRadar认为,当前差距更多体现在成本,而非绝对性能。更低的推理成本意义并不只是“以更便宜的价格完成同样任务”,还会直接改变企业使用AI的范围和方式。
在相同预算下,企业可以处理更多请求,AI的应用也不再局限于少数核心业务,而是能够扩展至客户支持、内容生成、企业内部流程自动化等更多场景。这也让初创公司和中型企业得以用相对较低的成本部署高性能AI能力。
从市场需求看,AI应用正出现分化。以客户咨询、文档撰写、内容生成等为代表的大众应用市场,相比基准测试分数,价格竞争力正在成为更关键的决策因素。
数据显示,过去一年,AI平台OpenRouter上的美国模型流量占比已从约74%降至约20%,中国模型占比则升至接近一半。若按Token使用量计算,中国模型已占据优势。
但在编程、AI Agent等需要复杂推理能力的高难度场景中,头部高性能模型的价值仍然更高。
原因在于,多步骤连续任务中,即便只是细微的性能差异,也可能对最终结果造成显著影响。因此,企业AI预算仍持续向头部模型集中。TechRadar称,受编程和AI Agent需求带动,Anthropic在企业API支出中的占比约为40%。
中国厂商的开放策略也被视为其加速扩散的重要原因。GLM-5.2、DeepSeek V4 Pro、Qwen 3.5 397B等模型均以开放权重方式提供,企业可直接在自有服务器上运行,从而掌握数据控制权,并降低对特定AI厂商定价或服务调整的依赖。
TechRadar认为,中国AI企业并不只是西方模型的低价替代者,而是正基于低成本、开放性和运营控制权,提出一套新的AI部署模式。
围绕监管的争议也在持续。近期,Microsoft CEO Satya Nadella与NVIDIA CEO Jensen Huang等人在公开信中表示,若对开放式AI模型实施过度监管,可能削弱美国竞争力。他们强调,扩大开放型AI模型的使用,有助于降低技术成本,并推动整个行业创新。
不过,中国AI模型的扩散也面临政治层面的限制。TechRadar指出,尽管中国模型在技术形态上更为开放,但在天安门事件、台湾问题、涉新疆维吾尔议题、香港示威以及与Xi Jinping相关的问题上,可能会限制回答,或呈现中国政府立场。
AI安全企业Enkrypt AI对DeepSeek R1的分析也显示,在涉及中国相关敏感议题时,约91%的回答呈现亲中国倾向。这意味着,即便企业将模型部署在自有服务器上,相关政治倾向也未必能够被完全消除。
TechRadar总结称,西方AI企业在顶级性能方面仍具优势,但在各细分市场维持高价商业模式将变得越来越困难。对于大众市场而言,“性能足够好”加上低成本正变得比单纯追求最高分更重要。未来AI竞争的胜负,或将取决于谁能构建更低成本、可扩展的AI生态,而不只是基准测试成绩的高低。