研究显示,低价AI模型并不一定更省钱。图片来源:Reve AI

一项最新研究显示,低价人工智能(AI)模型并不必然意味着更低的使用成本。在不少复杂任务中,表面单价更低的模型,实际总支出反而可能高于高价模型。

据外媒Gigazine当地时间6日报道,斯坦福大学、卡内基梅隆大学、加州大学伯克利分校和Microsoft Research联合研究团队,对8款前沿AI模型进行了6800余项任务测试。结果显示,在32%的测试任务中,低价模型的总成本反而高于高价模型。

该研究覆盖数学、编程、科学等多类任务,重点比较不同模型在真实任务中的成本结构。研究团队指出,仅凭token单价或单次调用费用,难以判断AI的实际使用成本,因为完成同一任务所需的推理过程和执行步骤可能存在明显差异。

研究举出的典型案例之一,是对YouTube视频进行逐帧分析。高价模型Gemini 3.1 Pro用85个步骤完成任务,而低价模型Gemini 3 Flash在经历1000多个步骤后仍未完成。成本对比显示,Gemini 3.1 Pro完成该任务的成本为1美元(约1300韩元),Gemini 3 Flash则达到14美元(约1.88万韩元)。

研究团队认为,这类“低价更贵”的现象,主要与模型在复杂任务中的过度推理和执行步骤过多有关。任务越复杂,推理链条和执行过程越容易被拉长,而性能更强的模型往往能以更少步骤、更低总成本完成任务。测试中还出现过这样的情况:Gemini 3 Flash消耗了6万余个推理token,而性能更高的GPT-5.4仅用25个token就解决了问题。

研究同时指出,AI成本并不容易准确预测。即便对同一模型输入完全相同的指令,不同轮次运行的支出也可能相差很大。研究团队在测试中发现,最贵的一次运行成本可达到最便宜一次的9.7倍。

这也意味着,企业在制定AI导入和选型策略时,不能只比较模型标价。对于简单任务,低价模型可能更具成本优势;但在复杂业务场景下,实际总成本未必更低。参与研究的Lin Zhao Chen表示,“不能只看价格就判断哪个模型更便宜”。

研究进一步显示,AI服务价目表并不能直接反映真实运营成本,尤其是在涉及多阶段推理和工具调用的任务中,模型性能差异会直接影响最终支出。研究团队建议,企业在付费部署AI时,除关注输入价格外,还应同时评估任务完成率、执行步骤数量以及重复运行时的成本波动。

关键词

#AI模型 #总成本 #推理token #执行步骤 #Gemini 3.1 Pro #Gemini 3 Flash #GPT-5.4 #企业AI选型 #Microsoft Research #成本波动
版权所有 © DigitalToday。未经授权禁止转载或传播。