图片来源:Shutterstock

一项最新测试显示,在编程任务中,Token价格更低的AI模型,实际使用成本未必更低。业内认为,评估模型性价比时,不能只看API标价,还需同时纳入回复长度和任务成功率等因素。

据海外科技媒体Gigazine 22日报道,AI观测与评估公司Fiddler研究团队对Anthropic的Claude Haiku 4.5和Claude Sonnet 5进行了编程测试。结果显示,看似更便宜的Haiku,在获得一次成功修复结果时,实际成本反而更高。

此次测试围绕5个Python漏洞修复任务展开。研究团队将每个任务重复执行3次,合计15次测试为一组,每个模型共运行3组,即每个模型完成45次测试,两款模型合计90次。

在测试过程中,模型会发出查看文件、修改代码、运行测试等指令。实验环境设定为,每次只执行模型回复中的第一条真实指令;当模型宣布修复完成时测试结束,若未完成,则最多进行8轮回复后中止。

研究团队关注的重点并非单纯的Token价格,而是完成一次成功修复所需的总成本。团队通过模型不可见的额外测试来验证修复结果,只有通过验证才被计为成功;随后再将包括失败尝试在内的总成本除以成功次数,以此计算单次成功修复成本。

测试结果显示,两款模型的成本差异十分明显。在各45次测试中,Sonnet总成本为0.45美元,而Haiku达到4美元。按每组的单次成功修复成本计算,Haiku分别是Sonnet的8.4倍至14.1倍。

如果只看Token价格,结论则恰好相反。Haiku的输入、输出Token价格均约为Sonnet的一半。但在实际任务中,Haiku生成的Token数量明显更多,低单价优势因此被抵消。

研究团队指出,造成差异的核心原因在于回复长度。按输出Token中位数计算,Sonnet单次回复为16个,而Haiku高达361个。团队解释称,Haiku更倾向于提前生成尚未实际执行的指令结果。

换言之,Haiku不会等待真实执行反馈,而是先写出预期结果,并在此基础上继续生成后续指令和结果链条。这样一来,即便部分内容并未在真实环境中执行,也会被计入输出Token,进而抬高整体成本。

在一次测试中,这一问题表现得尤为明显:Haiku在单次回复中一口气生成了60条指令及相应的虚构执行结果,直到报告修复完成,累计消耗21492个Token。

但在该实验环境下,回复中的指令只有第一条会被实际执行,其余59条都只是文本输出,并未真正运行。即便如此,这部分内容仍会全部计入输出费用。

过长回复还会进一步推高后续交互成本。由于实验环境会在每一轮重新输入历史对话内容,某一轮的超长输出,会直接放大下一轮的输入Token规模。

研究团队给出的案例显示,到第5轮交互时,Haiku的输入Token达到9930个,而Sonnet仅为1220个。一次过长回复,便足以显著拉高后续多轮对话的输入成本。

进一步分析发现,随着回复长度拉开,Haiku的成本波动也更为明显。短回复组的单次成本为0.00235美元,甚至低于Sonnet整体平均水平的0.00244美元;但长回复组的单次成本升至0.01693美元,是短回复组的7.2倍。

这也意味着,问题并不在于Haiku的低Token价格本身,而在于当模型生成大量对实际任务并非必要的长回复时,整体成本结构会发生明显变化。

研究团队同时强调,这一结果并不意味着所有编程任务都会得出相同结论。任务类型、执行环境以及模型使用方式不同,最终结果也可能不同。但在将AI模型引入编码工作时,企业不应只比较输入、输出Token价格,而应让模型在接近真实工作的任务中实际跑一遍,同时衡量成功率与回复规模,并以包含失败尝试在内的单次成功修复成本作为比较指标。

这项实验也表明,在AI代理编程场景中,模型选型标准可能发生变化。一次不必要的长回复,不仅会增加当轮输出费用,还可能继续推高后续对话的输入成本。

研究团队认为,编程模型的价格竞争力,并不取决于每个Token花多少钱,而在于完成真实任务究竟需要付出多少成本。即便选择了低价模型,如果过度输出和低效率反复出现,整体运营成本仍可能更高,因此在实际业务场景中,成本测算的重要性将进一步凸显。

关键词

#Fiddler #Anthropic #Claude Haiku 4.5 #Claude Sonnet 5 #编程模型 #Token价格 #AI代理编程 #成本测算 #Python
版权所有 © DigitalToday。未经授权禁止转载或传播。