日本媒体Gigazine于10月1日(当地时间)报道,开源基准测试工具livenerf已推出,可用于长期追踪AI模型发布后的性能是否随时间发生变化。
livenerf的核心问题在于:即便是同一名称的AI模型,上线后若推理配置、路由策略等发生调整,其性能和输出特征也可能随之改变。此前,围绕GPT-4的研究就曾指出,同一模型在不同时期的版本,在数学、编程等部分评测项目上的结果存在明显差异。
近期,Anthropic也出现了已被确认的质量波动情况。Anthropic表示,在调查4月出现在Claude Code、Claude Agent SDK和Claude Co-Work中的质量问题后,公司确认,3月4日对推理强度的调整以及额外的软件问题等因素,对输出质量造成了影响;不过,API和默认推理系统本身并未受到影响。
livenerf希望通过可重复的测量数据,而非用户的主观感受,来识别这类变化。该工具由北卡罗来纳大学格林斯伯勒分校的学生Nathan Langley开发,基于英国AI安全研究所的开源评估框架Inspect构建。
目前,livenerf的测量对象为上月22日发布的Claude Opus 5.5。该工具首先对2336道题进行了重复测试,剔除始终答对或始终答错的题目后,筛选出78道结果会发生变化的题目作为追踪样本。随后,它以前10天的平均值作为基线,再与之后两个10天时间窗口的数据进行比较。
不过需要注意的是,这项实验测量的是通过Claude Code提供的订阅版Opus 5.5,因此并不能代表全部API模型的整体表现。livenerf开发者也表示,仅凭现有数据,还无法判断是否已经出现性能下滑;这项实验的重点,在于区分模型的真实变化与用户预期变化带来的主观感受偏差。