这一案例表明,新模型不仅用于生成内容,也可直接用于优化自身推理基础设施和运营效率。图片来源:OpenAI

OpenAI表示,已将最新人工智能模型GPT-5.6用于优化自身AI推理基础设施,在压低推理服务成本的同时提升整体处理效率。

据在线媒体Gigazine当地时间7月30日报道,OpenAI利用GPT-5.6改进推理引擎及GPU资源使用方式后,高性能版本GPT-5.6 Sol的端到端服务成本下降20%,Token生成效率提升15%。

这也是OpenAI于7月9日发布GPT-5.6系列时披露的运营效率优化成果之一。GPT-5.6系列包括高性能版本Sol、均衡版本Terra和低成本版本Luna。其中,OpenAI称,GPT-5.6 Sol可在约为竞品Claude Fable 5一半的成本下提供高性能表现。

此次优化的关键,在于OpenAI直接将GPT-5.6 Sol用于改进自家推理基础设施。OpenAI表示,公司借助GPT-5.6 Sol优化了AI推理引擎的核心内核,基于GPU编程语言Triton和Gluon改写并提升内核效率,从而将整体服务运营成本压低20%。

在推理加速技术“投机式解码”(Speculative Decoding)方面,OpenAI也进行了优化。该技术先由草稿模型预测下一个Token,再由大模型进行验证。OpenAI称,GPT-5.6 Sol同样被用于提升草稿模型性能,由此带动Token生成效率提高15%。

OpenAI还表示,KV缓存处理方式和GPU任务分配系统也在GPT-5.6的帮助下完成优化,使推理过程中的计算资源调度更高效,并在相同硬件条件下处理更多请求。

在智能体(Agent)运行机制方面,OpenAI也作出调整,包括仅在必要时调用MCP服务器及各类技能模块;默认将工具输出限制在最多1万个Token,只有在确有需要时才由模型发起额外请求;同时固定工具调用顺序,以提高缓存利用率。

OpenAI表示,上述改进减少了智能体执行过程中的无效计算和不稳定性,实现了推理性能与成本效率的同步提升。

OpenAI称,GPT-5.6“对推理引擎和harness(测试框架)的改进作出了重大贡献”,并表示“未来优化速度还将进一步加快”。

这一案例也被视为,AI领域的竞争焦点正从单纯比拼模型性能,延伸至利用AI优化AI基础设施的新阶段。未来,除模型能力外,能否持续降低服务运营成本、提高GPU资源利用率,或将成为衡量AI竞争力的重要标准。

关键词

#OpenAI #GPT-5.6 #Sol #服务成本 #GPU资源利用率 #Triton #Gluon #投机式解码 #KV缓存 #推理基础设施优化
版权所有 © DigitalToday。未经授权禁止转载或传播。