Google与OpenAI正围绕“超高速”AI展开新一轮竞速。随着AI代理应用不断扩展,行业竞争焦点也在从单纯比拼模型能力,进一步转向响应速度和实际交付效率。
据Decrypt当地时间13日报道,Google正式发布面向代码生成与AI代理任务的低成本模型Gemini 3.7 Flash;同一天,OpenAI也推出GPT-5.6 Sol Ultrafast,为现有GPT-5.6 Sol新增超高速服务档位。
从开放节奏来看,两者路径明显不同。Gemini 3.7 Flash已在160多个国家和地区上线,可立即使用;GPT-5.6 Sol Ultrafast目前仅向部分API客户限量开放。
Google将Gemini 3.7 Flash定位为软件工程、Web开发和复杂知识任务的主力模型,并瞄准AI代理场景。该模型可支持多步骤任务规划与执行,能够调用工具并进行计算机控制。
在能力配置上,Gemini 3.7 Flash最高支持100万输入token和6.4万输出token,除文本外,还可处理图片、视频、音频和PDF等多模态内容。
速度是此次升级的重点之一。Google表示,在编程任务测试中,Gemini 3.7 Flash完成任务用时为2分13秒,相比上一代Flash模型超过5分钟明显缩短。
定价方面,Google也采取了更具进攻性的策略。到今年年底前,Gemini 3.7 Flash按每100万输入token 0.75美元、每100万输出token 3.75美元计费,约为Gemini 3.6 Flash初始价格的一半。自明年起,上述价格将分别上调至1.50美元和7.50美元。
Google还表示,在其自有基准测试中,Gemini 3.7 Flash在18项评估中有11项领先Claude Sonnet 5和GPT-5.6 Terra等模型;在Code Arena中的得分为1588 Elo,在AutomationBench中的成绩为30.4%。不过,这些数据来自Google自身评测体系,参考时仍需结合这一前提。
相比之下,OpenAI此次并未推出全新模型,而是为GPT-5.6 Sol增加了超高速服务档位GPT-5.6 Sol Ultrafast。OpenAI称,依托Cerebras芯片,该服务的响应速度最高可达到标准模式的14倍。
在输出速度方面,GPT-5.6 Sol Ultrafast最高可达每秒750个token,更适用于实时语音代理等需要边交互边即时生成答案的场景。
业内人士认为,更高的处理速度可能改变AI模型的使用方式。Jane Street的AI工程师John Crepezzi表示,Cerebras的处理速度有望带来使用习惯上的变化;Podium产品负责人Cortland Likins也指出,在语音服务场景中,更快的响应可能显著改善通话体验。
不过,在可用范围上,OpenAI目前仍落后于Google。GPT-5.6 Sol Ultrafast暂时仅通过OpenAI API向部分客户开放,后续将随着处理能力提升逐步扩大企业覆盖范围。
从两家公司的最新动作不难看出,随着AI代理持续普及,响应速度正在成为新的核心竞争指标。AI代理在接收用户请求后,通常需要完成任务拆解、工具调用和结果生成等多个环节,除了模型推理能力之外,各环节等待时间的长短也会直接影响最终体验。尤其在语音类AI场景中,响应一旦变慢,“对话感”就会明显下降。
从策略上看,Google更强调低成本和大范围开放,希望让开发者和企业客户能够尽快上手;OpenAI则借助Cerebras的算力基础设施,把高端模型的处理速度进一步推向极限。
这也意味着,本轮竞争的关注点已不再只是“谁更聪明”,而是“谁能以更快、更低成本的方式完成真实任务”。
接下来,双方后续动作仍值得关注。Google的主力高性能模型Gemini 3.5 Pro尚未公布发布时间;OpenAI则在不依赖自有基础设施的情况下,借助Cerebras的速度优势快速回应市场需求。随着超高速响应成为AI代理的重要竞争力,未来行业比拼或将进一步围绕模型能力、服务速度和供给方式展开。