据The Information当地时间7月21日报道,援引两名知情人士说法,Google正在研发一款新的服务器芯片,并计划将Gemini的部分推理逻辑直接固化到芯片中。
报道称,这款芯片在Google内部代号为“Frozen v2”,主要目标是缓解公司当前面临的AI算力紧张。
报道指出,算力资源不足也加剧了Google内部在资源分配上的压力,甚至一度令Google Cloud无法承接部分外部客户合同。
参与该项目的Google员工预计,按单位功耗下的token处理效率计算,“Frozen v2”较现有TPU可提升6至10倍。
“Frozen”这一名称,源于将模型部分推理逻辑永久固化到硅片中的设计思路。按照计划,Google最早可能在2028年部署“Frozen v2”芯片。
报道称,Frozen项目并非为了取代TPU。TPU与Nvidia GPU类似,属于可适配多种AI模型的通用型加速芯片;但模型一旦变化,芯片在处理推理任务时往往需要增加额外步骤,从而带来时间和能耗成本。
相比之下,Frozen v2会将Gemini所需的大量推理判断预先内置于芯片之中,以减少处理环节和数据搬移。
报道认为,这类芯片有望提升AI服务响应速度,并可能为Google推出新的AI应用服务提供支撑。
不过,Frozen芯片能否持续发挥作用,前提是Google未来仍沿用当前Gemini的基础架构。只有Gemini后续继续在同一架构上演进,这款芯片才具备长期使用价值。
此外,Google目前尚未决定将在多大程度上把模型权重写入这款芯片。此前,Google曾评估过Frozen项目的早期方案,即将模型权重本身固化到芯片中,但因可能缩短芯片寿命而暂未推进。该早期方案由Google DeepMind首席科学家Jeff Dean主导。