Dong-hyuk Kim,HS Hyosung Information System SA团队负责人。图片来源:HS Hyosung Information System SA

随着企业AI从实验阶段走向生产环境,基础设施投入的重心也在发生变化。过去,企业更多将预算投向模型训练;如今,越来越多的资金开始流向模型推理。对数据中心而言,这意味着新的压力来源正在形成——推理负载规模更大、运行时间更长,且往往需要全天候稳定支撑。

这已不再只是趋势判断,而是企业AI落地过程中的现实变化。真正的挑战并不在于推理是否比训练更复杂,而在于具备生产环境推理运营经验的基础设施团队仍然有限。当企业开始补齐相关能力时,行业门槛本身也可能已经进一步抬高。

从短期训练转向长期推理

Deloitte的数据显示,2025年推理在整体AI算力中的占比已接近一半,而这一比例在2023年还仅约为三分之一。多项研究也得出了相近结论:在生产级AI系统中,80%至90%的总体运营成本来自推理环节。其核心原因并非单次请求成本过高,而是推理需要长期、持续运行,进而形成结构性支出。

模型一旦上线,推理就不再是阶段性任务。训练通常带来的是短期峰值负载,推理则会持续抬升数据中心的基础负载。每增加一个嵌入AI能力的新功能,或新增一项基于AI的工作流自动化服务,基础设施所需承载的常态化负载就会随之上升,而且往往难以回落。这意味着,企业不仅要重估成本结构,也需要相应调整基础设施策略。

推理为何重新推高本地部署价值

在企业AI发展的早期阶段,云是最主要的承载平台,这对于实验和验证而言是合理选择。但当推理进入生产阶段后,成本、时延与治理因素开始同时显现。要降低时延,算力必须更靠近数据;而随着业务规模扩大,相关成本也会更快累积。与此同时,数据量越大、监管要求越严格,企业越倾向于让数据留在原地、让计算靠近数据,“数据重力(Data Gravity)”效应因此再次凸显。

云在模型训练、实验验证以及短时弹性流量处理方面仍具优势,但在生产推理场景中,混合架构已不再只是过渡方案,而正逐步成为企业从一开始就需要规划的目标架构。越来越多的领先企业不再简单地在云与本地之间做单选,而是依据数据所在位置、时延要求、治理条件和成本结构来配置工作负载,而最终结果也越来越倾向于本地部署。

瓶颈不只在算力,更在数据

当AI真正进入运营阶段,瓶颈往往不在GPU或算力本身,而在于数据能否被高效、合规地调用。推理负载通常呈现“多读少写”的特征,对时延更加敏感,同时又依赖最新数据。模型运行所需的并不是静态历史快照,而是实时更新的“活数据”。而这些数据大多仍存放在本地系统和生产数据库中,且这些系统在设计之初并不是为AI数据管道而构建。

因此,现实中的主要矛盾往往不在模型集群,而在“数据所在位置”与“模型所需数据位置”之间的错配。如果通过独立数据管道复制数据,不仅会增加时延,也会放大治理风险。对于强监管行业而言,数据每一次迁移都可能带来新的合规问题。相比之下,更可行的路径是在数据原始位置附近部署算力,让计算直接就近访问数据。随着推理逐步常态化,并进一步向以代理为中心的形态演进,模型所依赖的数据也将从固定数据集转向可按策略反复访问的生产运营数据。

针对上述问题,Hitachi Vantara从架构设计层面给出了解决思路。其VSP(Virtual Storage Platform)360被定位为面向企业数据基础设施的AI控制平面,用于统一协调存储与数据保护平台服务的配置和运营,以满足生产推理场景下对一致性、性能和可用性的日常要求。

在此基础上,Hitachi IQ Studio进一步提供面向推理负载的AI数据管理与编排能力。该平台无需复制或额外暂存数据,即可通过基于策略的访问方式直接连接企业数据,并围绕模型所使用的数据提供治理、数据血缘、质量管理和可观测性能力。

与此同时,推理也在重塑企业的成本结构。一旦推理融入业务运营,其资源消耗就更接近难以压缩的“公用事业型”支出。这也意味着,基础设施运营团队需要从一次性项目思维,转向持续优化重复性成本的消费型运营模式。

数据中心迈向下一阶段

从当前推动这一转向的企业实践来看,一条共通路径正在浮现:数据中心规划正从围绕峰值需求转向管理基础负载,从以资产持有为中心转向服务消费模式,从一次性交付项目转向必须每天稳定运行的常态化运营平台。

快速训练模型的竞争阶段已基本过去。下一阶段,企业竞争力将更多取决于能否在具备治理能力、可访问且更接近算力的数据基础之上,稳定支撑推理运行。对于数据中心和企业基础设施团队而言,真正的考验才刚刚开始。

关键词

#AI推理 #AI基础设施 #数据中心 #混合架构 #本地部署 #数据重力 #低时延 #数据治理 #Hitachi Vantara #VSP 360
版权所有 © DigitalToday。未经授权禁止转载或传播。