据香港《南华早报》10日 报道,尽管中国政府持续推动半导体自主化,但国内不少先进人工智能(AI)模型的训练仍在使用NVIDIA芯片,本土AI开发商短期内也难以轻易更换现有训练平台。
报道援引知情人士称,制约国产替代推进的关键因素并非单纯的硬件性能,而是软件生态门槛。长期以来,NVIDIA的CUDA一直是AI开发的主流标准;而要迁移至华为的替代平台CANN,往往需要对既有代码进行大规模重写和重新优化。
知情人士表示,目前中国AI开发商在训练大语言模型(LLM)时,仍普遍采用NVIDIA芯片。
上海一所高校下属研究机构的AI模型开发者James Wang表示,其现有训练流程高度依赖CUDA,相关代码无法直接在昇腾平台上运行,必须进行大范围改写。如果将既有工作流迁移至昇腾平台(CANN生态),时间和投入成本至少会增加50%。
报道指出,迁移成本还会因模型架构以及是否开源而进一步上升。一名参与将北京某大语言模型项目迁移至昇腾平台的工程师表示,对于DeepSeek这类开源模型及其蒸馏模型,借助现有生态支持,通常只需额外增加2至3名工程师、耗时约一个月,便可完成训练适配;但对于Moonshot AI的Kimi K3这类仅公开权重、不开放源码的模型,则可能需要约10名工程师额外投入6个月以上。
上述情况也反映出,中国AI产业的国产替代正在呈现“推理先行、训练滞后”的特点。通常而言,AI开发可分为训练和推理两个环节,其中训练流程更复杂、资源消耗更高,迁移难度也更大;相比之下,推理侧更容易完成适配。
报道提到,DeepSeek-V4和Moonshot的Kimi K3据称已经适配华为和阿里巴巴集团的平台。
不过,在训练阶段具体使用何种芯片,仍属于较为敏感的信息。DeepSeek和Moonshot均未披露其模型训练所采用的AI芯片。另据美国媒体The Information今年7月报道,Kimi K3的训练使用了包含NVIDIA Blackwell处理器在内的芯片。
与此同时,中国AI企业也并非没有基于国产芯片开展训练的尝试。美团今年6月发布参数规模达1.6万亿的LongCat-2.0时表示,尽管未披露具体供应商名称,但该模型已在由5万张国产算力卡组成的集群上完成训练和运行。
整体来看,中国AI半导体自主化的瓶颈,仍更多体现在开发生态的迁移成本上,而非芯片性能本身。国产芯片在推理侧的应用范围正持续扩大,但在最前沿模型训练领域,能否尽快突破以CUDA为核心的开发生态依赖,仍将直接影响国产替代的推进速度。