Nhiều công ty AI Trung Quốc vẫn tiếp tục huấn luyện các mô hình tiên tiến trên chip Nvidia, cho thấy trở ngại lớn nhất trong nỗ lực tự chủ bán dẫn không nằm ở hiệu năng phần cứng, mà ở chi phí chuyển đổi hệ sinh thái phần mềm, đặc biệt là sự phụ thuộc vào CUDA.
South China Morning Post (SCMP) ngày 10/8 đưa tin, dù chính phủ Trung Quốc đẩy mạnh chiến lược tự chủ bán dẫn, các doanh nghiệp AI trong nước vẫn gặp nhiều khó khăn khi chuyển hạ tầng huấn luyện sang chip nội địa vì chi phí cao và yêu cầu kỹ thuật phức tạp.
Theo SCMP, rào cản lớn nhất nằm ở phần mềm. CUDA của Nvidia đã trở thành tiêu chuẩn trong phát triển AI suốt nhiều năm, trong khi việc chuyển sang CANN, nền tảng của Huawei, đòi hỏi phải viết lại và tối ưu hóa lượng lớn mã nguồn. Một nguồn tin am hiểu ngành này cho biết, trong phần lớn công ty AI Trung Quốc, chip Nvidia vẫn là lựa chọn phổ biến để huấn luyện mô hình ngôn ngữ lớn (LLM).
James Wang, nhà phát triển mô hình AI tại một viện nghiên cứu thuộc một trường đại học ở Thượng Hải, cho biết toàn bộ pipeline huấn luyện hiện phụ thuộc vào CUDA. Theo ông, mã viết cho CUDA không thể chạy trực tiếp trên Ascend, nên phải chỉnh sửa trên diện rộng. Việc chuyển quy trình huấn luyện sang chip Huawei Ascend có thể làm tăng ít nhất 50% thời gian và chi phí.
Chi phí chuyển đổi cũng khác nhau tùy theo kiến trúc và mức độ mở của mô hình. Một kỹ sư tham gia chuyển LLM sang Ascend tại Bắc Kinh cho biết, với các mô hình mã nguồn mở như DeepSeek và các mô hình chưng cất, doanh nghiệp có thể tận dụng phần nào hệ sinh thái sẵn có. Trong trường hợp này, chỉ cần bổ sung 2-3 kỹ sư trong khoảng một tháng, so với hệ thống dựa trên Nvidia, là có thể hoàn tất huấn luyện.
Ngược lại, với các mô hình chỉ công bố trọng số mà không công khai mã nguồn, như Kimi K3 của Moonshot AI, khối lượng công việc tăng lên đáng kể. Nguồn tin trên cho biết các dự án dạng này có thể cần khoảng 10 kỹ sư và hơn 6 tháng xử lý.
Xu hướng trên cho thấy quá trình nội địa hóa trong ngành AI Trung Quốc đang diễn ra nhanh hơn ở mảng suy luận so với huấn luyện. SCMP nhận định quy trình AI gồm hai khâu chính là huấn luyện và suy luận; trong đó huấn luyện phức tạp và tiêu tốn tài nguyên hơn nhiều, còn suy luận tương đối dễ chuyển đổi nền tảng. Trên thực tế, DeepSeek-V4 và Kimi K3 của Moonshot được cho là đã thích ứng với các nền tảng của Huawei và Alibaba Group Holding. Alibaba Group Holding hiện là công ty mẹ của SCMP.
Dù vậy, loại chip được sử dụng ở giai đoạn huấn luyện vẫn là chủ đề nhạy cảm. DeepSeek và Moonshot đều không công bố cụ thể chip AI dùng để huấn luyện mô hình. Trước đó, vào tháng 7, The Information đưa tin Kimi K3 được huấn luyện trên cụm chip, trong đó có bộ xử lý Blackwell của Nvidia.
Bài viết cũng nhấn mạnh rằng, dù các công ty AI Trung Quốc đang tìm cách mở rộng lựa chọn trong nước, họ vẫn chưa thể thoát phụ thuộc vào phần cứng Nvidia ở khâu huấn luyện các mô hình tiên tiến.
Trung Quốc không thiếu các nỗ lực huấn luyện bằng chip nội địa. Tháng 6, Meituan công bố LongCat-2.0 với quy mô 1,6 nghìn tỷ tham số, đồng thời cho biết đã hoàn tất toàn bộ quá trình huấn luyện và vận hành mô hình trên một cụm tính toán nội địa gồm 50.000 chip, dù không nêu tên nhà cung cấp.
Từ thực tế này, điểm nghẽn lớn nhất trong bài toán tự chủ bán dẫn AI của Trung Quốc tiếp tục được xác định là chi phí chuyển đổi hệ sinh thái phát triển, hơn là năng lực của bản thân con chip. Chip nội địa đang mở rộng hiện diện ở mảng suy luận, nhưng trong cuộc đua huấn luyện các mô hình tiên tiến, tốc độ thay thế môi trường phát triển xoay quanh CUDA sẽ vẫn là yếu tố quyết định năng lực cạnh tranh.