Ảnh: SK hynix

Chip AI on-device do các công ty Hàn Quốc phát triển đang tiến gần chuẩn quốc tế về phần cứng, nhưng vẫn gặp trở ngại lớn trong thương mại hóa vì điểm nghẽn phần mềm. Dù nhiều NPU do doanh nghiệp fabless và startup AI trong nước phát triển đã chứng minh được năng lực tính toán và hiệu suất điện năng, không ít sản phẩm vẫn bị loại ngay từ giai đoạn kiểm chứng công nghệ (PoC) do SDK và compiler chưa đủ hoàn thiện.

Theo giới công nghiệp ngày 21/7, nhiều nhà sản xuất thiết bị trong các lĩnh vực điện gia dụng, mobility và robot từng cân nhắc chip AI nội địa ở giai đoạn PoC, nhưng cuối cùng đã từ bỏ vì thiếu môi trường phát triển phù hợp. Vấn đề nằm ở chỗ chưa có đủ công cụ và framework để khách hàng biên dịch, tối ưu mô hình AI của họ cho phần cứng chip.

Với đội ngũ lập trình tại các doanh nghiệp thiết bị đầu cuối, việc làm quen với một môi trường phát triển lạ trên NPU nội địa thường tốn kém hơn so với tiếp tục sử dụng chip nước ngoài dựa trên hệ sinh thái CUDA của Nvidia. Hệ quả là chip nội địa nhiều khi còn chưa có cơ hội thể hiện hiệu năng thực tế.

Điểm nghẽn này phần nào xuất phát từ cấu trúc đầu tư của các công ty fabless trong nước. Do hạn chế về ngân sách và nhân lực, phần lớn nguồn lực được dồn vào khâu thiết kế chip vật lý, trong khi các thành phần phần mềm như compiler hay SDK bị xếp sau. Vì vậy, dù các chỉ số phần cứng như TOPS đã được cải thiện, khả năng kết nối với môi trường phát triển của khách hàng vẫn chưa theo kịp.

Về mặt kỹ thuật, vấn đề nổi bật nhất nằm ở khâu biên dịch. Khi chuyển các mô hình AI được xây dựng bằng PyTorch hoặc định dạng ONNX sang mã máy tối ưu điện năng cho NPU, nếu xuất hiện toán tử không được hỗ trợ, tác vụ sẽ phải chuyển sang CPU xử lý, kéo theo hiện tượng nghẽn hiệu năng.

Ở bước lượng tử hóa, việc nén mô hình từ FP16 xuống INT8 có thể khiến độ chính xác suy giảm mạnh, khiến doanh nghiệp từ bỏ kế hoạch đưa vào sản xuất hàng loạt. Bên cạnh đó, việc khó truy vết nguyên nhân khi phát sinh lỗi mapping hoặc khi hiệu năng sụt giảm cũng làm tăng rào cản triển khai.

Sự thiếu vắng công cụ gỡ lỗi cũng là một vấn đề lớn. Khác với Nvidia Nsight hay Apple CoreML SDK, vốn có profiler trực quan để chỉ ra lớp nào đang gây nghẽn, nhiều giải pháp nội địa vẫn buộc lập trình viên phải dò lỗi thủ công.

Khi gánh nặng phát triển tăng lên, tại thị trường đã xuất hiện nhiều phản ánh về mức độ quá tải trong quá trình kiểm chứng chip nội địa. Trong bối cảnh các mô hình AI như LLM, vision transformer và SLM thay đổi chỉ trong vài tháng, tốc độ cập nhật SDK của các startup NPU Hàn Quốc bị đánh giá là chưa theo kịp, khiến các nhà sản xuất thiết bị càng thận trọng hơn với chip nội địa.

Các viện nghiên cứu cũng đưa ra đánh giá tương tự. Viện Nghiên cứu Điện tử và Viễn thông Hàn Quốc (ETRI), trong một báo cáo về năng lực cạnh tranh của bán dẫn AI từ góc nhìn phần mềm, cho rằng thị trường chip AI đòi hỏi compiler riêng cho từng tổ hợp giữa framework học sâu và kiến trúc chip. Theo ETRI, nếu các công ty fabless Hàn Quốc thiếu nhân lực phần mềm và không xây dựng được hệ sinh thái compiler, framework dùng chung, thì ngay cả NPU có hiệu năng cao cũng có thể rơi vào tình trạng không thể sản xuất hàng loạt và thương mại hóa.

Cơ quan Xã hội Thông tin Thông minh Quốc gia Hàn Quốc (NIA) và Viện Nghiên cứu Chính sách Khoa học và Công nghệ (STEPI) cũng chỉ ra rằng nguyên nhân khiến chip AI nội địa không tìm được nhu cầu thực tế là do thiếu tương thích kỹ thuật ở giai đoạn PoC và thiếu SDK. Hai tổ chức này nhận định thành bại của NPU không nằm ở thông số tính toán của một con chip đơn lẻ, mà phụ thuộc vào hệ sinh thái phần mềm cũng như khả năng tích lũy các dự án triển khai thực tế tại doanh nghiệp thiết bị đầu cuối và trung tâm dữ liệu.

Doanh nghiệp hạ tầng AI Modular cho rằng nguyên nhân nhiều công ty phần cứng thất bại trong việc xây dựng phần mềm AI nằm ở bài toán “bùng nổ tổ hợp”. Mỗi bước tiến của phần cứng, đặc biệt là bán dẫn, đều kéo theo yêu cầu đội ngũ phần mềm phải hỗ trợ hàng loạt tổ hợp khác nhau giữa loại mô hình AI, phương thức lượng tử hóa, batch size và framework.

Trong bối cảnh đội ngũ phần mềm tại nhiều công ty fabless còn thiếu từ hàng trăm đến hàng nghìn kỹ sư, họ thường bị cuốn vào xử lý các lỗi phát sinh trước mắt của khách hàng, thay vì xây dựng hệ sinh thái compiler theo hướng dài hạn. Theo đánh giá của giới chuyên môn, sức mạnh toàn cầu của Nvidia không chỉ đến từ tốc độ xử lý của GPU, mà còn từ hệ sinh thái tài liệu, CUDA, SDK và custom kernel đã được bồi đắp suốt 15-20 năm tại các trường đại học và viện nghiên cứu.

Với lập trình viên và doanh nghiệp, việc phải học thêm một SDK NPU mới ngoài CUDA đồng nghĩa với chi phí cơ hội rất lớn. Một người trong ngành cho rằng khi từng công ty fabless khó có thể tự xây dựng một hệ sinh thái ngang tầm CUDA, thị trường cần một nền tảng có thể chia sẻ gánh nặng phát triển, đồng thời cho phép nhà cung cấp chip và doanh nghiệp thiết bị cùng khai thác.

Từ khóa

#AI #chip AI on-device #NPU #SDK #compiler #profiler #PoC #fabless #CUDA #ETRI #NIA
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.