Ông Kim Dong-hyuk, trưởng nhóm SA tại HS Hyosung Information System, cho biết hơn một nửa ngân sách AI của doanh nghiệp hiện không còn dành cho việc xây dựng mô hình mà đã chuyển sang vận hành mô hình. Nếu trước đây các trung tâm dữ liệu chủ yếu xử lý những vấn đề quen thuộc như sự cố lưu trữ, dự báo sai nhu cầu dung lượng hay chậm chu kỳ nâng cấp, thì áp lực đầu tư trong năm 2026 đã khác. Trọng tâm của hạ tầng AI đang dịch chuyển rõ rệt từ huấn luyện sang suy luận quy mô lớn, vận hành liên tục 24/7.
Theo ông, đây không còn là xu hướng mang tính dự báo mà đã bắt đầu diễn ra trên thực tế. Thách thức không nằm ở chỗ suy luận phức tạp hơn huấn luyện về mặt kỹ thuật, mà ở việc nhiều tổ chức hạ tầng chưa từng vận hành khối lượng công việc này trong môi trường thực tế. Khi doanh nghiệp bắt đầu phản ứng, chuẩn mực của thị trường có thể đã thay đổi.
Huấn luyện là giai đoạn ngắn hạn, suy luận là tải vận hành thường trực
Theo Deloitte, đến năm 2025, suy luận sẽ chiếm khoảng một nửa tổng năng lực tính toán AI, tăng mạnh so với mức một phần ba của năm 2023. Nhiều phân tích cũng cho thấy 80-90% chi phí vận hành của hệ thống AI trong môi trường production phát sinh ở giai đoạn suy luận. Chi phí không đến từ từng yêu cầu riêng lẻ, mà từ việc hệ thống phải hoạt động liên tục, không ngắt quãng.
Sau khi được triển khai, mô hình AI sẽ phải vận hành thường xuyên. Nếu huấn luyện chỉ tạo ra tải đột biến trong một giai đoạn nhất định, thì suy luận lại làm thay đổi mặt bằng tải của toàn bộ trung tâm dữ liệu. Mỗi khi doanh nghiệp bổ sung một dịch vụ tích hợp AI cho tính năng mới hoặc tự động hóa quy trình, mức tải hạ tầng phải duy trì sẽ tăng lên và không quay về như trước. Điều này tạo ra một cấu trúc chi phí hoàn toàn khác, đòi hỏi cách tiếp cận mới trong chiến lược hạ tầng.
Vì sao on-premise trở lại cùng làn sóng suy luận AI
Ở giai đoạn đầu, AI doanh nghiệp phát triển chủ yếu trên nền tảng đám mây, vốn phù hợp cho thử nghiệm và triển khai ban đầu. Nhưng khi suy luận bước vào vận hành thực tế, bài toán trở nên phức tạp hơn. Muốn giảm độ trễ, năng lực tính toán phải được đặt gần nơi dữ liệu tồn tại; trong khi đó, quy mô càng lớn thì chi phí càng tích lũy nhanh. Cùng lúc, hiện tượng “Data Gravity” cũng quay trở lại: khi dữ liệu ngày càng lớn hoặc chịu yêu cầu kiểm soát và tuân thủ, xử lý tại chỗ thường hiệu quả hơn so với việc di chuyển dữ liệu.
Đám mây vẫn phù hợp cho huấn luyện hoặc xử lý nhu cầu tăng đột biến trong thời gian ngắn. Tuy nhiên, với suy luận trong môi trường production, mô hình hybrid không còn là giải pháp chuyển tiếp mà đang dần trở thành lựa chọn thiết kế ngay từ đầu. Các tổ chức đi trước không chọn một trong hai giữa cloud và on-premise, mà phân bổ workload theo vị trí dữ liệu, yêu cầu độ trễ, điều kiện quản trị và cấu trúc chi phí. Theo ông Kim Dong-hyuk, cán cân đang ngày càng nghiêng về on-premise.
Bài toán không chỉ là tính toán mà còn là dữ liệu
Khi AI đi vào vận hành, điểm nghẽn thường không nằm ở năng lực tính toán mà ở khả năng truy cập dữ liệu. Workload suy luận có tỷ trọng đọc dữ liệu cao, nhạy với độ trễ và đòi hỏi dữ liệu luôn được cập nhật. Mô hình không vận hành dựa trên dữ liệu tĩnh trong quá khứ, mà cần dữ liệu vận hành theo thời gian thực của doanh nghiệp. Phần lớn dữ liệu này nằm trong các hệ thống on-premise và cơ sở dữ liệu vận hành vốn không được thiết kế để kết nối trực tiếp với pipeline AI. Vì vậy, vấn đề cốt lõi thường nằm ở khoảng cách giữa nơi dữ liệu đang ở và nơi mô hình cần truy cập, hơn là ở cụm GPU.
Việc sao chép dữ liệu sang một pipeline riêng vừa làm tăng độ trễ, vừa làm phát sinh rủi ro quản trị. Với các ngành chịu ràng buộc pháp lý, mỗi lần dữ liệu được di chuyển đều có thể trở thành vấn đề về tuân thủ. Do đó, điều quan trọng là xây dựng kiến trúc cho phép truy cập trực tiếp dữ liệu tại nguồn, gần nơi thực thi tính toán. Khi suy luận trở thành hoạt động thường trực và dần phát triển theo hướng AI agent, mô hình không còn chỉ cần một bộ dữ liệu cố định, mà cần dữ liệu vận hành theo thời gian thực, có thể truy cập lặp lại theo chính sách.
Hitachi Vantara cho biết đã tiếp cận bài toán này ngay từ khâu thiết kế. VSP 360 (Virtual Storage Platform 360) là control plane ứng dụng AI cho hạ tầng dữ liệu doanh nghiệp. Nền tảng này điều phối toàn bộ quá trình cấp phát và vận hành dịch vụ lưu trữ cũng như bảo vệ dữ liệu, nhằm đáp ứng các yêu cầu về tính nhất quán, hiệu năng và độ sẵn sàng của suy luận trong môi trường production.
Trên nền tảng đó, Hitachi IQ Studio cung cấp các chức năng quản trị và điều phối dữ liệu dựa trên AI cho workload suy luận. Giải pháp hỗ trợ truy cập trực tiếp vào dữ liệu doanh nghiệp thông qua cơ chế truy cập theo chính sách, không cần sao chép dữ liệu hoặc tạo lớp staging riêng. Đồng thời, hệ thống cũng áp dụng các công cụ quản trị, truy xuất nguồn gốc dữ liệu, quản lý chất lượng và khả năng quan sát đối với dữ liệu được cung cấp cho mô hình.
Chi phí hạ tầng bước sang một cấu trúc mới
Theo ông Kim Dong-hyuk, cấu trúc chi phí cũng đang thay đổi. Khi suy luận đã trở thành một phần của vận hành, khoản chi này sẽ bám chặt vào hoạt động hàng ngày và rất khó cắt giảm, gần giống như một loại tiện ích hạ tầng. Vì vậy, bộ phận vận hành hạ tầng cần rời khỏi tư duy đầu tư theo dự án với chi phí cố định để chuyển sang mô hình tiêu dùng, trong đó việc tối ưu chi phí lặp lại trở thành yêu cầu thường xuyên.
Những tổ chức đi đầu trong làn sóng chuyển dịch này đang cho thấy một mô hình chung: từ lập kế hoạch theo nhu cầu giờ cao điểm sang quản trị mức tải nền; từ sở hữu tài sản sang tiêu thụ dịch vụ; từ các dự án triển khai một lần sang một nền tảng vận hành thường trực, phải duy trì ổn định mỗi ngày.
Cuộc đua huấn luyện mô hình thật nhanh, theo ông, về cơ bản đã qua. Năng lực cạnh tranh trong giai đoạn tiếp theo sẽ phụ thuộc vào khả năng vận hành suy luận ổn định trên nền dữ liệu được quản trị tốt, dễ truy cập và đặt gần tài nguyên tính toán. Chỉ những hạ tầng được chuẩn bị sẵn mới có thể thích ứng với giai đoạn phát triển tiếp theo của AI doanh nghiệp.