Microsoft đang tăng tốc chiến lược đưa Windows trở thành nền tảng trung tâm cho các agent AI, với mô hình “hybrid intelligence” phân bổ tác vụ giữa PC và đám mây nhằm tối ưu chi phí, đồng thời tăng cường bảo mật và kiểm soát dữ liệu.
Trong bài viết đăng trên blog chính thức ngày 7/10 (giờ địa phương), Pavan Davuluri, Phó chủ tịch điều hành phụ trách Windows + Devices của Microsoft, cho biết hãng đang định vị Windows như hạ tầng cốt lõi cho “hybrid intelligence”, đồng thời nêu rõ định hướng chiến lược và các điểm khác biệt của nền tảng này.
Microsoft cho biết sẽ nén mô hình lập trình MAI Code 1.1 Flash, từng được công bố tại hội nghị nhà phát triển Build hồi tháng 5. Mô hình này có tổng cộng 137 tỷ tham số, trong đó 6,8 tỷ tham số được kích hoạt, và sẽ được giảm gần 80% dung lượng để có thể chạy trực tiếp trên PC.
Theo Microsoft, Surface Laptop Ultra trang bị NVIDIA RTX Spark có thể chạy cục bộ các mô hình trên 120 tỷ tham số nhờ bộ nhớ hợp nhất tối đa 128 GB. Trong khi đó, DGX Station phiên bản Windows dự kiến ra mắt vào cuối năm có thể xử lý các mô hình hơn 1.000 tỷ tham số, đồng thời vận hành song song hơn 32 agent để phục vụ nhu cầu ở cấp độ nhóm.
Chi phí là một trong những trọng tâm chính của chiến lược hybrid intelligence.
Microsoft cho biết HydraFusion của GitHub trước đây chỉ hỗ trợ lựa chọn mô hình AI phù hợp cho từng tác vụ trên đám mây, nhưng nay đã mở rộng sang cả các mô hình chạy trên PC. Những tác vụ có thể xử lý ngay trên thiết bị sẽ được thực hiện cục bộ để giảm chi phí đám mây.
Ông Davuluri nhấn mạnh rằng khi mô hình AI ngày càng lớn, ngân sách dành cho đám mây khó có thể gánh toàn bộ khối lượng xử lý. Theo ông, khách hàng muốn tiết kiệm token nhưng vẫn duy trì hiệu năng ở cấp độ frontier.
Bên cạnh chi phí, Microsoft cũng đặt trọng tâm vào bảo mật.
MXC, viết tắt của Microsoft Execution Containers, đã được phát hành chính thức trên Windows 11. Công nghệ này cho phép cô lập môi trường thực thi và giới hạn quyền truy cập vào tệp cũng như mạng đối với các agent AI trong quá trình vận hành.
OpenAI Codex và GitHub Copilot đã hỗ trợ MXC. Meta cũng dự kiến đưa agent cá nhân Muse lên Windows dưới dạng ứng dụng chạy trên MXC. Microsoft cho biết sẽ bổ sung khả năng theo dõi hoạt động của từng agent, đồng thời cung cấp công cụ kiểm soát thông qua Agent 365 và Intune.
Theo ông Davuluri, việc chuyển khâu suy luận sang xử lý cục bộ sẽ giúp các tổ chức giữ dữ liệu nhạy cảm và tài sản trí tuệ trong chính môi trường của mình.
Microsoft cũng cho biết trong vài tháng tới, hãng sẽ triển khai trên Copilot Plus PC tính năng cho phép Copilot, sau khi được người dùng cấp quyền, đọc tệp trên PC và ngữ cảnh công việc gần đây để thay mặt người dùng thực hiện một số tác vụ như sắp xếp tệp hoặc xử lý sự cố.
Về lộ trình sản phẩm, HydraFusion tích hợp với mô hình cục bộ sẽ có bản thử nghiệm vào cuối tháng 10. DGX Station phiên bản Windows và mẫu mini desktop dựa trên RTX Spark dự kiến ra mắt vào cuối năm. Tính năng thực hiện tác vụ trực tiếp từ ô tìm kiếm của Windows trước mắt sẽ chỉ được cung cấp cho người dùng thuộc kênh thử nghiệm Windows Insider.
Tuy nhiên, với Microsoft, việc xây dựng hệ sinh thái xoay quanh hybrid intelligence vẫn là bài toán chưa dễ giải.
Anthropic Claude Code, Perplexity, Manus cùng nhiều công ty khác đã công bố kế hoạch hỗ trợ MXC, song hiện mới dừng ở mức cam kết. Do MXC cũng hỗ trợ các hệ điều hành khác, một số ý kiến cho rằng Microsoft cần chứng minh rõ hơn vì sao các công ty AI nên ưu tiên Windows. Đáp lại, hãng nhấn mạnh lợi thế tích hợp sâu với Windows, cùng dải lựa chọn rộng từ cô lập tiến trình đến máy ảo.
Yếu tố phần cứng cũng được xem là biến số quan trọng. Để chạy cục bộ các mô hình lớn, người dùng cần PC hiệu năng cao với bộ nhớ hợp nhất dung lượng lớn. Microsoft cho biết PC dùng RTX Spark có thể nhanh hơn tối đa 2,1 lần so với MacBook Pro 16 inch dùng M5 Pro của Apple về thời gian phản hồi token đầu tiên, nhanh hơn 4,3 lần trong tác vụ tạo ảnh AI và 6,2 lần trong tạo video AI. Tuy nhiên, các số liệu này đều là mức tối đa do Microsoft công bố.