Chi phí triển khai AI tăng cao đang khiến doanh nghiệp chuyển dần sang các mô hình nguồn mở có hiệu quả chi phí tốt hơn cho những tác vụ cơ bản. Trong xu hướng đó, cuộc cạnh tranh giữa các hãng công nghệ đang nhanh chóng dịch chuyển sang mảng LLM có thể chạy cục bộ trên PC cá nhân.
Sau giai đoạn bùng nổ của các mô hình siêu lớn với quy mô gần 10 nghìn tỷ tham số, thị trường hiện chứng kiến sự quan tâm ngày càng lớn đối với các mô hình nhẹ hơn. Đây cũng là phân khúc mà những tên tuổi lớn như DeepSeek, Meta và Nvidia đang đồng loạt tăng tốc.
Tại Trung Quốc, DeepSeek gần đây liên tiếp giới thiệu các mô hình có thể triển khai trên PC nhưng vẫn duy trì hiệu năng đáng chú ý. Ở Mỹ, Meta và Nvidia cũng mở rộng danh mục AI theo hướng tương tự, tập trung vào khả năng chạy trên thiết bị thay vì phụ thuộc hoàn toàn vào hạ tầng đám mây.
Cuối tháng 7, DeepSeek ra mắt V4 Flash, mô hình mới nhắm vào lập trình với quy mô 304 tỷ tham số. Dù nhỏ hơn bản xem trước V4 Pro, mẫu chủ lực có khoảng 1.600 tỷ tham số, V4 Flash vẫn nhanh chóng thu hút cộng đồng phát triển nhờ hiệu năng được đánh giá là tiệm cận nhóm mô hình lớn.
Theo các đánh giá được chia sẻ trong giới phát triển, V4 Flash chỉ được tinh chỉnh ở mức tối thiểu nhưng cho kết quả vượt xa bản xem trước V4 Pro và tiến gần tới Claude Opus 4.8. Trong các bài kiểm tra về lập trình phức tạp và tác vụ phần mềm tự trị, mô hình này đạt điểm số tương đương Claude Opus 4.8, đồng thời vượt Opus 4.8 trên bảng xếp hạng Arena Frontend Coding.
Yếu tố giá cũng khiến V4 Flash được chú ý hơn. Claude Opus 4.8 có giá đầu ra 25 USD/phút, trong khi giá API mà DeepSeek công bố cho V4 Flash là 28 cent, thấp hơn 99%.
Một điểm khác được cộng đồng phát triển quan tâm là khả năng vận hành V4 Flash trên phần cứng tiêu dùng. Các mô hình AI tiên tiến thường đòi hỏi máy chủ với GPU có bộ nhớ lên tới vài trăm GB, nhưng V4 Flash được cho là vẫn có thể chạy hiệu quả trên các PC cá nhân cấu hình cao.
Salvatore Sanfilippo, nhà phát triển nổi tiếng với bút danh antirez và là người tạo ra Redis, cho biết ông đang cân nhắc chuyển từ GLM 5.2 sang V4 Flash cho một máy tính nhỏ gọn.
Trong khi đó, Meta theo đuổi chiến lược đại trà hơn cho AI chạy cục bộ. Công ty dự kiến phát hành dòng mô hình mới mang tên Muse Glimmer, được thiết kế để có thể chạy trên laptop.
Muse Glimmer là mô hình 30 tỷ tham số; phát hành trọng số theo giấy phép Apache 2.0 để nhà phát triển có thể tải về và chỉnh sửa. Meta cho biết mô hình này được xây dựng cho các AI agent xử lý tác vụ nhiều bước.
Với một GPU tiêu dùng trên Mac hoặc PC, Muse Glimmer có thể gọi công cụ, viết và gỡ lỗi mã, xử lý tệp và ảnh chụp màn hình, đồng thời vận hành các workflow kéo dài. Mô hình hỗ trợ cả văn bản lẫn hình ảnh và được huấn luyện trên hơn 100 ngôn ngữ.
Meta cũng nhấn mạnh yếu tố quyền riêng tư khi nói về thị trường mục tiêu của Muse Glimmer. Theo công ty, mô hình này hướng tới xử lý trực tiếp trên thiết bị thay vì gửi dữ liệu lên đám mây, từ đó tạo nền tảng cho các tác nhân cá nhân trong những tình huống nhạy cảm về dữ liệu.
Meta lấy ví dụ các tác vụ như quản lý lịch, soạn tin nhắn hay sắp xếp tệp, vốn đòi hỏi quyền truy cập vào dữ liệu cá nhân, là những kịch bản sử dụng phù hợp với Muse Glimmer.
CEO Meta Mark Zuckerberg nói rằng “các tác nhân cá nhân sẽ thay người dùng hỗ trợ 24/7 trong các mối quan hệ, sức khỏe, sự nghiệp, tài chính, quản lý gia đình hay sở thích, và mọi người sẽ có thể tiếp cận các công cụ này miễn phí hoặc với mức chi phí có thể chi trả”.
Dù vậy, việc triển khai Muse Glimmer trên PC vẫn còn rào cản. Mô hình yêu cầu GPU tối thiểu 24 GB VRAM, khiến việc mở rộng trong môi trường doanh nghiệp không hẳn dễ dàng.
Computerworld dẫn ý kiến của các nhà phân tích và tư vấn cho biết doanh nghiệp hiện quan tâm lớn tới vận hành AI cục bộ. Tuy nhiên, việc đánh giá hiệu quả tài chính khi chuyển từ cloud sang hạ tầng cục bộ phức tạp hơn nhiều. Yếu tố then chốt là rất khó dự báo biến động giá RAM và giá dịch vụ cloud trong 12-18 tháng tới.
Ở một hướng đi khác, Nvidia cũng công bố mô hình AI nguồn mở Nemotron 3.5 Lightning, cho phép doanh nghiệp tải về, sử dụng và chỉnh sửa mà không cần xin phép hay trả phí. Đây là phiên bản gọn nhẹ, có thể chạy trên GPU của PC.
Nemotron 3.5 Lightning là mô hình kiến trúc hỗn hợp chuyên gia, hay MoE, với 30 tỷ tham số, được phát triển cho các AI agent hoạt động tự động ở chế độ nền. Mô hình hiện được cung cấp trên Hugging Face và website của Nvidia.
Doanh nghiệp cũng có thể sử dụng Nvidia NeMo trên phần cứng nội bộ để tiếp tục huấn luyện mô hình dựa trên dữ liệu chuyên biệt, công cụ và workflow riêng của tổ chức.