Nvidia ngày 25/8 (giờ địa phương), tức một ngày trước khi công bố kết quả kinh doanh quý II, đã giới thiệu loạt sản phẩm mới về tăng tốc AI suy luận và hạ tầng mạng tại hội nghị thiết kế bán dẫn Hot Chips 2026 ở Mỹ. Tâm điểm của đợt ra mắt là tốc độ tạo token trong giai đoạn suy luận, cùng các công nghệ mở rộng mạng và hạ tầng dành cho kỷ nguyên AI tác tử.
Theo Nvidia, ba trụ cột chính trong lần công bố này gồm hiệu năng suy luận, khả năng mở rộng mạng và CPU cho AI tác tử. Công ty cho biết các công nghệ mới đều nằm trong hệ sinh thái Vera Rubin, qua đó củng cố kỳ vọng của thị trường về định hướng kinh doanh trong kỳ báo cáo sắp tới. Nvidia dự kiến công bố kết quả quý II vào ngày 26/8 (giờ địa phương), tức rạng sáng 27/8 theo giờ Hàn Quốc.
Grok 3 LPX vào giai đoạn sản xuất hàng loạt, mở rộng tới 512.000 GPU
Tại Hot Chips 2026, Nvidia cho biết Grok 3 LPX đã chính thức bước vào giai đoạn sản xuất hàng loạt. Đây là bộ tăng tốc AI suy luận được thiết kế để mở rộng nền tảng AI factory thế hệ mới Vera Rubin, đồng thời được hãng giới thiệu là cấu hình có hiệu năng cao nhất từng được đo trong dòng sản phẩm này.
Theo Nvidia, trong bài đánh giá của Artificial Analysis sử dụng mô hình tác tử mã nguồn mở Gemma 4 31B với ngữ cảnh 100.000 token, Grok 3 LPX đạt tốc độ tạo 3.400 token đầu ra mỗi giây.
Nebius, doanh nghiệp cung cấp dịch vụ điện toán đám mây AI, dự kiến sẽ là đơn vị đầu tiên triển khai Grok 3 LPX trên nền tảng suy luận Nebius Token Factory. Nvidia cũng nêu tên Nebius trong nhóm doanh nghiệp triển khai sớm.
Jensen Huang, nhà sáng lập kiêm CEO Nvidia, nhận định suy luận đang trở thành động lực tăng trưởng của AI. Theo ông, Vera Rubin mở rộng tầm nhìn này với cấu hình AI factory được tối ưu theo từng loại workload cho thời đại AI tác tử, trong đó LPX giúp đẩy nhanh đáng kể tốc độ tạo token.
Nvidia cho rằng AI tác tử có khả năng tự hoàn thành các tác vụ nhiều bước mà không cần con người can thiệp. Trong quá trình suy luận kéo dài từ hàng trăm đến hàng nghìn bước, hệ thống phải tạo ra lượng token rất lớn; nếu tốc độ tạo token chậm, toàn bộ tác vụ sẽ bị kéo dài. Theo hãng, bài toán của AI tác tử hiện nằm ở cả xử lý ngữ cảnh quy mô lớn lẫn tạo token với độ trễ thấp, và Grok 3 LPX được tối ưu để tăng tốc quá trình này cho từng người dùng.
Spectrum-X Multiplane mở rộng hạ tầng Ethernet mà không cần thêm tầng mạng thứ ba
Cùng ngày, Nvidia cũng giới thiệu kiến trúc Ethernet mới mang tên Spectrum-X Multiplane. Theo công ty, khi mở rộng AI factory vượt quy mô của các cụm hiện nay, mô hình cũ thường phải bổ sung thêm tầng mạng thứ ba, làm tăng độ trễ, chênh lệch hiệu năng, chi phí cáp, linh kiện quang và điện năng tiêu thụ.
Để xử lý vấn đề này, Multiplane chia kết nối mạng của máy chủ thành nhiều plane độc lập, trong đó mỗi plane vận hành như một mạng lớp 2 riêng. Nvidia cho biết kiến trúc này giúp hệ thống duy trì mô hình “phẳng” và có thể mở rộng tới 512.000 GPU mà không cần bổ sung tầng mạng thứ ba.
Việc điều phối đường truyền do một bộ máy phần cứng chuyên dụng tích hợp trong ConnectX SuperNIC đảm nhiệm. Khi xảy ra sự cố, hệ thống có thể lập tức tái cấu hình tuyến để tránh điểm lỗi, trong khi ứng dụng và phần mềm vẫn chỉ nhìn thấy một kết nối duy nhất. Với cấu hình 8 plane, nếu một plane gặp sự cố, hệ thống vẫn duy trì khoảng 90% tổng băng thông. Nvidia cho biết tốc độ phục hồi bằng phần cứng nhanh gấp 11 lần so với cơ chế cân bằng tải dựa trên phần mềm, qua đó nâng hiệu suất vận hành AI factory thêm 1,6 lần.
ScaleIn tăng tốc dịch vụ hạ tầng, hỗ trợ mạng, lưu trữ và bảo mật
Nvidia cũng công bố ScaleIn, công nghệ tăng tốc cho các dịch vụ hạ tầng, được xây dựng trên bộ xử lý BlueField-4 và nền tảng phần mềm DOCA. Theo hãng, giải pháp này cho phép tăng tốc đồng thời mạng, lưu trữ, bảo mật và vận hành hệ thống.
Nvidia cho rằng khi AI factory tiếp tục mở rộng, các lớp dịch vụ hạ tầng cũng phải được tăng tốc tương ứng với năng lực tính toán AI. Các công nghệ mạng mới được thiết kế phù hợp với Vera Rubin NVL72, bao gồm switch Spectrum-X dòng SN6000 và ConnectX-9 SuperNIC.
Bên cạnh đó, Nvidia cho biết Spectrum-XGS Ethernet, công nghệ dùng để kết nối nhiều trung tâm dữ liệu thành một “AI superfactory”, có thể tăng tốc các phép toán tập hợp NCCL đa điểm lên 1,9 lần.
SpaceXAI đưa Vera CPU lên quỹ đạo
Nvidia cho biết hãng sẽ đưa thiết bị tính toán lên quỹ đạo, trong khi SpaceXAI công bố kế hoạch triển khai Vera CPU để tăng tốc các workload AI tác tử thế hệ tiếp theo. Theo Nvidia, môi trường quỹ đạo đặt ra những yêu cầu khác với trung tâm dữ liệu mặt đất, bao gồm điện năng, quản lý nhiệt, băng thông, độ tin cậy và tích hợp vật lý.
Vera được Nvidia giới thiệu là CPU đầu tiên được thiết kế cho AI tác tử. Sản phẩm tích hợp 88 lõi Olympus do Nvidia phát triển cùng bộ nhớ LPDDR5X băng thông cao, cung cấp băng thông tối đa 1,2 TB/s. Nvidia cho biết trong các workload AI tác tử, học tăng cường và xử lý dữ liệu, Vera có thể rút ngắn thời gian hoàn thành tác vụ tới 1,8 lần so với CPU x86.
Theo Nvidia, vai trò của CPU ngày càng lớn do đặc thù vận hành của AI tác tử. Các ứng dụng loại này phụ thuộc nhiều hơn vào CPU để điều phối công cụ giữa các lần gọi mô hình, thực thi mã và xử lý dữ liệu. Mike Nichols, Chủ tịch SpaceXAI, cho biết Vera giúp GPU tập trung vào những tác vụ phù hợp nhất với GPU, đồng thời cung cấp hiệu năng CPU và băng thông bộ nhớ cần thiết cho điều phối quy mô lớn, thực thi mã và xử lý dữ liệu.
SpaceXAI cũng cho biết sẽ mở rộng hạ tầng AI hỗ trợ Grok dựa trên Vera Rubin lên quy mô điện toán mức gigawatt. Với vệ tinh AI Starmind thế hệ đầu tiên, công ty sẽ triển khai hệ thống Vera Rubin NVL72 đã được tối ưu, nhằm đưa kiến trúc vận hành AI factory trên mặt đất lên môi trường quỹ đạo.