Nvidia đã đưa chip suy luận Groq 3 LPX dành cho AI agent vào sản xuất hàng loạt. Ảnh: Nvidia

Nvidia đã đưa Groq 3 LPX, dòng chip suy luận dành cho AI agent, vào sản xuất hàng loạt. Theo công ty, sản phẩm được thiết kế để tăng tốc giai đoạn tạo token, đạt tốc độ 3.400 token/giây trong bài kiểm tra của Artificial Analysis.

Theo SiliconANGLE và một số nguồn tin quốc tế ngày 24/8 (giờ địa phương), Groq 3 LPX là sản phẩm mở rộng từ nền tảng trung tâm dữ liệu Vera Rubin của Nvidia. Con chip được giới thiệu tại Hot Chips 2026. Nebius Group là khách hàng đầu tiên công khai kế hoạch triển khai Groq 3 LPX.

Suy luận AI là quá trình đưa mô hình đã được huấn luyện vào vận hành thực tế. Khi AI agent ngày càng được sử dụng để tự động hóa công việc của con người, hệ thống phải liên tục lặp lại nhiều bước như suy luận và lập kế hoạch, viết và chạy mã, kiểm tra tệp hệ thống, gọi công cụ bên ngoài. Điều này làm khối lượng token cần xử lý tăng mạnh.

Trong bối cảnh đó, độ trễ ở khâu tạo token trở thành điểm nghẽn đối với tốc độ phản hồi. Nvidia cho biết để giảm độ trễ, hệ thống cần một kiến trúc tính toán chuyên biệt, tách riêng phần xử lý ngữ cảnh quy mô lớn với phần tạo token.

Vai trò này được đảm nhiệm ở cấp rack bởi nền tảng Vera Rubin NVL72. Theo mô hình Nvidia công bố, nhiều GPU Vera Rubin sẽ phụ trách tiếp nhận và xử lý ngữ cảnh lớn, trong khi Groq 3 LPX được bổ sung để chuyên xử lý tác vụ decode.

Nvidia cho biết một cấu hình rack có thể kết nối tối đa 256 bộ tăng tốc LP30 thông qua liên kết chip băng thông siêu cao. Trong kiến trúc này, GPU và bộ xử lý ngôn ngữ LPU phối hợp như một hệ thống suy luận tích hợp, xử lý toàn bộ các bước trong vòng lặp suy luận của AI agent.

Theo Nvidia, cách tiếp cận này giúp giảm bớt sự đánh đổi giữa thông lượng và độ phản hồi. Công ty cho biết Groq 3 LPX có thể hỗ trợ AI agent xử lý các cửa sổ ngữ cảnh dài, kiểm chứng dữ liệu, gọi công cụ bên ngoài và lặp lại các tác vụ phức tạp nhiều bước theo thời gian thực mà không tạo ra độ trễ đáng kể.

Trong bài benchmark của Artificial Analysis, Groq 3 LPX đạt 3.400 token/giây, mức cao nhất từng được ghi nhận, khi chạy mô hình agent mã nguồn mở Gemma 4 31B với cửa sổ ngữ cảnh 100.000 token. Nvidia cho biết kết quả này cho thấy hiệu năng phản hồi trong các tác vụ nhạy cảm với độ trễ cao hơn 4 lần so với các nền tảng cạnh tranh, qua đó có thể rút ngắn thời gian xử lý các tác vụ agent nhiều bước từ vài giờ xuống còn vài phút.

Con chip này được phát triển dựa trên công nghệ cấp phép từ Groq, một startup bán dẫn quy mô nhỏ. Nvidia cho biết vào tháng 12 năm ngoái, công ty đã chi 20 tỷ USD để giành quyền tiếp cận công nghệ này, đồng thời chiêu mộ nhà sáng lập Jonathan Ross và chủ tịch Sunny Madra.

Groq là công ty độc lập, không liên quan tới mô hình AI Grok của SpaceX. Doanh nghiệp này tập trung phát triển bộ xử lý tối ưu cho suy luận, thay vì huấn luyện AI.

Jensen Huang, CEO Nvidia, cho biết công ty đã tạo ra bước tiến mới về hiệu năng và hiệu quả suy luận AI với Grace Blackwell và nền tảng NVL72. Theo ông, Vera Rubin mở rộng các cấu hình “AI factory” theo hướng tối ưu hóa từng loại tải công việc, phù hợp với kỷ nguyên AI agent. Nvidia hiện tiếp tục đẩy giới hạn hiệu năng với LPX để tăng tốc tạo token, qua đó thay đổi cách “sản xuất trí tuệ” và tạo thêm bước nhảy về thông lượng, hiệu quả lẫn độ phản hồi.

Nebius Group là một trong những doanh nghiệp sớm quyết định triển khai Groq 3 LPX. Công ty dự kiến tích hợp con chip này vào nền tảng suy luận sản xuất Nebius Token Factory để cung cấp tốc độ tạo token rất cao cho các ứng dụng dạng agent đòi hỏi phản hồi nhanh.

Danila Shtan, CTO của Nebius, cho biết giai đoạn tạo sinh là phần quyết định độ phản hồi thực tế của một hệ thống AI, và Groq 3 LPX được thiết kế để tăng tốc chính khâu này. Ông nói Nebius Token Factory đang được thương mại hóa như một nền tảng đám mây AI, giúp từng bước trong vòng lặp agent diễn ra gần như tức thời.

Nvidia cũng cho biết tại Hot Chips, hãng đã giành thêm một khách hàng đáng chú ý là SpaceX. Theo kế hoạch, SpaceX sẽ xây dựng kiến trúc AI thế hệ tiếp theo xoay quanh nền tảng Vera Rubin, đồng thời triển khai Vera CPU của Nvidia cho các tác vụ điều phối, thực thi công cụ thiên về CPU và công việc mô phỏng, từ trung tâm dữ liệu mặt đất tới các vệ tinh trên quỹ đạo.

Cùng với đó, Nvidia công bố thêm một loạt công nghệ bổ trợ cho AI factory. Trong đó có kiến trúc Ethernet tối ưu cho AI mang tên Spectrum-X Multiplane, hỗ trợ mở rộng cụm lên tối đa 512.000 GPU; nền tảng phần mềm hạ tầng Nvidia Scale-in, giúp offload các tác vụ bảo mật, mạng và quản trị dữ liệu khỏi nút tính toán host chính để tăng tốc hệ thống; và Nvidia NVLink Fusion, giải pháp kết nối CPU tùy biến cùng thiết bị xử lý dữ liệu vào hệ thống rack NVLink thế hệ thứ 6.

Từ khóa

#Nvidia #Groq 3 LPX #AI agent #suy luận AI #Vera Rubin #Hot Chips 2026 #Nebius Group #SpaceX #GPU #LPU
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.