Kim Seon-uk, Giám đốc điều hành Nvidia Korea, trình bày về “agentic AI” tại hội thảo Digital Insight 2026 do DigitalToday tổ chức ngày 29/9. Ảnh: DigitalToday

Nvidia cho rằng một AI agent đúng nghĩa phải có khả năng tự thực hiện nhiệm vụ liên tục trong nhiều giờ, thay vì chỉ trả lời câu hỏi rồi chờ người dùng nhập lệnh tiếp theo.

Phát biểu tại hội thảo Digital Insight 2026 với chủ đề “agentic AI” do DigitalToday tổ chức ngày 29/9 tại COEX, quận Gangnam, Seoul, ông Kim Seon-uk, Giám đốc điều hành Nvidia Korea, nói rằng khi được giao việc, agent có thể vận hành trong 5 giờ, thậm chí 12 giờ.

Theo ông, để làm được điều đó, hệ thống phải phối hợp đồng thời nhiều thành phần và công cụ liên kết với nhau. Ông nhấn mạnh AI agent thực sự phải vận hành trên một tầng điều phối (orchestration), thay vì chỉ là một mô hình phản hồi đơn lẻ.

Ông Kim cho biết nhu cầu hạ tầng cho loại agent này đang tăng nhanh trong khối doanh nghiệp. Theo ông, Nvidia nhận được nhiều câu hỏi từ khách hàng về việc có thể thuê năng lực tính toán hay không, trong bối cảnh họ không có đủ tài nguyên để tự vận hành hệ thống.

Mô tả cấu trúc của AI agent, ông Kim ví đây là mô hình “gắn harness vào LLM”. Nếu LLM đóng vai trò như bộ não hiểu ngôn ngữ, thì harness là lớp điều khiển bộ não đó. Thành phần này lưu lại lịch sử người dùng để tinh chỉnh câu lệnh, đồng thời kết nối với tệp, máy tính và các công cụ khác để thay con người thực hiện tác vụ. Phần LLM có thể được lựa chọn tùy theo môi trường tính toán, bao gồm cả các mô hình do Nvidia và Google phát triển.

Trong kiến trúc này, harness chủ yếu chạy trên CPU, trong khi LLM chạy trên GPU. Theo ông Kim, vì phần điều khiển của agent phần lớn hoạt động trên CPU, vai trò của CPU đang trở nên quan trọng hơn. Cách huấn luyện agent thay đổi cũng là yếu tố làm gia tăng tầm quan trọng của bộ xử lý này.

Ông giải thích trước đây doanh nghiệp chủ yếu huấn luyện trực tiếp LLM, còn hiện nay trọng tâm đã chuyển sang huấn luyện agent. CPU đảm nhận quá trình lặp lại hàng chục nghìn lần dựa trên phản hồi để đánh giá mức độ hoàn thành công việc của agent. Đây cũng là lý do Nvidia thiết kế rack CPU riêng. Hiện hãng sử dụng Vera, dòng CPU dựa trên kiến trúc Arm.

Với các tác vụ như bảo mật lưu trữ và xử lý dữ liệu mà CPU khó gánh toàn bộ, Nvidia chuyển sang DPU (Data Processing Unit). Đây là dòng chip do Nvidia phát triển nhằm tách phần xử lý dữ liệu vốn trước đây do CPU đảm nhiệm. DPU sử dụng giao tiếp mạng hiệu năng cao để phân tích và xử lý dữ liệu, sau đó truyền dữ liệu hiệu quả hơn tới GPU và CPU.

Một nền tảng quan trọng khác để agent có thể tiếp tục công việc là bộ nhớ. Agent cần lưu nhiệm vụ và lịch sử hoạt động vào bộ nhớ để xử lý tiếp. Theo ông Kim, cũng giống như con người dựa vào ký ức tích lũy theo thời gian, bộ nhớ là thành phần “cực kỳ quan trọng” đối với agent.

Tuy nhiên, chỉ sở hữu đủ chip vẫn chưa thể tạo ra một AI agent hoàn chỉnh. Ông Kim cho biết trên thị trường hiện có những công ty chỉ phát triển mô hình, trong khi một số khác chỉ xây dựng harness. Vì vậy, Nvidia cung cấp bộ công cụ cho agent, gồm Nemotron, thư viện tăng tốc dữ liệu và các cơ chế an toàn, để doanh nghiệp có thể lắp ghép các thành phần này. Theo ông, doanh nghiệp có thể dùng trọn bộ công cụ của Nvidia hoặc kết hợp với mô hình khác; chỉ cần thay thế thành phần tốt nhất cho từng tác vụ là có thể tạo ra kết quả khác biệt.

Từ góc nhìn của Nvidia, AI agent trước hết là một bài toán hạ tầng. Ông Kim cho rằng cần hợp nhất CPU, GPU và máy chủ lưu trữ trong một kiến trúc thống nhất để vận hành agent. Yếu tố quyết định của hạ tầng này là điện năng. Ông nhấn mạnh agent chỉ có thể hoạt động trong giới hạn nguồn điện có thể cung cấp, và chi phí thực chất được quyết định bởi lượng điện cần tiêu thụ để tạo ra token.

Bước tiếp theo mà Nvidia hướng tới là robot. Theo ông Kim, robot giống như “một con người đang di chuyển”, nên gánh nặng đặt lên agent sẽ lớn hơn nhiều. Vì vậy, hệ thống hỗ trợ cho robot cũng sẽ phải phức tạp hơn đáng kể.

Từ khóa

#Nvidia #AI agent #agentic AI #LLM #CPU #GPU #DPU #tầng điều phối
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.