Qualcomm ngày 11/9 công bố thiết kế cùng các chỉ số hiệu năng của Hexagon NPU, bộ xử lý chuyên dụng cho tác vụ AI sẽ được tích hợp trên nền tảng di động cao cấp thế hệ mới. Theo hãng, đây là một trong những thành phần cốt lõi phục vụ xử lý agentic AI trực tiếp trên smartphone.
Qualcomm cho rằng trong kỷ nguyên agentic AI, việc chia nhỏ tác vụ và sử dụng nhiều mô hình chuyên biệt sẽ phù hợp hơn với từng ngữ cảnh, từng người dùng và từng nhu cầu cụ thể, thay vì phụ thuộc vào một mô hình khổng lồ duy nhất. Trên cơ sở đó, hãng đã bổ sung bộ gia tốc tính toán mới, đồng thời tăng tối đa 50% bộ nhớ chia sẻ của NPU.
Element Accelerator, bộ gia tốc mới của Qualcomm, sẽ đảm nhiệm các phép tính trong kiến trúc Transformer - nền tảng của AI tạo sinh và agentic AI. Với các mô hình lớn, khả năng mở rộng cho cả vector lẫn scalar đều được tăng cường: vector xử lý khối lượng tính toán AI lớn, còn scalar hỗ trợ suy luận logic, phân bổ nhiệm vụ và điều phối tác nhân AI. Qualcomm cho biết cách tiếp cận này giúp agent AI phản hồi và suy luận nhanh hơn, nhưng vẫn đảm bảo hiệu quả năng lượng.
Trong quá trình tạo phản hồi, mô hình AI liên tục truy xuất KV cache để lưu ngữ cảnh hội thoại và các kết quả đã được tính toán trước. Nếu dung lượng trong NPU không đủ, dữ liệu buộc phải chuyển qua lại với DDR - bộ nhớ chính của thiết bị - làm tăng độ trễ. Khi bộ nhớ chia sẻ được mở rộng thêm tối đa 50%, NPU có thể giữ lại nhiều dữ liệu hơn bên trong, qua đó giảm số lần truy cập DDR, rút ngắn độ trễ và giải phóng băng thông bộ nhớ cho các tác vụ khác.
Qualcomm cho biết khi không gian bộ nhớ khả dụng lớn hơn, NPU có thể tập trung nhiều hơn cho suy luận. Đồng thời, các mô hình chạy on-device có thể xử lý ngữ cảnh dài hơn, sử dụng nhiều công cụ hơn và vận hành đồng thời nhiều tác vụ. Ở giai đoạn prefill - bước mô hình đọc câu hỏi và ngữ cảnh ban đầu - hiệu suất tăng 50% với mô hình Int4 tối ưu 4-bit. Với mô hình 4 tỷ tham số, thời gian tạo token đầu tiên để bắt đầu xuất câu trả lời ở mức dưới 1,5 giây.
Về phía nhà phát triển, Qualcomm cho biết nền tảng mới cho phép điều chỉnh linh hoạt giữa hiệu năng, dung lượng bộ nhớ, chất lượng mô hình và mức tiêu thụ điện năng. Hexagon NPU hỗ trợ đầy đủ các mức độ chính xác gồm Int2, Int4, Int8, FP8 và FP16. Hãng cũng hỗ trợ mô hình Mixture of Experts (MoE), cơ chế chỉ kích hoạt các expert cần thiết theo từng đầu vào, giúp giảm khối lượng tính toán và áp lực bộ nhớ so với mô hình truyền thống phải kích hoạt toàn bộ mạng trong mỗi lần chạy.
Ngoài ra, Qualcomm cho biết đang phối hợp với các đối tác về bộ nhớ và mô hình để phát triển phương thức nạp một số expert từ bộ nhớ flash. Theo hãng, toàn bộ expert vẫn luôn ở trạng thái khả dụng, nhưng mỗi tác vụ chỉ cần kích hoạt khoảng 3 tỷ tham số. Qualcomm gọi đây là “Intelligent Flash-to-Memory Expert Management”, kết hợp với kỹ thuật caching riêng để mang lại trải nghiệm AI tương đương các mô hình lớn hơn nhưng với mức tiêu thụ điện năng và bộ nhớ thấp hơn.
Với Hexagon NPU, Qualcomm cho biết hãng đã hoàn tất việc công bố các thành phần hiệu năng chính của Snapdragon thế hệ mới gồm CPU, GPU và NPU, hướng đến triển khai agentic AI. Trong đó, CPU Oryon sẽ đảm nhiệm vai trò lập kế hoạch, suy luận và điều phối theo từng bước, đồng thời chuyển các tác vụ cần API đám mây lên cloud. Mỗi prime core chạy ở xung nhịp 5GHz và sử dụng cấu trúc cache mới Flex Cache. GPU Adreno sẽ phối hợp với NPU để xử lý suy luận AI trong môi trường lai, nơi nhiều mô hình có thể vận hành đồng thời trên thiết bị. Các chi tiết cụ thể hơn sẽ được Qualcomm công bố tại Snapdragon Summit 2026.