Ảnh: Shutterstock

Lightbits Labs đã ra mắt Infera, công cụ phần mềm mới nhằm nâng cao hiệu quả suy luận AI bằng cách mở rộng KV cache ra ngoài HBM, vốn có dung lượng hạn chế trên GPU.

Theo SiliconANGLE ngày 9/9 (giờ địa phương), Infera được thiết kế để quản lý KV cache trên nhiều tầng bộ nhớ, gồm HBM của GPU, DRAM và bộ lưu trữ NVMe. Mục tiêu là cải thiện hiệu năng suy luận đồng thời tối ưu chi phí vận hành các mô hình ngôn ngữ lớn (LLM).

Sản phẩm này nhắm tới các môi trường chạy LLM có ngữ cảnh dài hoặc phải xử lý nhiều phiên đồng thời.

Theo giới thiệu của công ty, Infera sử dụng cơ chế prefetch dự đoán để đưa trước dữ liệu cần thiết đến gần GPU, thay vì giữ toàn bộ KV cache trong HBM.

KV cache là khu vực lưu lại các giá trị đã được tính toán trong quá trình mô hình tạo đầu ra. Nhờ đó, hệ thống không phải xử lý lại toàn bộ ngữ cảnh trước đó mỗi khi dự đoán token tiếp theo, qua đó rút ngắn thời gian suy luận.

Với Infera, toàn bộ ngữ cảnh không được nạp lên bộ nhớ GPU cùng một lúc mà được chia thành các khối nhỏ và đưa vào theo nhu cầu xử lý. Lightbits Labs cho biết cách làm này đặc biệt hiệu quả trong các tác vụ như retrieval-augmented generation, AI agent, prompt dài và dịch vụ GPU dùng chung cho nhiều người dùng.

Tuy nhiên, công ty cũng thừa nhận hiệu quả của Infera có thể không rõ rệt trong các môi trường có cụm GPU dư dả, ít người dùng và toàn bộ ngữ cảnh đã sẵn trong bộ nhớ.

Từ khóa

#Lightbits Labs #Infera #KV cache #GPU #LLM #suy luận AI #HBM #DRAM #NVMe
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.