AI & Enterprise
Lightbits Labs ra mắt Infera, mở rộng KV cache trên GPU để tăng hiệu quả suy luận AI
Lightbits Labs giới thiệu Infera, công cụ quản lý KV cache trên HBM, DRAM và NVMe, giúp cải thiện hiệu quả suy luận AI và tối ưu chi phí vận hành các mô hình ngôn ngữ lớn.