据SiliconANGLE当地时间9日 报道,Lightbits Labs正式推出面向AI推理场景的软件引擎Infera。
Lightbits Labs表示,Infera的核心思路是将KV缓存从容量有限的GPU HBM中扩展出来,从而提升推理性能和成本效率。该产品主要针对长上下文窗口或高并发会话的大语言模型(LLM)部署环境。
在技术实现上,Infera采用预测式预取机制,提前判断所需数据,并将其调度到更接近GPU的位置,在HBM、DRAM和NVMe之间对KV缓存进行统一管理。
大语言模型在生成文本时,通常按照顺序逐词输出。为了预测下一个词,模型需要利用此前上下文中的信息。如果每次都从头反复计算,耗时会明显增加。因此,系统通常会把已经计算过的中间结果保存在内存中,供后续生成时直接复用,而这部分存储空间就是KV缓存。
Infera并不会一次性将完整上下文全部加载到GPU内存中,而是将数据切分成更小的块,并在需要时按需调入。Lightbits Labs称,在检索增强生成、AI Agent、长上下文以及多用户共享GPU服务等场景中,Infera带来的效果可能更为显著。
不过,该公司也指出,如果企业自有GPU集群资源充足、用户数量较少,且上下文本身就可以装入可用内存,那么Infera能够带来的收益可能相对有限。
记者信息