搜索关键词 vLLM
AI & Enterprise
Dinothicia开源STAR-KV技术,缓解大语言模型推理内存瓶颈
AI基础设施企业Dinothicia公开了KV缓存压缩技术STAR-KV的论文和源代码。论文实验显示,该方案仅凭低秩压缩即可将KV缓存最高减少75%;结合混合精度量化后,整体压缩幅度最高可达20倍,旨在缓解大语言模型长上下文推理中的内存和速度瓶颈。
AI & Enterprise
Red Hat调整AI战略:企业控成本需从外部调用转向自建运营
面向AI Agent加速落地的趋势,Red Hat正在重新调整AI平台战略。Red Hat CTO Chris Wright表示,尽管AI token成本每年下降75%至90%,但企业token使用量每年增长超过500%,单纯依赖外部API和专有模型已难以长期持续。为此,Red Hat推出Red Hat AI Enterprise,主打覆盖基础设施、推理、模型服务与Agent管理等环节的开源全栈能力。
Crypto
Nvidia市值升至约5.3万亿美元 AI基础设施扩张提振AI代币预期
随着Nvidia市值升至约5.3万亿美元,市场正将其股价表现和业绩变化视为分布式AI基础设施及链上算力需求的前瞻性指标。TAO、RNDR、FET等AI相关加密资产,一方面关注大型科技公司2026年AI资本开支或合计达到6600亿美元、Nvidia 2月至4月营收同比增长69%等信号,另一方面也在评估自研芯片和开源工具演进带来的不确定性。