搜索关键词 推理速度
Industry
Qualcomm发布新一代Hexagon NPU:共享内存最高提升50%,面向智能体AI
Qualcomm披露了面向下一代高端移动平台的Hexagon NPU设计与性能数据,重点强化智能体AI场景下的端侧推理能力。新架构新增Transformer专用加速器,并将共享内存最高提升50%,以减少DDR访问并降低时延。公司称,在Int4模型基准下,预填阶段性能提升50%;在40亿参数模型上,首个Token生成时间低于1.5秒。
AI & Enterprise
Google据称最快9月2日发布Gemini 3.8 Flash,聚焦编程能力提升
据《华尔街日报》报道,Google最快将于9月2日发布新模型Gemini 3.8 Flash,重点强化编程能力。该模型内部代号为“SchemaKey”,在Google内部编程工具JetSki的对比测试中,工程师对其评价高于Anthropic的Opus模型。报道同时指出,Google正加大对强化学习和后训练的投入,但Pro系列新模型发布仍有延后,Gemini 4的后训练流程也尚未完成。
AI & Enterprise
Rabbleup研究员:智能体普及将推动多模型协同,小型模型使用占比上升
Rabbleup研究员Lee Junbeom表示,在生成式AI服务中,不同规模模型分工协作已成为常态。检索、信息收集、摘要等任务通常由小型模型完成,关键判断和内容生成则由前沿大模型负责。随着智能体应用加快普及,模型调用频率持续上升,推理成本压力也随之加大,多模型协同和小型模型的应用比重预计将进一步提高。
-
AI & Enterprise
Lunit、KAIST冲刺韩国产业专用基础模型最终评估,9月9日见分晓
-
AI & Enterprise
SoftBank、Meta入局Neocloud,AI云市场冲击AWS等三巨头格局
-
Mobility
XPeng公布自动驾驶AI框架X-Mind:先预测未来路况,再生成驾驶决策
-
AI & Enterprise
SKT携手KG Steel、KONIC推进自研AI基础模型落地制造业现场
-
AI & Enterprise
Miso Information Technology在CMTX落地AI视觉检测智能制造平台
-
AI & Enterprise
NVIDIA发布5500亿参数开源大模型Nemotron 3 Ultra,Vera Rubin平台进入量产阶段
-
AI & Enterprise
NVIDIA CEO Jensen Huang:AI正加速迈入Agent AI时代
-
Mobility
XPeng推出VLA 2.0自动驾驶系统,强调类人驾驶决策能力
-
AI & Enterprise
Cerebras上线Kimi K2.6企业级推理服务:速度达981 token/s
-
AI & Enterprise
Red Hat发布Red Hat AI 3.4:推理速度最高提升至3倍,拓展航天与汽车合作
-
AI & Enterprise
Kakao一季度营收和营业利润双双创同期新高,加速将KakaoTalk升级为Agentic AI平台
-
AI & Enterprise
Google发布Gemma 4开放权重模型,可在低功耗设备端本地运行复杂推理
-
Industry
Google推出TurboQuant压缩KV缓存,SK hynix、Samsung Electronics等存储股走低
-
AI & Enterprise
iPhone本地运行近400B参数大模型迎来新进展
-
AI & Enterprise
Gimlet Labs完成8000万美元A轮融资,发力“多芯片推理云”