搜索关键词 屏幕识别
AI & Enterprise
Xenon开源Hunmin VLM 397B,主打屏幕识别与电脑操作能力
生成式AI解决方案公司Xenon宣布开源视觉语言模型Hunmin VLM 397B。该模型基于Qwen3.5-397B打造,重点强化屏幕识别和电脑操作能力,在ScreenSpot-Pro测试中获得75.6分,位列Hugging Face榜单第2位;在OSWorld测试中取得70.5分,较基座模型提升22.3分。Xenon同时公开原版模型、FP8版本及配套开发与评测方法。
AI & Enterprise
Google发布Gemini 3.5语音模型:可在打断后继续对话,Transcribe覆盖85种语言
Google更新语音模型产品线,推出Gemini 3.5 Live、Gemini 3.5 Live Experimental和语音转写模型Gemini 3.5 Transcribe。新模型提升了对话中断处理能力,并带来多语混合识别、实时视觉理解和工具调用等能力;其中,Gemini 3.5 Transcribe覆盖85种语言,语音到文本输出耗时较Chirp 3缩短约70%,实时语音识别错误率降至5.5%。
Telecommunications & Media
Apple 发布 iOS 27 开发者测试版 Beta 5:图标继续调整,Siri 强化语音新增英式英语
Apple 已向开发者推送 iOS 27 开发者测试版 Beta 5,本次更新主要围绕系统图标、Siri 语音和搜索设置展开。新版本进一步统一“液态玻璃”设计风格,Siri 强化语音新增英式英语选项,正式版预计将于 9 月随新一代 iPhone 一同发布。