Google Gemini(资料图)。图片来源:Shutterstock

Google发布手语转文本AI模型SL2T,并在Pixel 11上率先推出这一功能。

据外媒SiliconANGLE当地时间12日报道,听障人士可通过手机摄像头做出手语动作,SL2T会将其实时转写为文本。

Google将SL2T定义为一款面向多种手语的转写模型,首个版本可将美国手语转换为英文文本。

借助这一模型,用户无需键盘输入,即可使用手语完成网页搜索、撰写邮件和短信、编辑文档,也可以向Gemini提问并请求其执行相关任务。在Live Transcribe中,用户还可在面对面交流场景下,以手语输入回复内容。

Google表示,全球约有7000万听障人士,而使用200多种手语的人群,长期以来在AI产品和服务中获得的支持相对有限。SL2T正是面向这一群体开发,目标是让用户能够通过手语与智能手机进行交互。

从训练数据看,SL2T覆盖50多种手语,累计时长超过10万小时,其中约四分之一为美国手语数据。不过在首发阶段,该模型仅支持理解美国手语。Google解释称,多手语联合训练有助于模型学习不同手语之间共享的结构模式。

技术实现方面,SL2T基于端侧计算机视觉模型MediaPipe Holistic,对面部、手部、手臂和躯干位置进行追踪,并将坐标数据而非原始视频上传至云端服务器。Google表示,不上传原始视频有助于实现更快、更安全的处理。

与依赖“gloss”这一中间文本标注步骤的传统方案不同,SL2T可直接将手语动作转换为文本。该模型还针对降低延迟进行了优化,并加入对非手语动作的幻觉抑制机制,同时支持左撇子用户和单手手语。

在FLEURS-ASL基准测试中,SL2T的BLEURT得分为70分。Google还与听障组织及手语专家共同成立了AI手语咨询委员会,以支持技术的负责任应用,并计划联合发布报告,梳理SL2T目前的能力边界与现阶段局限。Google表示,后续将扩大支持的手语范围,并开发手语生成模型。

关键词

#Google #SL2T #Pixel 11 #手语转文本 #无障碍 #Gemini #MediaPipe Holistic #端侧计算机视觉 #隐私保护
版权所有 © DigitalToday。未经授权禁止转载或传播。