搜索关键词 自回归模型
AI & Enterprise
Meta发布实时语音识别模型Muse Voice Transcribe:可转写20名以上说话人对话,支持多语混说
Meta于9月1日发布实时语音识别模型Muse Voice Transcribe,可在实时转写过程中区分不同说话人,适用于20名以上说话人参与的对话以及多语言、混合语种场景。该模型以80毫秒为单位处理音频,并采用自适应延迟技术。Meta称,其在Artificial Analysis流式语音识别评测中的最终词错误率(WER)为3.1%,API按语音时长计费为每小时0.18美元。
AI & Enterprise
NVIDIA发布ArtiFixer:可补全照片缺失区域的3D场景生成模型
NVIDIA发布AI模型ArtiFixer,可根据多张照片生成3D场景,并对照片未覆盖区域进行生成式补全,以缓解传统3D重建中常见的画质下降和场景一致性不足问题。该模型基于视频生成AI模型Wan 2.1开发,参数规模约169亿。NVIDIA同时推出ArtiFixer、ArtiFixer3D和ArtiFixer3D+三个版本,并披露了与其他方法的对比结果。
AI & Enterprise
韩国获政府GPU支持下企业加速研发下一代LLM与行动型AI
在韩国政府GPU支持项目带动下,多家AI初创企业正加快模型研发,方向涵盖基于扩散的Transformer大语言模型、韩文文档解析模型以及行动型AI代理。韩国科学技术信息通信部表示,已优先向159个项目分配4224块GPU,并将于3月就剩余资源启动追加公开招募。