NVIDIA宣布扩展面向广播、体育转播及流媒体平台的AI工具集“NVIDIA AI for Media”,进一步将AI能力引入媒体制作流程。此次更新将视频补帧、视频超分辨率、SDR转HDR、运动员动作追踪、实时唇形同步和语音增强等功能整合至统一工作流中。
NVIDIA当地时间15日介绍称,新推出的视频帧生成技术(VFG)可在相邻帧之间通过AI生成中间帧,将视频帧率提升至2倍或4倍。在体育转播场景中,该功能可用于提升回放和慢动作画面的流畅度。至于6倍和8倍补帧方案,目前仍处于实验和评估阶段。
视频超分辨率技术(VSR)可将低分辨率视频提升至最高8K,并减少噪点、模糊和压缩伪影,同时支持10bit视频处理。TrueHDR则可将SDR视频实时转换为HDR,在尽可能保留原有明暗层次的基础上,将亮度表现扩展至最高约2000尼特。VFG、VSR和TrueHDR可在同一视频处理流程中连续叠加使用。
在人物分析方面,3D Body Pose可基于单机位视频、无需额外标记点,对全身关节动作进行追踪,并转换为3D动画数据,可用于运动员分析、赛事回放和动画制作等场景。
在内容全球化与本地化场景中,系统还提供唇形同步(LipSync)和发言者检测(Active Speaker Detection)功能。其中,LipSync可根据翻译后的音轨实时调整画面中人物口型;Active Speaker Detection则通过联合分析音视频信号,在多人画面中识别实际发言者。LipSync目前还支持法语、德语和西班牙语的唇形同步。
在音频处理方面,Studio Voice可将普通麦克风录音提升至播出级音质,独立降噪功能可进一步压制环境噪声。NVIDIA还升级了既有的AI生成视频检测工具Synthetic Video Detector。总体来看,从内容生成、编辑、翻译到验证,NVIDIA正将AI能力进一步延伸至广播制作全流程。