Twelve Labs发布视觉语言模型(VLM)Pegasus 1.6。

多模态视频理解AI企业Twelve Labs于7日发布视觉语言模型(VLM)Pegasus 1.6,进一步将业务延伸至第一视角数据理解以及Physical AI相关场景。

所谓第一视角数据,是指以佩戴者视角拍摄的视频内容,通常由作业人员通过运动相机、智能眼镜等设备,在执行特定任务过程中采集形成。

Twelve Labs表示,第一视角数据正成为机器人学习的重要来源。不过,单纯采集第一视角视频,并不足以直接形成可用于训练的数据。要真正用于训练,还需要筛选出合适片段,将视频切分为不同动作阶段,并识别手部与工具、物体之间的交互方式及结果等细节。

以往,上述流程对人工处理依赖较高。Pegasus 1.6则针对第一视角视频理解提供支持,以提升相关数据处理流程的自动化水平。

据介绍,该模型可同时理解视频中的人物动作、周边物体以及前后语境,对作业过程进行分段并给出解释。例如,在“抓取零部件—使用工具加工—搬运成品”的场景中,模型能够识别各个动作、涉及物体及其先后顺序,并将相关内容转化为结构化信息。

为支持机器人训练数据构建,Pegasus 1.6提供五项核心功能,分别为行为分割标注(Action Segmentation and Labeling)、密集字幕标注(Dense Caption Labeling)、质量评分(Quality Scoring)、检索与策展(Search and Curation),以及隐私与合规检测(Consent and Compliance Flagging)。

Twelve Labs CEO Lee Jaeseong表示,公司的核心方向一直是让机器通过视频理解现实世界的运作方式,而Physical AI正是这一方向的自然延伸。他还指出,人类在现实世界中积累了大量经验,例如物体滑落后如何迅速纠正,但这些经验往往并未以机器可学习的形式被记录下来。Pegasus 1.6的目标,就是将视频转化为结构化知识,帮助Physical AI和机器人企业把真实的人类经验用于训练。

在此之前,Twelve Labs已将通用视频理解技术应用于媒体、娱乐、体育及公共领域,围绕视频中的行为、事件和上下文理解提供相关能力。近期,公司正进一步把布局拓展至机器人等Physical AI场景,以及制造现场等工业AX领域。

关键词

#Twelve Labs #Pegasus 1.6 #VLM #多模态AI #第一视角视频 #机器人学习 #Physical AI #行为分割标注 #合规检测 #工业AX
版权所有 © DigitalToday。未经授权禁止转载或传播。