Twelve Labsは10月7日、一人称動画の理解に特化したビジョン言語モデル(VLM)「Pegasus 1.6」を公開した。行動分割やラベリング、品質評価など5つの中核機能を備え、ロボット向け学習データ整備の自動化を支援する。動画理解技術の適用先を、従来のメディア分野からPhysical AIへ広げる狙いだ。
一人称動画は、人の視点で撮影した映像を指す。作業者がアクションカメラやスマートグラスを装着し、特定の動作を行う様子を撮影して収集する。
こうしたデータはロボット学習向けに注目を集めているが、Twelve Labsによると、映像を集めるだけでは学習データとしては不十分だ。学習に適した場面を選別したうえで、映像内の行動を区間ごとに分け、手がどの道具や物体とどう関わったのか、結果がどうだったのかまで把握する必要があるという。
これらの工程は従来、人手に頼る部分が大きかった。Pegasus 1.6は、一人称動画を自動的に理解・整理することで、こうした作業の効率化を後押しする。
同モデルは、人物の行動、周囲の物体、前後の文脈をあわせて理解し、作業工程ごとに切り分けて記述できる。例えば、作業者が部品をつかみ、道具を使って作業し、完成品を移動させる場面では、それぞれの行動、登場する物体、行動の順序を把握し、構造化データとして整理できるとしている。
ロボット学習データの構築に向けた主な機能は5つ。行動分割・ラベリング(Action Segmentation and Labeling)、詳細キャプションの付与(Dense Caption Labeling)、品質評価(Quality Scoring)、検索・キュレーション(Search and Curation)、個人情報・コンプライアンス検知(Consent and Compliance Flagging)を備える。
Twelve Labsのイ・ジェソンCEOは、「機械が映像を通じて現実世界の動きを理解できるようにすることを、一貫して目指してきた」と述べた。そのうえで、「Physical AIは、その延長線上にある自然な展開だ」と位置付けた。
さらに同氏は、「物が滑ったときに持ち直すといった現実世界での経験の多くは、機械が学習できる形では記録されていない」と指摘。「Pegasus 1.6は映像を構造化された知識に変換し、Physical AIやロボティクス企業が実際の人間の経験を学習に活用できるようにする」と説明した。
同社はこれまで、動画内の行動や出来事、前後の文脈を理解する汎用的な動画理解技術を、メディア、エンターテインメント、スポーツ、公共分野などに展開してきた。足元では、ロボットを含むPhysical AIや製造現場向けの産業AX分野にも適用領域を広げているという。