Pegasus 1.6 của TwelveLabs. Ảnh: TwelveLabs.

TwelveLabs ngày 7/10 công bố Pegasus 1.6, mô hình thị giác - ngôn ngữ (VLM) được phát triển để xử lý dữ liệu video góc nhìn thứ nhất, hướng tới tự động hóa quy trình xây dựng dữ liệu huấn luyện cho robot và physical AI.

Dữ liệu góc nhìn thứ nhất là video được ghi theo tầm mắt của con người. Loại dữ liệu này thường được thu thập khi người lao động đeo camera hành động hoặc kính thông minh trong lúc thực hiện một tác vụ cụ thể.

Theo TwelveLabs, dữ liệu dạng này đang được quan tâm ngày càng nhiều trong huấn luyện robot. Tuy nhiên, chỉ riêng video góc nhìn thứ nhất là chưa đủ để hoàn thiện bộ dữ liệu đào tạo.

Để có thể dùng cho học máy, video cần được chọn lọc theo từng cảnh phù hợp, chia thành các đoạn hành động cụ thể, đồng thời xác định chi tiết việc bàn tay tương tác với công cụ hay vật thể nào và tạo ra kết quả ra sao.

Trước đây, phần lớn quy trình này phụ thuộc vào sức người. TwelveLabs cho biết Pegasus 1.6 cung cấp khả năng hiểu video cần thiết để tự động hóa các bước nói trên.

Mô hình có thể đồng thời phân tích hành vi của con người trong video, nhận diện các vật thể xung quanh và nắm bắt ngữ cảnh trước và sau, từ đó chia nhỏ tác vụ theo từng đoạn và tạo mô tả tương ứng.

Chẳng hạn, trong một cảnh người lao động nhặt một bộ phận, dùng dụng cụ để thao tác rồi chuyển vật thể đã thao tác xong sang bước tiếp theo, mô hình có thể nhận diện từng hành động, các vật thể xuất hiện cũng như trình tự diễn ra để cấu trúc hóa dữ liệu.

Để đưa khả năng hiểu video này vào quy trình xây dựng dữ liệu huấn luyện robot, Pegasus 1.6 được tích hợp 5 tính năng cốt lõi: phân đoạn và gắn nhãn hành động (Action Segmentation and Labeling), gắn nhãn chú thích chi tiết (Dense Caption Labeling), chấm điểm chất lượng (Quality Scoring), tìm kiếm và tuyển chọn (Search and Curation), cùng phát hiện các vấn đề về quyền riêng tư và tuân thủ (Consent and Compliance Flagging).

Lee Jae-sung, CEO TwelveLabs, cho biết định hướng nhất quán của công ty là giúp máy móc hiểu cách thế giới thực vận hành thông qua video, và physical AI là bước phát triển tiếp theo một cách tự nhiên của hướng đi này.

Ông cũng nói phần lớn kinh nghiệm mà con người tích lũy trong thế giới thực, chẳng hạn như điều chỉnh lại một đồ vật khi bị trượt, vẫn chưa được ghi lại dưới dạng mà máy móc có thể học được.

Theo Lee Jae-sung, Pegasus 1.6 sẽ chuyển video thành tri thức có cấu trúc, qua đó giúp các công ty phát triển physical AI và robot khai thác trải nghiệm thực tế của con người cho mục tiêu huấn luyện.

Trước đó, TwelveLabs đã đưa công nghệ hiểu video tổng quát — gồm nhận biết hành động, sự kiện và ngữ cảnh trước và sau — vào nhiều lĩnh vực như truyền thông, giải trí, thể thao và khu vực công. Gần đây, công ty tiếp tục mở rộng sang AX công nghiệp, nhắm tới các ứng dụng trong physical AI, robot và môi trường sản xuất.

Từ khóa

#TwelveLabs #Pegasus 1.6 #VLM #dữ liệu góc nhìn thứ nhất #physical AI #robot
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.