Dyna Robotics của Mỹ vừa giới thiệu DYNA-2, mô hình nền tảng cho robot được tiền huấn luyện từ khoảng 1 triệu giờ video góc nhìn thứ nhất của con người, thay vì dựa vào dữ liệu thu thập trực tiếp từ robot. Công ty kỳ vọng cách tiếp cận này sẽ giúp giải quyết tình trạng thiếu dữ liệu huấn luyện, một trong những rào cản lớn nhất đối với robot đa năng.
Theo Cryptopolitan, ngày 11/8 theo giờ địa phương, DYNA-2 được huấn luyện trước hoàn toàn bằng video góc nhìn thứ nhất của con người.
Lâu nay, một phương pháp phổ biến trong phát triển robot đa năng là để con người điều khiển robot từ xa nhằm tạo dữ liệu huấn luyện. Người vận hành sẽ trực tiếp điều khiển cánh tay robot hoặc robot hình người, lặp lại từng tác vụ cụ thể để ghi nhận dữ liệu.
Tuy nhiên, quy trình này đòi hỏi nhiều thời gian và chi phí. Khi số lượng tác vụ tăng lên hoặc hình thái robot thay đổi, nhà phát triển thường phải thu thập lại dữ liệu từ đầu, khiến việc mở rộng quy mô trở nên khó khăn.
Dyna Robotics chọn hướng đi khác. Thay vì để robot tham gia ngay từ giai đoạn học ban đầu, công ty khai thác các video ghi lại quá trình con người tương tác với đồ vật để rút ra thông tin hành động cần thiết cho robot.
Theo công ty, DYNA-2 được huấn luyện trên khoảng 1 triệu giờ video góc nhìn thứ nhất của con người, tương đương gần 170 năm hành vi liên tục. Đồng sáng lập Jason Ma cho rằng dữ liệu hành động rất khan hiếm, trong khi video lại hiện diện ở khắp nơi. Ông nói robot có thể học trực giác vật lý thông qua những cảnh con người cầm nắm, di chuyển và thao tác với đồ vật, thay vì phải dựa vào hàng triệu giờ điều khiển cánh tay robot.
Dyna Robotics cũng công bố một số kết quả cải thiện hiệu suất. Với các tác vụ sản xuất đòi hỏi độ chính xác cao, tỷ lệ thành công được cho là tăng từ khoảng 20% lên 80-90%. Trong 15 tác vụ đánh giá chuẩn, mô hình được huấn luyện trên lượng video con người lớn hơn cũng cho kết quả ổn định hơn so với mô hình học từ quy mô dữ liệu nhỏ hơn.
Về kiến trúc, DYNA-2 khác với nhiều hệ AI cho robot trước đây. Đây không phải mô hình thị giác - ngôn ngữ thông thường, mà là mô hình world-action được xây dựng trên nền tảng tạo sinh video. Ở giai đoạn tiền huấn luyện, mô hình không chỉ hiểu bối cảnh trong video mà còn đồng thời dự đoán khung hình tiếp theo và hành động kế tiếp.
Theo Dyna Robotics, cách học này giúp robot hình thành biểu diễn nội tại về những thay đổi vật lý và quan hệ không gian phát sinh trong quá trình tiếp xúc với đồ vật.
Mục tiêu cuối cùng của công ty là xây dựng năng lực có thể chuyển giao giữa nhiều loại robot khác nhau, thay vì gắn với một nền tảng cụ thể. Theo đó, kiến thức học từ video của con người có thể được áp dụng cho cánh tay robot cố định, nguyên mẫu robot hình người hoặc bàn tay robot đa khớp, dù các thiết bị này không trực tiếp tham gia giai đoạn tiền huấn luyện của DYNA-2.
Dyna Robotics cho biết thời gian tinh chỉnh để thích ứng với một nền tảng robot mới cũng có thể rút ngắn đáng kể, từ vài tuần xuống còn vài giờ. Ví dụ được công ty đưa ra là một robot dạng bàn tay có thể học thao tác vặn nắp chai chỉ với 13 phút dữ liệu bổ sung.
Công ty cũng nhấn mạnh dự án không dừng ở giai đoạn nghiên cứu. Theo Dyna Robotics, robot DYNA-1 hiện đã được triển khai trong khách sạn, nhà hàng, tiệm giặt là, phòng gym và nhiều môi trường khác. Dyna Robotics do Linden Gao, York Yang và Jason Ma đồng sáng lập, trong đó có thành viên từng làm việc tại Google DeepMind.
Trong thời gian tới, công ty dự kiến mở rộng quy mô huấn luyện từ 1 triệu giờ lên 10 triệu giờ video của con người. Dyna Robotics cho rằng điểm nghẽn của robot đa năng hiện nằm ở khâu thu thập dữ liệu hơn là số lượng thiết bị được triển khai. Thay vì đưa hàng nghìn hoặc hàng chục nghìn robot có chi phí cao ra thực địa để tự tạo dữ liệu, công ty muốn tận dụng kho video hành vi của con người sẵn có trên Internet và trong đời thực để tăng tốc huấn luyện.
Dù vậy, khả năng tái hiện ổn định những tri thức hành động học từ video của con người trong môi trường robot thực tế vẫn cần thêm kiểm chứng. Nguyên nhân là con người và robot khác nhau về cấu trúc cơ thể, khớp, lực tác động cũng như trường nhìn.
Theo giới quan sát, thành bại của DYNA-2 sẽ không chỉ phụ thuộc vào số lượng video mà mô hình đã học, mà còn nằm ở khả năng chuyển giao ổn định trực giác vật lý đó sang các loại robot khác nhau và các môi trường tác vụ thực tế. Việc Dyna Robotics theo đuổi quy mô 10 triệu giờ video vì thế đang thu hút sự chú ý của ngành robot.