KAIST cho biết nhóm nghiên cứu do giáo sư Noh Yong-man, Khoa Kỹ thuật Điện và Điện tử, dẫn dắt đã phát triển hai kỹ thuật mới giúp AI đa phương thức giảm nhầm lẫn khi xử lý dữ liệu từ nhiều cảm biến, đồng thời hạn chế hiện tượng “ảo giác” khi mô hình đưa ra thông tin không tồn tại.
Theo thông tin công bố ngày 31/7, hai kỹ thuật này được thiết kế để nâng khả năng hiểu dữ liệu cảm biến của mô hình ngôn ngữ lớn đa phương thức (MLLM), đồng thời giảm sự can nhiễu giữa thông tin hình ảnh và âm thanh.
AI đa phương thức có thể xử lý đồng thời văn bản, hình ảnh, giọng nói và nhiều loại dữ liệu cảm biến khác. Tuy nhiên, một số mô hình hiện nay vẫn gặp hạn chế trong việc phân biệt đặc tính riêng của từng cảm biến, thậm chí đưa ra câu trả lời như thể thông tin từ một giác quan đã được xác nhận bởi giác quan khác.
Để khắc phục vấn đề này, nhóm nghiên cứu đã phát triển kỹ thuật tối ưu hóa mang tên DNA. Công nghệ này giúp AI diễn giải chính xác hơn ý nghĩa vật lý của dữ liệu thu được từ các cảm biến như ảnh nhiệt, ảnh độ sâu và ảnh X-quang.
Ví dụ, với ảnh nhiệt, mô hình có thể nhầm vùng sáng là nguồn sáng trong ảnh thông thường, thay vì hiểu đó là khu vực có nhiệt độ cao. Nhóm nghiên cứu đã huấn luyện AI tập trung vào những tình huống dễ sai, qua đó cải thiện khả năng phân biệt các thông tin vật lý như nhiệt độ hay khoảng cách do cảm biến ghi nhận.
Nhờ vậy, AI có thể khai thác hiệu quả hơn dữ liệu từ nhiều cảm biến để nhận diện vật thể chính xác hơn, kể cả trong môi trường mà camera thông thường khó quan sát như bóng tối hoặc có khói.
Bên cạnh DNA, nhóm cũng phát triển kỹ thuật MAD nhằm giảm hiện tượng ảo giác nảy sinh khi thông tin thị giác và thính giác ảnh hưởng lẫn nhau.
Theo KAIST, MAD cho phép AI tự xác định nên ưu tiên dữ liệu hình ảnh hay âm thanh trước khi đưa ra phản hồi, đồng thời tập trung vào nguồn thông tin có mức độ liên quan cao hơn. Cách tiếp cận này giúp giảm đáng kể tình trạng nhầm lẫn và ảo giác mà không cần huấn luyện lại mô hình từ đầu.
Nhóm nghiên cứu cho biết DNA giúp cải thiện hiệu quả xử lý nhiều loại dữ liệu cảm biến ngay cả khi lượng dữ liệu huấn luyện hạn chế, trong khi MAD có thể được bổ sung trực tiếp vào các hệ thống AI hiện có.
KAIST kỳ vọng các công nghệ này có thể được ứng dụng trong xe tự lái, robot cứu hộ, drone ảnh nhiệt, môi trường công nghiệp và cả AI y tế, nơi mô hình cần phân tích đồng thời nhiều loại hình ảnh y khoa.
Giáo sư Noh Yong-man cho rằng để AI đa phương thức có thể hoạt động tin cậy trong môi trường thực tế, điều quan trọng là phải hiểu đúng đặc tính của từng cảm biến và tránh nhầm lẫn giữa các nguồn dữ liệu giác quan. Ông nói nhóm nghiên cứu đã xây dựng được nền tảng giúp giảm thiên lệch giác quan và ảo giác của AI mà không cần tái huấn luyện quy mô lớn.
Trong hai nghiên cứu này, nghiên cứu sinh tiến sĩ Jeong Sang-yoon, Khoa Kỹ thuật Điện và Điện tử của KAIST, là tác giả thứ nhất. Yu Young-jun là đồng tác giả thứ nhất của nghiên cứu về DNA.
Nghiên cứu về MAD đã được trình bày tại hội nghị quốc tế IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) hồi tháng 6. Trong khi đó, nghiên cứu về DNA đã được công bố trên tạp chí IEEE Transactions on Image Processing.
Dự án được triển khai với sự hỗ trợ từ chương trình phát triển công nghệ lõi AI lấy con người làm trung tâm của Viện Lập kế hoạch và Đánh giá Công nghệ Thông tin - Truyền thông (IITP), cùng các nhiệm vụ thuộc Trung tâm Nghiên cứu chuyên biệt về trí tuệ nhân tạo của Viện Nghiên cứu Phát triển Quốc phòng.