Hình ảnh đầu vào, kết quả tái dựng của KATok và các token được sử dụng trong quá trình tái dựng. Việc lược bỏ các token được tô đen không làm giảm chất lượng nhưng giúp cải thiện hiệu quả tính toán. Ảnh: Kakao

Kakao cho biết sẽ giới thiệu KATok, công nghệ token hóa video thích ứng dành cho AI, tại hội nghị thị giác máy tính quốc tế ECCV 2026. Công nghệ này cho phép mô hình tự điều chỉnh lượng token theo mức độ phức tạp của từng cảnh, qua đó cắt giảm chi phí tính toán trong quá trình tạo video. Theo kết quả thử nghiệm, tốc độ huấn luyện mô hình tạo video tăng khoảng 6,9 lần, trong khi tốc độ tạo video tăng khoảng 3,2 lần so với phương pháp hiện có.

Ngày 9/9, Kakao cho biết KATok là viết tắt của “Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation” và sẽ được trình bày tại ECCV 2026.

ECCV được xem là một trong ba hội nghị hàng đầu thế giới về thị giác máy tính, cùng với CVPR và ICCV. Sự kiện này diễn ra tại Thụy Điển đến hết ngày 12/9. Theo kế hoạch, Lee Yeon-kyeong, kỹ sư nghiên cứu tại Kakao Research, sẽ công bố bài báo vào ngày 10/9 theo giờ địa phương.

KATok là công nghệ giúp AI tự động điều chỉnh số lượng token dùng cho tính toán dựa trên chuyển động và lượng thông tin trong video. Với những cảnh có nhiều chuyển động hoặc chứa nhiều thông tin, hệ thống sẽ phân bổ nhiều token hơn. Ngược lại, ở các khu vực ít thay đổi, công nghệ này cắt giảm các token trùng lặp để tối ưu xử lý.

Theo Kakao, các phương pháp token hóa video truyền thống thường nén dữ liệu theo một tỷ lệ cố định, bất kể nội dung của video. Vì vậy, ngay cả những cảnh ít chuyển động vẫn tạo ra lượng token tương đương với các cảnh phức tạp hơn. Khi độ phân giải và thời lượng video tăng lên, hệ thống phải xử lý thêm nhiều token không cần thiết, làm chi phí tính toán đội lên đáng kể.

Để khắc phục hạn chế này, Kakao tập trung vào việc giảm dữ liệu trùng lặp giữa các khung hình nhằm hạ gánh nặng tính toán. Hệ thống được thiết kế để AI tự xác định mức tính toán cần thiết tùy theo độ phức tạp của video theo không gian và thời gian, thay vì ấn định trước số lượng token.

Kết quả thử nghiệm cho thấy KATok có thể tái dựng video với số token ít hơn so với Dense Tokenizer. Khi được áp dụng cho toàn bộ quy trình tạo video, công nghệ này giúp tăng tốc độ huấn luyện mô hình khoảng 6,9 lần và tăng tốc độ xử lý trong giai đoạn tạo video khoảng 3,2 lần.

Kakao cho biết hiệu quả không chỉ đến từ khâu nén token mà còn nhờ việc tích hợp trực tiếp công nghệ này vào mô hình tạo video, qua đó nâng hiệu quả tính toán của toàn bộ quy trình. Trong thời gian tới, công ty dự kiến tiếp tục nâng cấp KATok để ứng dụng trong môi trường tạo video có độ phân giải cao và thời lượng dài.

Choi Dong-jin, phụ trách mảng thành tựu mô hình Applied AI tại Kakao, cho biết: “Trong các môi trường đòi hỏi năng lực tính toán lớn như video độ phân giải cao và thời lượng dài, hiệu quả cắt giảm chi phí tính toán của KATok sẽ càng rõ rệt.” Ông nói thêm: “Chúng tôi sẽ tiếp tục kiểm chứng tính phổ quát của công nghệ này trên nhiều mô hình tạo video AI khác nhau, qua đó phát triển KATok thành công nghệ nền tảng cho tạo video quy mô lớn.”

Từ khóa

#Kakao #trí tuệ nhân tạo #video AI #token #KATok #ECCV 2026 #thị giác máy tính
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.