Logo Kakao. Ảnh: Kakao

Kakao ngày 8/10 cho biết đã giới thiệu tại hội nghị quốc tế COLM 2026 loạt công nghệ nhằm giảm chi phí huấn luyện các mô hình AI quy mô lớn, đồng thời tinh gọn kích thước mô hình mà vẫn cải thiện hiệu năng.

Theo công ty, các nội dung được trình bày gồm kỹ thuật tối ưu huấn luyện cho mô hình hỗn hợp chuyên gia (MoE) quy mô lớn và kết quả nghiên cứu về kiến trúc mô hình tinh gọn. Kakao công bố các kết quả này tại phiên chính của hội nghị và workshop về tokenization mang tên Tokshop.

COLM là hội nghị quốc tế chuyên về mô hình ngôn ngữ lớn (LLM) và các công nghệ mô hình hóa ngôn ngữ, được thành lập năm 2024.

Tại phiên chính, Kakao giới thiệu một phương pháp dự đoán learning rate tối ưu cho mô hình MoE quy mô lớn với chi phí chỉ tương đương khoảng 1% tổng chi phí huấn luyện. Đây là tham số quyết định mức độ cập nhật trọng số trong quá trình huấn luyện mô hình.

Công ty cho biết đã điều chỉnh kỹ thuật “mu-parameterization” — vốn thường được dùng để mở rộng thiết lập huấn luyện từ mô hình nhỏ sang mô hình lớn — để phù hợp với kiến trúc MoE. Từ đó, Kakao tăng dần quy mô mô hình và số lượng token huấn luyện nhằm tìm ra learning rate tối ưu, đồng thời kiểm tra liệu các thiết lập rút ra từ giai đoạn huấn luyện ngắn có còn hiệu quả khi mở rộng lên quy mô lớn hay không.

Phương pháp này cũng đã được áp dụng trong quá trình tiền huấn luyện mô hình “Kanana-2.6-155b-a17b”. Kakao cho biết nhờ đó, công ty có thể duy trì quá trình huấn luyện ổn định ở quy mô tới 10 nghìn tỷ token.

Tại Tokshop, Kakao tiếp tục công bố kiến trúc “BBT” với mục tiêu vừa giảm kích thước mô hình vừa cải thiện hiệu năng. Nếu các mô hình dựa trên byte pair encoding (BPE) lưu trữ thông tin theo từ hoặc mảnh từ, thì BBT được thiết kế để khai thác đơn vị nhỏ hơn là byte nhưng vẫn giữ được lợi thế xử lý theo cụm nhiều ký tự.

Trong các thử nghiệm đối chiếu, số tham số của mô hình giảm từ 20,2% đến 40,4%, trong khi hiệu năng kiểm thử tăng từ 2,7% đến 6,6%. Kakao cũng cho biết mô hình cải thiện khả năng xử lý lỗi chính tả và nhiễu ký tự, đồng thời tăng hiệu quả chuyển giao sang các ngôn ngữ chưa xuất hiện trong dữ liệu huấn luyện.

Theo đánh giá của công ty, BBT có thể giúp giảm áp lực bộ nhớ trong môi trường on-device, đồng thời duy trì hiệu năng ổn định trong các tình huống nhập liệu đa ngôn ngữ hoặc hội thoại thường xuyên phát sinh lỗi chính tả.

Trong thời gian tới, Kakao dự kiến mở rộng phạm vi ứng dụng của các nghiên cứu này sang nhiều kiến trúc mô hình khác nhau, cũng như các môi trường đa phương thức và đa ngôn ngữ, qua đó tiếp tục hạ chi phí huấn luyện LLM quy mô lớn.

Đại diện Kakao cho biết nghiên cứu lần này mở ra hướng tiếp cận giúp giảm chi phí huấn luyện và vận hành mà vẫn duy trì, thậm chí cải thiện hiệu năng mô hình AI. Công ty cũng nhấn mạnh sẽ tiếp tục mở rộng nghiên cứu để nâng khả năng ứng dụng vào các dịch vụ thực tế.

Từ khóa

#Kakao #trí tuệ nhân tạo #AI #LLM #MoE #COLM 2026 #tối ưu huấn luyện #tinh gọn mô hình #tokenization #on-device
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.