Bốn đội tham gia dự án “mô hình AI nền tảng độc lập” do chính phủ thúc đẩy đã hoàn tất nộp kết quả cho vòng đánh giá 2. Trong số này, hai tập đoàn lớn chọn hướng mở rộng mạnh quy mô mô hình để tiệm cận các mô hình open-weight hàng đầu thế giới, trong khi hai startup ưu tiên hiệu quả tính toán và khả năng xử lý tác vụ thực tế.
Nguồn tin trong ngành cho biết ngày 4/8, Motif Technologies đã nộp báo cáo kết quả cho vòng đánh giá 2 vào ngày 3/8. Trước đó, LG AI Research, SK Telecom và Upstage cũng đã hoàn tất nộp kết quả, khép lại giai đoạn chuẩn bị của cả bốn đội.
Cả bốn đơn vị đều sử dụng kiến trúc Mixture of Experts (MoE). Với kiến trúc này, mô hình được chia thành nhiều mô-đun tính toán gọi là “expert”, nhưng ở mỗi truy vấn chỉ một phần cần thiết được kích hoạt. Cách tiếp cận này cho phép tăng tổng dung lượng mô hình mà vẫn giảm lượng tính toán thực tế khi tạo câu trả lời.
Vì vậy, khi đánh giá mô hình MoE, cần nhìn đồng thời hai chỉ số: tổng số tham số, phản ánh quy mô toàn bộ mô hình, và số tham số được kích hoạt, tức phần thật sự tham gia xử lý mỗi truy vấn.
Hai tập đoàn lớn đưa ra các mô hình cỡ trung đến lớn với tổng tham số từ 600B trở lên. Trong nhóm mô hình toàn cầu cùng quy mô, DeepSeek R1 hiện có tổng 671B tham số và 37B tham số kích hoạt. K-Exaone 2.0 của LG AI Research có tổng 750B tham số, trong đó khoảng 37B được kích hoạt; còn A.X K2 của SK Telecom có tổng 688B tham số, với 33B tham số kích hoạt cho mỗi token.
Trong khi đó, hai startup chọn quy mô quanh mốc 300B. Solar Open 2 của Upstage có tổng 250B tham số và 15B tham số kích hoạt. Motif 3 Preview Beta của Motif Technologies đạt tổng 314B tham số, với khoảng 13B tham số kích hoạt. Quy mô này tương đương DeepSeek V4 Flash Preview được công bố hồi tháng 4, với tổng 284B tham số và 13B tham số kích hoạt.
LG AI Research là đơn vị tăng quy mô mạnh nhất ở vòng này. Tổng số tham số của K-Exaone 2.0 đã tăng hơn ba lần so với mô hình ở vòng 1, khi phiên bản trước dừng ở 236B tham số.
Công ty tăng số lớp xử lý thông tin từ 48 lên 78, đồng thời nâng số expert trong mỗi lớp MoE từ 128 lên 256. Số tham số kích hoạt cũng tăng từ 23B lên 37B.
LG AI Research lựa chọn phương án “upcycling”, tức dùng trọng số đã được học từ mô hình cũ làm nền tảng cho mô hình mới. Theo công ty, cách làm này giúp giữ lại tri thức của phiên bản trước, đồng thời mở rộng độ sâu tính toán và dung lượng của mô hình.
Trong các bài đánh giá nội bộ, hiệu năng của mô hình cũng được cải thiện. K-Exaone 2.0 đạt điểm trung bình 70,1 trên 24 chỉ số, tăng hơn 10% so với mức 63,3 của mô hình vòng 1. Riêng trung bình của ba chỉ số chính liên quan đến lập trình và agentic coding tăng khoảng 30%.
LG AI Research cho biết sẽ dùng mô hình lần này làm cơ sở để tiến lên giai đoạn tiếp theo, nơi công ty dự kiến thử phát triển mô hình quy mô nghìn tỷ tham số.
Im Woo-hyeong, đồng trưởng nhóm nghiên cứu tại LG AI Research, cho biết ý nghĩa lớn nhất là đội ngũ trong nước đã tự hoàn tất toàn bộ quy trình, từ thiết kế mô hình 750B, huấn luyện dữ liệu, huấn luyện phân tán đến xây dựng môi trường suy luận. Theo ông, nhóm nghiên cứu hiện đã có năng lực cạnh tranh ở cùng phân khúc với các mô hình AI tiên phong trên thế giới.
SK Telecom lại tập trung vào việc giảm gánh nặng tính toán và bộ nhớ trong khâu vận hành, dù quy mô của A.X K2 đã tăng khoảng 30% so với vòng 1. Nhờ tăng số expert, tổng số tham số của mô hình tăng từ 519B lên 688B, nhưng số tham số kích hoạt cho mỗi token vẫn được giữ ở mức 33B.
Ở phần dữ liệu huấn luyện, SK Telecom cũng ưu tiên chất lượng hơn số lượng. Nếu phiên bản trước được huấn luyện trên 10 nghìn tỷ token, thì A.X K2 dùng khoảng 8,5 nghìn tỷ token. Đổi lại, ở giai đoạn cuối, mô hình được bổ sung nhiều dữ liệu có chất lượng và độ khó cao hơn.
Công ty cũng tìm cách giảm chi phí tính toán khi xử lý tài liệu dài. Cơ chế Sparse Gate Attention (SGA) do SK Telecom phát triển chỉ chọn tham chiếu đến những thông tin có mức liên quan cao với câu hỏi hiện tại. Nhờ không phải rà soát toàn bộ tài liệu với cùng một trọng số, gánh nặng xử lý giảm đáng kể khi đầu vào kéo dài.
Theo báo cáo kỹ thuật của A.X K2, sau khi áp dụng SGA, điểm số ở bài kiểm tra hiểu văn bản dài vẫn được giữ ở mức tương đương. Đồng thời, tốc độ xử lý đầu vào dài được cải thiện, còn thời gian bắt đầu phản hồi và thời gian tạo các token tiếp theo đều giảm so với phiên bản trước.
SK Telecom cho biết sẽ tiếp tục mở rộng mô hình kế tiếp lên quy mô nghìn tỷ tham số, đồng thời triển khai lượng tử hóa và tối ưu hóa trên bộ xử lý thần kinh nội địa (NPU). Sau khi lượng tử hóa, dung lượng bộ nhớ cần cho vận hành của A.X K2 chỉ còn khoảng một phần ba so với A.X K1.
Đại diện SK Telecom nhận định ngày càng có nhiều mô hình mã nguồn mở vượt mốc 1 nghìn tỷ tham số, khiến việc phát triển mô hình lớn trở thành yêu cầu cần thiết để cạnh tranh toàn cầu. Theo công ty, các biện pháp tối ưu vận hành như lượng tử hóa có thể giúp giảm đáng kể gánh nặng khi quy mô mô hình tiếp tục tăng.
Upstage cho biết Solar Open 2 hỗ trợ cửa sổ ngữ cảnh tối đa 1 triệu token, đồng thời vẫn giảm chi phí xử lý văn bản dài. Để làm được điều này, công ty kết hợp linear attention, dùng để nén ngữ cảnh trước đó, với softmax attention truyền thống, vốn tính toán quan hệ chi tiết giữa các từ. Theo Upstage, so với việc chỉ dùng phương pháp truyền thống ở mọi lớp, cách tiếp cận này giúp giảm bộ nhớ và lượng tính toán cho xử lý văn bản dài xuống còn khoảng một phần tư.
Công ty cũng nhấn mạnh lợi thế ở tokenizer, công cụ chia câu tiếng Hàn thành các đơn vị nhỏ để AI xử lý. Trong bộ đánh giá nội bộ về đầu vào cho các tác vụ văn phòng bằng tiếng Hàn, mỗi token chứa 4,41 byte thông tin, cao hơn khoảng 24% so với mô hình toàn cầu hiệu quả nhất trong nhóm được đối chiếu. Upstage cho rằng nhờ xử lý cùng một tài liệu với ít token hơn, chi phí có thể giảm trong các tác vụ kéo dài, nơi hội thoại và lịch sử làm việc liên tục tích lũy theo thời gian.
Ngoài ra, Upstage còn tập trung nâng cao năng lực AI agent trong thực thi công việc. Công ty tích hợp kết quả huấn luyện từ 12 mô hình chuyên biệt theo từng tác vụ như sử dụng công cụ, lập trình và soạn thảo tài liệu vào một mô hình duy nhất. Mục tiêu là giúp mô hình hoàn thành trọn vẹn những nhiệm vụ đòi hỏi suy luận nhiều bước và gọi công cụ liên tiếp.
Trong môi trường đánh giá nội bộ của Upstage, Solar Open 2 đạt điểm trung bình 85,4 trên 9 benchmark tiếng Hàn, nhỉnh hơn mức 84,9 của DeepSeek V4 Flash Preview. Ở các bài đánh giá tiếng Anh, tùy từng hạng mục như tri thức và suy luận, lập trình hay agent, kết quả giữa hai mô hình có lúc nghiêng về bên này, có lúc nghiêng về bên kia. Upstage cho biết trọng tâm của họ là nâng năng lực tiếng Hàn và khả năng xử lý tác vụ thực tế trong cùng quy mô tham số.
Kim Seong-hun, CEO Upstage, cho biết Solar Open 2 không được xây dựng chỉ để tối ưu điểm benchmark, mà hướng tới khả năng để agent tự hoàn thành công việc trong môi trường vận hành thực tế.
Motif Technologies nhấn mạnh điểm khác biệt nằm ở hiệu quả thiết kế mô hình. Trước khi nộp mô hình cho vòng đánh giá 2, Motif 3 Beta từng đạt 44 điểm trên chỉ số tổng hợp AAII do tổ chức đánh giá AI toàn cầu Artificial Analysis công bố, dựa trên kết quả cộng gộp từ 9 bài đánh giá. Mức này ngang với DeepSeek V4 Pro (Max), dù mô hình của DeepSeek có tổng 1.600B tham số, lớn gấp khoảng 5 lần Motif 3.
Motif 3 Beta có tổng 314B tham số nhưng chỉ kích hoạt khoảng 13B. So với mức 49B tham số kích hoạt của DeepSeek V4 Pro, lượng tính toán thực tế được dùng để tạo câu trả lời chỉ bằng khoảng một phần tư. Theo Motif Technologies, việc đạt cùng điểm tổng hợp với một mô hình nhỏ hơn và dùng ít tài nguyên tính toán kích hoạt hơn cho thấy hiệu quả thiết kế của mô hình.
Công ty cho biết kết quả này đến từ một mô hình “from scratch”, tức tự thiết kế kiến trúc và huấn luyện ngay từ đầu, thay vì dựa trên cấu trúc của các mô hình mã nguồn mở ở nước ngoài. Theo Motif Technologies, hơn 30 nhà nghiên cứu đã sử dụng khoảng 700 GPU để phát triển mô hình preview trong 5 tháng.
Tuy nhiên, đây mới là kết quả đo được trên một mô hình ở giai đoạn trung gian, chưa phải mô hình cuối cùng đã nộp cho vòng đánh giá 2. Hiệu năng của phiên bản nộp cuối cùng hiện vẫn chưa được công bố.
Lim Jeong-hwan, CEO Motif Technologies, cho biết công ty kỳ vọng hiệu năng sẽ tiếp tục được cải thiện so với bản beta và xem kết quả hiện tại là bước đệm để tiến tới các mô hình dẫn đầu thế giới. Ông nói doanh nghiệp sẽ tiếp tục đầu tư R&D nhằm nâng cấp năng lực mô hình và chứng minh sức cạnh tranh của công nghệ AI Hàn Quốc trên thị trường toàn cầu.
Theo kế hoạch, chính phủ sẽ tổng hợp kết quả benchmark, đánh giá của chuyên gia và đánh giá từ 200 người dùng để chọn ra 3 trong 4 đội bước tiếp vào giai đoạn sau. Phần đánh giá của nhóm người dùng sẽ diễn ra từ ngày 8 đến 11/8.