Minh họa về Docpamo. Ảnh: ChatGPT

Cuộc đua mô hình ngôn ngữ lớn (LLM) toàn cầu đang dịch chuyển từ các hệ thống hỏi đáp sang agentic AI, tức mô hình có thể tận dụng công cụ và dữ liệu bên ngoài để thực hiện tác vụ. Trong bối cảnh đó, giới quan sát cũng đặc biệt chú ý cách dự án mô hình nền tảng AI độc lập của Chính phủ Hàn Quốc, còn gọi là Docpamo, đánh giá năng lực này ở giai đoạn 2.

Ngày 14/8, theo các cơ quan liên quan, đợt đánh giá giai đoạn 2 của Docpamo tiếp tục gồm ba phần như giai đoạn 1: benchmark, đánh giá chuyên gia và đánh giá người dùng.

Tuy nhiên, cấu trúc nhóm người dùng đã được điều chỉnh. Nếu ở giai đoạn 1 có 49 người dùng thuộc nhóm chuyên môn tham gia, thì sang giai đoạn 2, phần đánh giá người dùng được tách thành hai nhóm: người dùng chuyên môn và người dùng phổ thông gồm 200 người.

Bộ Khoa học và ICT Hàn Quốc cho biết quyền sử dụng công cụ bên ngoài sẽ được áp dụng khác nhau tùy mục tiêu của từng phần đánh giá, nhằm tách bạch năng lực cốt lõi của mô hình với năng lực agentic AI.

Theo đại diện bộ, nhóm người dùng chuyên môn bị hạn chế sử dụng công cụ bên ngoài để tập trung đánh giá năng lực LLM. Trong khi đó, ở phần đánh giá chuyên gia, việc sử dụng công cụ được cho phép tự do hơn.

Đại diện này cho biết thêm cơ quan quản lý đã xây dựng cơ chế cần thiết để kiểm chứng khách quan năng lực agentic AI của các mô hình tham gia Docpamo.

Agentic AI là dạng LLM không chỉ dừng ở việc trả lời câu hỏi, mà còn có thể chia nhỏ mục tiêu thành nhiều bước, lựa chọn công cụ phù hợp và thực hiện chuỗi tác vụ liên tiếp. Tùy nhu cầu, mô hình có thể tìm kiếm thông tin, truy vấn cơ sở dữ liệu hoặc chạy ứng dụng bên ngoài.

Benchmark cũng tiếp tục được sử dụng để đo năng lực tác nhân của mô hình. Ở đợt đánh giá giai đoạn 1, Viện Xã hội Thông tin và Trí tuệ Quốc gia Hàn Quốc (NIA) đã dùng bộ đánh giá hiệu năng mô hình AI trong nước, cùng các benchmark toàn cầu tổng hợp và benchmark theo từng hạng mục.

Trong đó, nhóm benchmark toàn cầu tổng hợp gồm 13 bài đánh giá, dùng để đo các năng lực như tác nhân, toán học, kiến thức và suy luận.

Dù vậy, để bảo đảm công bằng, Bộ Khoa học và ICT Hàn Quốc không công bố chi tiết danh mục benchmark toàn cầu được áp dụng trong đợt đánh giá thực tế.

Trên thị trường quốc tế, hiện có nhiều benchmark được dùng để đo chi tiết năng lực agentic. Tổ chức đánh giá mô hình AI Artificial Analysis xếp “tau³-Banking”, “Terminal-Bench v2.1” và “GDPval-AA v2” lần lượt là các chỉ số đo khả năng sử dụng công cụ theo hướng agentic, năng lực coding và terminal theo hướng agentic, cùng năng lực xử lý tác vụ thực tế trong công việc.

Cả bốn mô hình tham gia đánh giá giai đoạn 2 của Docpamo đều đã công bố kết quả trên ba benchmark này.

Ở GDPval-AA, chỉ số đo năng lực xử lý tác vụ thực tế trong công việc, Motif Technologies với “Motif 3” đạt 39%, Upstage với “Solar Open2” đạt 31%, SK Telecom với “A.X K2” đạt 30% và LG AI Research với “K-EXAONE 2.0” đạt 24%.

Với tau³-Banking, benchmark đo khả năng tận dụng công cụ bên ngoài, Motif 3 đạt 35%, Solar Open2 đạt 22%, A.X K2 đạt 16% và K-EXAONE 2.0 đạt 12%.

Trong khi đó, ở Terminal-Bench v2.1, benchmark đo năng lực coding và sử dụng terminal theo hướng agentic, Motif 3 đạt 75%, Solar Open2 đạt 44%, K-EXAONE 2.0 đạt 40% và A.X K2 đạt 39%.

Dù vậy, các benchmark này chỉ phản ánh một phần năng lực tác nhân của mô hình trong những môi trường cụ thể. Việc diễn giải điểm số của từng benchmark như thước đo cho toàn bộ hiệu năng agentic hoặc khả năng ứng dụng trong công nghiệp vẫn có những giới hạn nhất định.

Theo giới chuyên gia, yếu tố quan trọng hơn là quy trình kiểm chứng khả năng ứng dụng trong môi trường làm việc thực tế, thay vì chỉ nhìn vào kết quả benchmark.

Choi Jae-sik, giáo sư danh dự tại KAIST, nhận định rằng trong cuộc cạnh tranh AI toàn cầu, agentic AI đang là trọng tâm trước mắt. Vì vậy, các mô hình nội địa cũng cần nâng hiệu năng lên mức có thể triển khai tại hiện trường. Ông nhấn mạnh cần kiểm chứng bằng thực nghiệm ở những lĩnh vực cụ thể như coding hoặc tự động hóa công việc, thay vì dừng lại ở điểm benchmark.

Từ khóa

#Docpamo #agentic AI #LLM #Bộ Khoa học và ICT Hàn Quốc #benchmark #Artificial Analysis #KAIST #Motif 3 #Solar Open2 #A.X K2 #K-EXAONE 2.0
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.