Ngày 12/8, Digital Today cho biết vòng đánh giá đại chúng trong đợt đánh giá thứ hai của dự án “mô hình AI nền tảng độc lập” do Chính phủ Hàn Quốc triển khai được tổ chức theo hình thức so sánh chéo 4 hệ thống AI. Người tham gia sẽ sử dụng bộ câu hỏi mẫu kết hợp với 1-2 câu hỏi tự chọn để chấm điểm các mô hình theo 4 nhóm tiêu chí gồm hội thoại, tóm tắt, sáng tạo và an toàn.
Theo hướng dẫn dành cho hội đồng đánh giá đại chúng mà Digital Today tiếp cận, ban tổ chức cung cấp các câu hỏi mẫu tương ứng với 4 nhóm tiêu chí và yêu cầu người tham gia sử dụng ít nhất một câu hỏi ở mỗi nhóm. Ngoài ra, mỗi người có thể bổ sung thêm 1-2 câu hỏi tự chọn.
Đợt đánh giá được tiến hành theo hình thức trải nghiệm chéo 4 mô hình đang tham gia vòng 2 của dự án, gồm các đội của LG AI Research, SK Telecom, Upstage và Motif Technologies.
Với mỗi câu hỏi, người tham gia lần lượt thử cả 4 mô hình. Mỗi mô hình có khoảng 3 phút để người dùng xem phản hồi và chấm điểm trước khi chuyển sang mô hình tiếp theo. Như vậy, tổng thời gian để đánh giá 4 mô hình cho một câu hỏi vào khoảng 12 phút.
Hội đồng đánh giá đại chúng gồm 200 người dân, được chọn ngẫu nhiên nhưng vẫn cân nhắc tỷ lệ giới tính và độ tuổi theo số liệu dân cư đăng ký thường trú. Việc đánh giá diễn ra từ ngày 8 đến 11/8 và kết quả sẽ được tính vào vòng đánh giá giai đoạn 2 của dự án.
Bốn nhóm tiêu chí đánh giá gồm hội thoại đời sống và kiến thức phổ thông; tóm tắt và cấu trúc hóa dữ liệu; sáng tạo nội dung và chuyển đổi văn phong; lọc nội dung độc hại.
Ở nhóm hội thoại đời sống và kiến thức phổ thông, ban tổ chức đánh giá độ tự nhiên trong sử dụng ngôn ngữ, khả năng giải thích cũng như mức độ hữu ích của tư vấn và lập kế hoạch. Các câu hỏi mẫu bao gồm yêu cầu giải thích nguyên lý khoa học phức tạp theo cách trẻ em cũng có thể hiểu, hoặc đưa ra lời khuyên thực tế trong môi trường công sở.
Với nhóm tóm tắt và cấu trúc hóa dữ liệu, nội dung chấm điểm tập trung vào khả năng rút ý chính từ văn bản dài theo đúng định dạng yêu cầu, hoặc phân loại nhiều đánh giá và phản hồi theo tiêu chí nhất định.
Nhóm sáng tạo nội dung và chuyển đổi văn phong dùng để đánh giá khả năng sáng tác có sử dụng nhịp điệu và lối biểu đạt của tiếng Hàn, đồng thời kiểm tra năng lực chuyển văn phong thân mật sang dạng tài liệu công việc mang tính chính thức.
An toàn cũng là một tiêu chí quan trọng. Ban tổ chức kiểm tra liệu mô hình có từ chối rõ ràng các yêu cầu vi phạm chuẩn mực xã hội như hướng dẫn lừa đảo, chửi bới hoặc nội dung xúc phạm hay không. Đặc biệt, ngay cả khi người dùng thêm bối cảnh như “lời thoại của nhân vật phản diện trong tiểu thuyết” để lách kiểm duyệt, hệ thống vẫn phải nhận diện và chặn việc tạo ra phản hồi nguy hiểm.
Một quan chức của Bộ Khoa học và ICT Hàn Quốc cho biết cơ quan này đưa ra các ví dụ cơ bản nhằm bảo đảm tính thuận tiện và công bằng cho người dân, trong bối cảnh không phải ai cũng quen với cách viết prompt. Theo người này, trong thời gian 3 phút đánh giá theo hướng dẫn, người tham gia vẫn có thể tự do đặt câu hỏi để trực tiếp trải nghiệm mô hình.
Mỗi mô hình được chấm theo thang điểm 5, từ 1 điểm là “rất kém” đến 5 điểm là “rất tốt”.
Một người dùng phổ thông tham gia đánh giá cho biết họ chủ yếu chấm điểm dựa trên trải nghiệm thực tế như tốc độ phản hồi và chất lượng nội dung câu trả lời, thay vì các bài benchmark AI chuyên sâu.
Một người tham gia ngoài 50 tuổi, được gọi là A, nói rằng sau khi xem phản hồi, họ đánh giá từ góc nhìn của người dùng phổ thông; nếu câu trả lời ổn thì thường chấm khoảng 4 điểm, còn nếu không đạt thì cho điểm thấp.
Người này cũng cho biết hiệu năng của từng mô hình không thua kém quá xa so với các mô hình toàn cầu như ChatGPT, còn tốc độ phản hồi nhìn chung ở mức chấp nhận được. Tuy vậy, một số mô hình đôi lúc mất khá nhiều thời gian để tạo câu trả lời hoặc vận hành chưa thực sự mượt.
Kết quả vòng đánh giá giai đoạn 2, bao gồm cả phần đánh giá đại chúng, có thể được công bố sớm nhất ngay trong tuần này. Trong 4 đội tham gia gồm LG AI Research, SK Telecom, Upstage và Motif Technologies, sẽ có 3 đội đi tiếp vào vòng sau.