Viện Khoa học và Công nghệ Tiên tiến Hàn Quốc (KAIST) ngày 4/9 cho biết đã phát triển SafeQL, công nghệ giúp AI sửa đúng phần bị lỗi trong câu truy vấn cơ sở dữ liệu của doanh nghiệp thay vì phải tạo lại toàn bộ từ đầu.
Theo KAIST, nhóm nghiên cứu do giáo sư Kim Min-su, Khoa Khoa học Máy tính, dẫn dắt đã xây dựng SafeQL để xử lý lỗi phát sinh trong quá trình chuyển câu hỏi ngôn ngữ tự nhiên thành câu truy vấn SQL (Structured Query Language).
Text-to-SQL gần đây được ứng dụng ngày càng nhiều, cho phép AI biến những câu hỏi thông thường như “Sản phẩm bán chạy nhất năm ngoái là gì?” thành câu lệnh SQL nhằm truy xuất dữ liệu doanh thu, khách hàng hoặc tồn kho của doanh nghiệp.
Tuy nhiên, khi AI sử dụng bảng hoặc trường không tồn tại trong cơ sở dữ liệu, hoặc thiết lập liên kết dữ liệu sai, câu truy vấn có thể không thực thi được. Trước đây, mỗi khi phát sinh lỗi như vậy, hệ thống thường phải gửi lại toàn bộ câu SQL cho mô hình ngôn ngữ lớn (LLM) để sinh lại từ đầu.
Cách làm này không chỉ làm tăng thời gian và chi phí do phải gọi LLM lặp lại, mà còn có thể tạo ra thêm lỗi mới.
SafeQL được thiết kế để tránh tình trạng đó. Thay vì tạo lại toàn bộ câu truy vấn, công nghệ này dựa trên thông tin lỗi và dữ liệu đang có trong cơ sở dữ liệu để xác định chính xác phần sai và sửa từng bước. Hệ thống có thể xử lý nhiều tình huống như thiếu bảng hoặc trường, thiếu liên kết dữ liệu, hay dùng sai hàm và giá trị truy vấn.
Nhóm nghiên cứu áp dụng phương pháp “Safe Query Space”, tức không gian truy vấn an toàn, để rà soát trước các phương án sửa có kết quả gần nhất với câu SQL do AI tạo ban đầu. Những phương án không phù hợp về kiểu dữ liệu hoặc ít liên quan sẽ bị loại sớm nhằm rút ngắn thời gian sửa lỗi.
SafeQL được triển khai trực tiếp trên PostgreSQL, hệ quản trị cơ sở dữ liệu mã nguồn mở. Chỉ khi việc sửa từng phần không đủ để khắc phục lỗi, hệ thống mới gọi lại LLM, qua đó hạn chế những lần sử dụng AI không cần thiết.
Nhóm nghiên cứu đã đánh giá SafeQL trên hai bộ benchmark Text-to-SQL quốc tế là BIRD và Spider. Trên BIRD, công nghệ này sửa được tới 87,4% lỗi thực thi trong các câu SQL ban đầu, đồng thời giảm tối đa 15,1 lần lượng token sử dụng và rút ngắn tối đa 29,6 lần thời gian sửa lỗi so với cách tiếp cận trước đây.
Trên Spider, hệ thống đạt độ chính xác thực thi 91,7%, cho thấy hiệu quả của phương pháp.
Theo nhóm nghiên cứu, SafeQL có thể được ứng dụng trong AI agent cho doanh nghiệp, phân tích dữ liệu bằng ngôn ngữ tự nhiên, business intelligence và copilot phân tích dữ liệu.
Giáo sư Kim Min-su cho biết để AI có thể đảm nhiệm công việc thực tế trong doanh nghiệp, khả năng tìm đúng dữ liệu cần thiết là yếu tố then chốt. Theo ông, SafeQL có thể đồng thời giảm lỗi, rút ngắn thời gian xử lý và hạ chi phí vận hành AI.
Nghiên cứu này có Lee Geon-ho, Khoa Khoa học Máy tính thuộc KAIST, là tác giả thứ nhất, còn giáo sư Kim Min-su là tác giả liên hệ. Kết quả nghiên cứu sẽ được trình bày tại VLDB, hội nghị quốc tế về cơ sở dữ liệu tổ chức ở Boston, Mỹ.