Naver đang siết quyền khai thác dữ liệu từ các dịch vụ của mình khi cấm thu thập trái phép bài viết trên Naver Cafe và thu hẹp phạm vi sử dụng dữ liệu từ Search API. Theo đó, dữ liệu này không còn được phép dùng để huấn luyện AI, tạo câu trả lời bằng AI hoặc bán lại cho bên thứ ba.
Động thái trên cho thấy công ty bắt đầu quản lý chặt hơn việc bên ngoài khai thác dữ liệu tìm kiếm và nội dung, trong bối cảnh đây ngày càng trở thành tài sản cốt lõi của cuộc đua AI.
◆ Chặn hành vi sao chép bài viết từ Naver Cafe lên website bên ngoài
Gần đây, Naver ghi nhận một số website bên ngoài tự động thu thập bài viết mua bán đồ cũ và các nội dung chia sẻ thông tin trên Naver Cafe để hiển thị lại trong dịch vụ của họ.
Chẳng hạn, khi người dùng đăng tin mua hoặc bán trong một cộng đồng giao dịch máy ảnh trên Naver Cafe, website bên ngoài có thể lấy tiêu đề bài viết và thông tin sản phẩm để đăng lại dưới dạng nội dung như “tổng hợp giao dịch máy ảnh cũ”. Người dùng bấm vào sẽ được dẫn về bài gốc trên Cafe, nhưng bên vận hành website vẫn có thể làm dày nội dung để hút lưu lượng tìm kiếm và traffic mà không cần tự tạo nội dung hay trực tiếp thu hút người dùng.
Naver gần đây đã thông báo trên Cafe rằng việc thu thập hàng loạt bài viết và bình luận, hoặc sao chép sang website bên ngoài khi chưa có sự đồng ý của thành viên và của Cafe, đều bị cấm. Công ty cũng liệt kê các hành vi bị nghiêm cấm như thu thập tự động bằng crawler, bot, script; truy cập dữ liệu bằng cách không chính thức; và né tránh các biện pháp ngăn chặn.
Theo Naver, dữ liệu đã thu thập không được đăng lại trên dịch vụ bên ngoài, cũng không được xử lý rồi cung cấp lại. Với các doanh nghiệp đang sử dụng dữ liệu từ Cafe, công ty yêu cầu dừng thu thập và xóa dữ liệu; đồng thời sẽ áp dụng biện pháp pháp lý nếu xác định có hành vi xâm phạm quyền.
Naver cho biết thông báo lần này không trực tiếp nhắm vào việc huấn luyện AI. Công ty nói hoạt động AI crawling đối với nội dung do người dùng tạo đã cơ bản bị chặn từ năm ngoái, còn thông báo mới chủ yếu nhằm xử lý các trường hợp thu thập trái phép gần đây. Tuy nhiên, song song với đó, Naver cũng bắt đầu siết việc sử dụng dữ liệu Search API cho AI bên ngoài.
◆ Search API không được dùng để huấn luyện AI hay tạo câu trả lời
Điều khoản sửa đổi của Search API trên Naver Developer Center sẽ có hiệu lực từ ngày 7/9. Theo quy định mới, Search API chỉ được phép sử dụng cho mục đích hiển thị kết quả tìm kiếm của Naver.
Đây là kênh cho phép các nhà phát triển bên ngoài gọi kết quả tìm kiếm theo từng mảng như tin tức, tài liệu web, blog, cafe và Knowledge iN của Naver lên website hoặc ứng dụng của họ.
Theo điều khoản sửa đổi, dữ liệu nhận qua Search API không được đưa vào AI để huấn luyện, cải thiện hoặc đánh giá mô hình. Việc sử dụng dữ liệu này để tạo câu trả lời hoặc đầu ra do AI sinh ra cũng bị hạn chế. Nói cách khác, Naver không chỉ chặn việc dùng dữ liệu để huấn luyện trực tiếp mô hình, mà còn ngăn cả hình thức mỗi khi nhận câu hỏi từ người dùng thì gọi kết quả tìm kiếm của Naver để tạo câu trả lời.
Ngoài ra, các hành vi cung cấp hoặc bán dữ liệu tìm kiếm cho bên thứ ba, gắn quảng cáo vào trang sử dụng kết quả tìm kiếm, hoặc tạo doanh thu riêng thông qua Search API cũng bị cấm. Naver đang dựng rào cản đối với việc dùng kết quả tìm kiếm như nguồn lực cho các dịch vụ hay mô hình kinh doanh khác, vượt ra ngoài mục đích hiển thị đơn thuần.
Cùng với việc sửa điều khoản, Naver cũng đang tái cấu trúc hệ thống cung cấp Search API. Từ tháng 7, công ty đã dừng tiếp nhận đăng ký mới đối với Search API, Search Term Trend và Shopping Insight API, đồng thời bắt đầu chuyển sang “Naver API Hub” của Naver Cloud.
Các Search API trong mảng mua sắm, sách và tài liệu chuyên ngành không nằm trong diện chuyển đổi và đã chấm dứt dịch vụ. Trên API Hub, từ ngày 20/9, các điều khoản sửa đổi, bao gồm hạn chế sử dụng cho AI, cũng sẽ được áp dụng.
◆ Dữ liệu tìm kiếm và nội dung ngày càng quan trọng với năng lực cạnh tranh AI
Naver mở Search API từ năm 2006 để các nhà phát triển bên ngoài có thể tích hợp kết quả tìm kiếm vào dịch vụ của họ. Tuy nhiên, khi AI tạo sinh lan rộng, kết quả tìm kiếm không còn chỉ là thông tin để hiển thị, mà đã trở thành đầu vào quan trọng cho việc tạo câu trả lời bằng AI và cải thiện mô hình.
Naver cũng xem dữ liệu và nội dung là hạt nhân trong năng lực cạnh tranh AI. Tại một media roundtable hồi tháng 5, Kim Gwang-hyun, Giám đốc Dữ liệu & Nội dung (CDO) của Naver, cho biết trọng tâm cạnh tranh của các nền tảng AI đang dịch chuyển từ hiệu năng mô hình sang chất lượng dữ liệu và năng lực dịch vụ.
Dịch vụ tìm kiếm AI “AI Tab” của Naver trả lời câu hỏi của người dùng và kết nối tới hoạt động mua hàng, đặt chỗ dựa trên dữ liệu tích lũy từ tìm kiếm tổng hợp, mua sắm, địa điểm, blog và cafe. Khi dữ liệu tìm kiếm và nội dung đã trở thành nền tảng cho dịch vụ AI nội bộ, Naver đang siết việc AI bên ngoài sử dụng các nguồn dữ liệu này để tạo câu trả lời và phát triển dịch vụ.
Dù vậy, Naver không dừng hoàn toàn việc cung cấp dữ liệu tìm kiếm ra bên ngoài. Công ty vẫn duy trì mục đích cơ bản là hiển thị kết quả trên dịch vụ bên ngoài, nhưng hạn chế việc dùng dữ liệu cho huấn luyện AI hoặc các hoạt động kiếm tiền riêng.
Một nguồn tin trong ngành nhận định rằng, khi AI tạo sinh mở rộng, dữ liệu tìm kiếm và nội dung do người dùng tạo ra đã trở thành tài sản cốt lõi của các nền tảng, kéo theo thay đổi trong phạm vi mở dữ liệu. Theo người này, Naver không đóng hẳn việc cung cấp dữ liệu, mà muốn trực tiếp kiểm soát cách các doanh nghiệp bên ngoài sử dụng dữ liệu đó cho AI hoặc cho mô hình kinh doanh riêng.