Nvidia vừa công bố Kumo Tabular, một mô hình AI mã nguồn mở dành cho dữ liệu dạng bảng, trên nền tảng chia sẻ mô hình Hugging Face. Theo hãng, mô hình có thể dự báo trực tiếp trên dữ liệu dạng bảng mà không cần huấn luyện bổ sung hay fine-tuning cho từng tác vụ.
Kumo Tabular hoạt động bằng cách đọc các bảng dữ liệu đã gắn nhãn hoặc kèm kết quả mẫu, sau đó suy luận giá trị cho các dòng mới hoặc các trường còn thiếu. Nvidia cho biết mô hình không đòi hỏi feature engineering và hỗ trợ đồng thời hai nhóm tác vụ chính là phân loại và hồi quy.
Mô hình hiện có ba phiên bản, với quy mô từ 28 triệu đến 215 triệu tham số. Nvidia áp dụng giấy phép OpenMDW-1.1, cho phép sử dụng cho mục đích thương mại. Hãng cũng cho biết Kumo Tabular đang dẫn đầu trên bốn bộ đánh giá chuẩn gồm TabArena, BeyondArena, Talent và ScoringBench.
Theo Nvidia, trong khoảng 20 năm qua, doanh nghiệp chủ yếu sử dụng các mô hình gradient-boosted trees cho những bài toán như dự báo tỷ lệ khách hàng rời bỏ, nhu cầu hay giá cả. Tuy nhiên, với cách tiếp cận này, mỗi khi bài toán thay đổi, doanh nghiệp thường phải thực hiện lại từ đầu các bước thu thập nhãn, thiết kế đặc trưng và kiểm định mô hình.
Kumo Tabular được xây dựng theo hướng đưa cơ chế học trong ngữ cảnh của mô hình ngôn ngữ lớn vào dữ liệu dạng bảng. Cụ thể, mô hình đọc các bảng có sẵn kết quả như một ngữ cảnh đầu vào, rồi dự đoán trực tiếp cho dữ liệu mới.
Nvidia cho biết quá trình huấn luyện Kumo Tabular được thực hiện hoàn toàn trên dữ liệu bảng tổng hợp. Để tạo ra dữ liệu này, hãng sử dụng mô hình nhân quả cấu trúc (SCM) nhằm xây dựng các đồ thị nhân quả ngẫu nhiên, từ đó sinh dữ liệu dạng bảng phục vụ huấn luyện.
Hãng cho biết sẽ sớm công bố chi tiết phương pháp huấn luyện cũng như công cụ tạo dữ liệu tổng hợp.
Kumo Tabular được xem là có liên hệ với công nghệ của Kumo AI, startup phát triển phần mềm AI dự báo cho doanh nghiệp mà Nvidia đã mua lại vào tháng 6.
Kumo AI phát triển các mô hình AI có khả năng trả lời những câu hỏi mang tính dự báo dựa trên dữ liệu có cấu trúc của doanh nghiệp, như dữ liệu khách hàng hay dữ liệu thanh toán. Đây là nhóm dữ liệu mà các mô hình ngôn ngữ lớn phổ thông thường xử lý chưa hiệu quả. Vào tháng 4 năm nay, Kumo giới thiệu phiên bản mới nhất mang tên KumoRFM-2. Công ty hiện có DoorDash, Reddit, Databricks và Snowflake trong danh sách khách hàng và đối tác.