Alibaba vừa giới thiệu Qwen Image 3.0, mẫu AI tạo ảnh mới được định vị cho các tác vụ phục vụ công việc như dàn trang báo, infographic và storyboard. Theo công ty, trọng tâm của phiên bản này là khả năng ứng dụng thực tế và năng suất làm việc, thay vì chỉ chạy đua về độ đẹp của hình ảnh.
Theo Decrypt ngày 22/7 (giờ địa phương), Qwen Image 3.0 có thể xử lý prompt dài tối đa 4.500 token.
Mức này cao gấp 4,5 lần thế hệ trước, cho phép người dùng đưa vào một prompt nhiều thành phần như panel, biểu đồ, công thức, chú thích và chữ cỡ nhỏ để tạo ra bố cục hoàn chỉnh, thay vì phải dựng riêng từng cảnh hay từng yếu tố.
Alibaba cho biết mô hình có thể tạo trong một lần sinh các trang báo, storyboard và lưới infographic phức tạp. Doanh nghiệp cũng nhấn mạnh những ảnh demo được công bố đều được tạo từ một quy trình sinh ảnh duy nhất, không phải ghép từ nhiều kết quả khác nhau.
Trong thông báo chính thức, nhóm phát triển Qwen cho biết Qwen Image 3.0 không chỉ nhằm tạo ra “hình ảnh đẹp mắt”, mà còn hướng đến vai trò một công cụ năng suất có thể đưa vào quy trình dàn trang.
Khả năng hiển thị văn bản cũng được cải thiện. Alibaba cho biết mô hình có thể tái hiện chính xác chữ nhỏ ở mức 10 pixel, đồng thời giữ được các chi tiết như kết cấu da và tóc. Qwen Image 3.0 cũng hỗ trợ ký pháp LaTeX để thể hiện các công thức toán học phức tạp, từ đó phù hợp hơn với việc tạo hình ảnh dạng tài liệu học thuật hoặc tài liệu giáo dục có công thức, chú thích và biểu đồ.
Ở mảng đa ngôn ngữ và mô phỏng giao diện, Alibaba cho biết mô hình hỗ trợ sẵn 12 ngôn ngữ, đồng thời có thể tái hiện các dạng giao diện số phổ biến như website, game và livestream. Mô hình cũng có khả năng kết hợp dữ liệu mới nhất từ Internet vào hình ảnh; chẳng hạn, khi nhập tên thành phố và ngày để trực quan hóa thời tiết, kết quả sẽ dựa trên dữ liệu thực tế mới nhất thay vì giá trị ước đoán.
Alibaba cho biết các nhóm khách hàng mục tiêu gồm studio thiết kế, đội ngũ sản xuất nội dung, bộ phận vận hành thương mại điện tử và lĩnh vực giáo dục. Cách định vị này cho thấy công ty đang nhắm tới các tổ chức có nhu cầu sản xuất hàng loạt tài liệu trực quan và hình ảnh chứa nhiều nội dung văn bản.
Tuy vậy, đợt công bố lần này chưa đi kèm các tài liệu đủ để kiểm chứng hiệu năng thực tế. Qwen Image 3.0 được giới thiệu mà không phát hành trọng số mở, đồng thời chưa có bảng đối chiếu hiệu năng hay báo cáo kỹ thuật. Hiện người dùng có thể trải nghiệm mô hình trên dịch vụ chat chính thức của Qwen, nhưng giá API vẫn chưa được công bố.
Cách ra mắt này cũng khác với các phiên bản trước. Qwen Image 1.0 từng phát hành ngay trong ngày ra mắt cùng trọng số mở theo giấy phép Apache 2.0 và báo cáo kỹ thuật, trong khi phiên bản mới chủ yếu giới thiệu năng lực qua các ảnh demo do công ty lựa chọn.
Khả năng cạnh tranh của mô hình mới vì thế vẫn cần thêm dữ liệu kiểm chứng. Trong bài đánh giá nội bộ mang tên “Qwen Image Bench”, phiên bản chủ lực trước đó là Qwen Image 2.0 Pro xếp thứ 5 trong số 18 mô hình, còn vị trí dẫn đầu thuộc về GPT Image 2 của OpenAI.
Với các thông tin hiện có, vẫn khó đo lường chính xác mức cải thiện của Qwen Image 3.0 so với thế hệ trước. Đánh giá từ người dùng, mức giá API và việc Alibaba có công bố thêm báo cáo kỹ thuật hay không sẽ là những yếu tố then chốt để xác định năng lực cạnh tranh của mô hình này.
Thành bại của Qwen Image 3.0 sẽ phụ thuộc vào khả năng tạo ổn định các hình ảnh dạng tài liệu phức tạp trong môi trường triển khai thực tế. Khi Alibaba chọn tính ứng dụng làm điểm khác biệt trên thị trường AI tạo ảnh, những dữ liệu kiểm chứng bổ sung và kết quả sử dụng thực tế nhiều khả năng sẽ là tâm điểm chú ý tiếp theo.