Alibaba ngày 15/8 (giờ địa phương) công bố Qwen3.8-27B, mô hình AI đa phương thức mã nguồn mở được tối ưu để chạy cục bộ trên thiết bị cá nhân như MacBook Pro cấu hình cao hoặc Mac Studio.
Theo OfficeChai, Alibaba phát hành cả trọng số của Qwen3.8-27B theo giấy phép Apache 2.0, qua đó tham gia cuộc cạnh tranh ở phân khúc mô hình có thể vận hành cục bộ trên một GPU với các đối thủ như Meta và Google.
Cùng với đó, hãng cũng công bố trọng số của Qwen3.8-2.4T-A95B, phiên bản cao cấp nhất trong dòng sản phẩm này. Động thái này giúp nhà phát triển có thêm lựa chọn giữa một mô hình gọn nhẹ để chạy trên phần cứng tại chỗ và một mô hình đầu bảng phục vụ các tác vụ agent quan trọng.
Về cấu hình, Qwen3.8-27B có quy mô đủ nhỏ để chạy cục bộ trên MacBook Pro bản cấu hình cao hoặc Mac Studio. Mô hình hỗ trợ cửa sổ ngữ cảnh mặc định 262.000 token; khi áp dụng công nghệ mở rộng ngữ cảnh YaRN, con số này có thể tăng lên tối đa 1 triệu token.
Alibaba cho biết Qwen3.8-27B có thể cạnh tranh với những mô hình lớn hơn đáng kể trong các bài kiểm tra về lập trình và công việc văn phòng. Theo kết quả benchmark nội bộ do hãng công bố, hiệu năng của mô hình được xếp ngang Anthropic Opus 4.6 Max và đồng thời hỗ trợ năng lực thị giác.
Đối thủ được chú ý nhiều nhất trong đợt ra mắt này là Muse Glimmer-30B, mô hình AI cục bộ của Meta vừa giới thiệu vài ngày trước. Trước đó, Meta từng tuyên bố Muse Glimmer-30B vượt Qwen3.6-27B trong phần lớn bài kiểm tra, vì vậy Qwen3.8-27B được xem là phản ứng trực diện từ Alibaba.
Trong các phép so sánh trực tiếp, Qwen3.8-27B đều nhỉnh hơn. Ở TerminalBench 2.1, mô hình đạt 73,0 điểm, so với 51,7 điểm của đối thủ, tức chênh hơn 20 điểm. Tại IFBench và GPQA Diamond, Qwen3.8-27B cũng dẫn trước, dù khoảng cách không lớn.
Khác với cách làm trước đây, khi các mô hình nhỏ thường được mở nguồn sớm còn bản cao cấp phát hành theo hướng khép kín trước, lần này Alibaba công bố đồng thời trọng số của cả hai phiên bản.
Dù vậy, benchmark không phản ánh đầy đủ hiệu năng trong môi trường sử dụng thực tế. Với các tác vụ agent, lớp “harness” bao quanh mô hình có thể quan trọng không kém chính mô hình đó.
Theo The New Stack, một số đánh giá ban đầu cho rằng mô hình có xu hướng “nghĩ” quá lâu, tức thời gian suy luận kéo dài. Ngoài ra, các số liệu benchmark mà Alibaba công bố được đo trên checkpoint gốc, trong khi phần lớn người dùng chạy cục bộ thường sử dụng bản lượng tử hóa (Quantization), điều có thể làm suy giảm hiệu năng.
Về bản chất, mô hình AI lưu trữ các giá trị với độ chính xác rất cao, khiến dung lượng tệp lớn và tiêu tốn nhiều bộ nhớ. Lượng tử hóa là kỹ thuật giảm độ chính xác của các giá trị này để cắt giảm đáng kể kích thước mô hình và mức sử dụng bộ nhớ.