SpaceXAI đã giới thiệu mô hình trí tuệ nhân tạo mới mang tên Grok 4.6, với tổng điểm trên bảng đánh giá Artificial Analysis ngang GPT-5.6 Sol Max của OpenAI, đồng thời cho kết quả tốt hơn ở một số bài kiểm tra về lập trình và tác vụ terminal.
Theo ITmedia và một số hãng tin quốc tế ngày 12/8 (giờ địa phương), Grok 4.6 được định vị cho các tác vụ agent kéo dài qua nhiều bước, đồng thời tăng cường khả năng tạo đầu ra hội thoại và hình ảnh. SpaceXAI là đơn vị AI trực thuộc SpaceX.
Grok 4.6 được phát triển từ phiên bản tiền nhiệm Grok 4.5. SpaceXAI cho biết mô hình đã được nâng cấp để phù hợp hơn với việc triển khai agent xử lý liên tục các tác vụ nhiều bước, đồng thời cải thiện khả năng tạo đầu ra trực quan trong quá trình tương tác với người dùng.
Theo benchmark do công ty công bố, Grok 4.6 đạt 61 điểm trên Intelligence Index (AAII) của Artificial Analysis, chỉ số tổng hợp từ 9 hạng mục đánh giá. Mức này ngang với GPT-5.6 Sol Max, nhưng vẫn thấp hơn 1 điểm so với Fable5 Max của Anthropic, mô hình đạt 62 điểm. So với Grok 4.5 High trước đó ở mức 56 điểm, Grok 4.6 tăng thêm 5 điểm.
Ở từng hạng mục chi tiết, kết quả của các mô hình có sự phân hóa rõ rệt. GPT-5.6 Sol Max dẫn đầu nhóm so sánh ở một số benchmark, gồm 1.753 điểm tại GDPVal-AA v2, bài kiểm tra năng lực xử lý công việc có giá trị kinh tế; 1.577 điểm tại AA-Briefcase, bài đánh giá về lao động tri thức; và 15,8% tại Harvey Bench (Vals) trong lĩnh vực pháp lý.
Trong khi đó, Grok 4.6 vượt Fable5 Max và Grok 4.5 High ở DeepSWE v1.1, bài kiểm tra kỹ thuật phần mềm, với 65,9%, cùng 26% ở Terminal Bench v3.0, thước đo hiệu quả thao tác terminal. SpaceXAI cho biết số liệu của các mô hình cạnh tranh được trích từ system card và leaderboard do từng công ty công bố.
Theo SpaceXAI, thế mạnh nổi bật của Grok 4.6 là khả năng tạo phiên bản đầu tiên của sản phẩm chỉ từ một ý tưởng ở mức khái quát. Công ty cho biết mô hình phù hợp với các quy trình như tìm hiểu lĩnh vực mới, thiết kế cấu trúc ứng dụng và lặp lại cải tiến dựa trên phản hồi. Với các tác vụ kéo dài, mô hình cũng bắt đầu cho thấy khả năng tự kiểm tra kết quả trước khi chuyển sang bước tiếp theo.
Về huấn luyện, SpaceXAI kéo dài giai đoạn tiền huấn luyện so với Grok 4.5, đồng thời áp dụng tinh chỉnh có giám sát (SFT) bằng dữ liệu tái tạo từ Grok 4.5. Công ty cũng bổ sung học tăng cường trong các môi trường theo lĩnh vực, gồm tối ưu kernel, phát triển web và thiết kế có trợ giúp máy tính (CAD).
Các biện pháp an toàn cũng được siết chặt. SpaceXAI cho biết đã tiếp tục điều chỉnh cơ chế an toàn tương ứng với mức nâng cấp hiệu năng, đồng thời mở rộng quy mô đánh giá và kiểm thử an toàn trước khi phát hành, lớn nhất từ trước đến nay.
Ngay trong ngày công bố, Grok 4.6 đã được cung cấp qua Grok Build, Cursor, Grok Bot và API. Người dùng cũng có thể truy cập mô hình này thông qua các đối tác như OpenRouter, Vercel và Cloudflare.
Trong đó, Grok Bot beta là dịch vụ được SpaceXAI công bố trước đó một ngày, hoạt động như một AI agent chạy liên tục trên máy tính ảo trên nền tảng đám mây. Dịch vụ này có thể sử dụng trên iPhone và Mac. Trước đó, vào tháng 6, SpaceXAI đã mua lại Cursor.
Giá sử dụng được niêm yết từ 2 USD cho mỗi 1 triệu token đầu vào và 6 USD cho mỗi 1 triệu token đầu ra. Phiên bản tốc độ cao có mức giá gấp đôi. SpaceXAI cũng triển khai chương trình khuyến mãi trong một tuần sau khi ra mắt, tăng gấp đôi hạn mức sử dụng trong các gói trên Cursor và Grok Build.