Anthropic vừa giới thiệu mô hình AI mới Claude Fable 5.1 và ngay lập tức vươn lên dẫn đầu bảng xếp hạng của tổ chức đánh giá độc lập Artificial Analysis, vượt các đối thủ như OpenAI, Google và SpaceXAI.
Theo Cryptopolitan ngày 1/9 (giờ địa phương), ngay sau khi Anthropic phát hành Claude Fable 5.1, Artificial Analysis đã cập nhật bảng xếp hạng năng lực mô hình. Kết quả cho thấy hai biến thể của Fable 5.1 lần lượt giữ vị trí số 1 và số 2.
Artificial Analysis hiện so sánh hơn 250 mô hình ngôn ngữ dựa trên các tiêu chí như giá, tốc độ và năng lực xử lý. Trong đợt đánh giá này, Fable 5.1 Max kèm cơ chế fallback đạt 66 điểm, còn bản XHigh kèm fallback đạt 65 điểm.
Trước đó, mô hình dẫn đầu là Claude Opus 5 với 63 điểm ở cả hai chế độ Max và XHigh. Với kết quả mới, Anthropic hiện nắm cả 4 vị trí cao nhất trên bảng xếp hạng.
Đứng sau nhóm mô hình của Anthropic là GPT-5.6 Sol của OpenAI và Grok 4.6 của SpaceXAI, cùng đạt 61 điểm. Các mô hình của Google, Alibaba và DeepSeek cũng có mặt trong danh sách, nhưng vẫn kém khá xa về điểm số.
Đáng chú ý, đây là bảng xếp hạng do một đơn vị đánh giá độc lập công bố, không phải số liệu do chính Anthropic đưa ra. Trong bối cảnh cuộc đua AI ngày càng khốc liệt, xếp hạng từ các tổ chức bên ngoài đang trở thành chỉ báo tham khảo quan trọng của thị trường.
Ở các bài kiểm tra do Anthropic công bố, Fable 5.1 cũng cho thấy bước tiến rõ rệt. Trong bài Terminal-Bench-Science 0.1, dùng để đánh giá năng lực nghiên cứu khoa học theo tác nhân AI, Fable 5.1 đạt 52,6%, cao hơn gấp đôi mức 24,7% của Fable 5. Claude Opus 5 đạt 29%, trong khi GPT-5.6 Sol đạt 22,4%.
Với bài Terminal-Bench 4.0 đánh giá năng lực lập trình, Fable 5.1 đạt 55,8%, tăng mạnh so với 42,0% của Fable 5.
Anthropic cho biết thế mạnh lớn nhất của phiên bản mới là khả năng xử lý các tác vụ phức tạp, kéo dài nhiều bước. Theo Millennium, Fable 5.1 đã truy ra một lỗi xung đột hiếm gặp trong hệ thống của công ty và phát hiện một bug mà đội ngũ kỹ sư chưa thể giải quyết trong suốt 4-5 năm.
Browserbase cũng cho biết trong bài kiểm tra tác nhân trình duyệt khó nhất, Fable 5.1 hoàn thành 82% tổng số nhiệm vụ, cao hơn 8 điểm phần trăm so với mức 74% của Claude Opus 5.
Về giá, Anthropic giữ nguyên khung phí cơ bản. Fable 5.1 có giá 10 USD cho mỗi 1 triệu token đầu vào và 50 USD cho mỗi 1 triệu token đầu ra. Mức này cao hơn Opus 5, lần lượt là 5 USD và 25 USD, cũng như Sonnet 5 với 2 USD và 10 USD.
Bù lại, hãng giảm mạnh chi phí đọc lại ngữ cảnh đã lưu trong bộ nhớ đệm từ 1 USD xuống 0,25 USD cho mỗi 1 triệu token, tương đương mức giảm 75%.
Theo Anthropic, chính sách giá này phản ánh đặc thù của các tác vụ dạng agent, vốn thường phải đọc lặp lại cùng một đoạn mã, chỉ dẫn và lịch sử hội thoại. Công ty ước tính chi phí trung bình cho mỗi tác vụ có thể giảm khoảng 25%, còn với các tác vụ có tỷ trọng agent cao, mức giảm có thể lên tới 45%.
Cùng với Fable 5.1, Anthropic cũng ra mắt Claude Mythos 5.1. Hai mô hình sử dụng gần như cùng một nền tảng, nhưng khác nhau ở lớp bảo vệ an toàn và nhóm người dùng mục tiêu.
Trong đó, Fable 5.1 dành cho người dùng phổ thông, còn Mythos 5.1 chỉ được cung cấp cho các tổ chức trong lĩnh vực an ninh mạng và khoa học sự sống đã vượt qua quy trình thẩm định thông qua chương trình Project Glasswing của Anthropic.
Cách tung ra song song hai mô hình được xem là bước đi nhằm mở rộng năng lực AI nhưng vẫn siết chặt kiểm soát an toàn. Trước đó, ngày 23/7, Anthropic từng tạm dừng hoạt động đánh giá an ninh mạng từ bên ngoài sau khi phát sinh sự cố Claude truy cập vào hệ thống thực trong một quy trình thử nghiệm lẽ ra phải được thực hiện trong môi trường cách ly.
Sau sự việc này, Anthropic đã bổ sung thêm các biện pháp chặn và nối lại hoạt động đánh giá từ bên ngoài. Lần ra mắt mới nhất cho thấy hãng đang tách bạch giữa một mô hình hiệu năng cao dành cho số đông và một mô hình bị giới hạn quyền truy cập cho các lĩnh vực rủi ro cao nhằm tăng cường quản trị an toàn.
Khi cuộc đua AI không còn chỉ xoay quanh hiệu năng mà mở rộng sang năng lực tác nhân, khả năng vận hành các tác vụ dài, hiệu quả chi phí và mức độ an toàn, thị trường sẽ tiếp tục theo dõi liệu Anthropic có thể duy trì khoảng cách với các đối thủ nhờ Fable 5.1 hay không.