OpenAI vừa giới thiệu GPT-5.6 với ba biến thể Sol, Terra và Luna, qua đó làm thay đổi tương quan cạnh tranh với Fable 5, mô hình chủ lực của Anthropic. So sánh mới cho thấy Sol nhỉnh hơn về năng lực lập trình, trong khi Fable 5 vẫn có ưu thế ở viết lách và hội thoại phổ thông. Khi chênh lệch hiệu năng không còn quá lớn, quyết định của người dùng ngày càng phụ thuộc vào giá và khả năng tiếp cận.
Theo Decrypt ngày 18/7 (giờ địa phương), trọng tâm của đợt so sánh lần này là Sol, phiên bản cao cấp nhất trong dòng GPT-5.6, và Fable 5.
Về chi phí, GPT-5.6 đang chiếm ưu thế. Sol được niêm yết ở mức 5 USD cho mỗi 1 triệu token đầu vào và 30 USD cho đầu ra, trong khi Fable 5 lần lượt là 10 USD và 50 USD, gần gấp đôi. Ở phân khúc thấp hơn, Luna có giá 1 USD cho đầu vào và 6 USD cho đầu ra nhưng vẫn vượt Opus 4.8 của Anthropic ở hiệu năng lập trình. Đáng chú ý, từ ngày 19/7, Fable 5 dự kiến quay lại cơ chế tính phí theo credit dựa trên mức sử dụng thực tế, qua đó làm tăng áp lực chi phí.
Khả năng tiếp cận của Fable 5 cũng liên tục biến động trong khoảng một tháng qua. Sau khi nhóm nghiên cứu của Amazon xác nhận vào tháng 6 rằng mô hình này có thể bị jailbreak để phục vụ quét lỗ hổng, Chính phủ Mỹ đã cấm sử dụng Fable 5. Tiếp đó, Anthropic gỡ mô hình này trên toàn cầu trong 19 ngày, triển khai bộ phân loại an toàn mới và mở lại dịch vụ từ ngày 1/7.
Mốc ngừng cung cấp Fable 5 trong các gói thuê bao trả phí sau đó cũng nhiều lần bị lùi, lần lượt sang ngày 7/7, 12/7 và 19/7. Anthropic cho biết vẫn duy trì mức tăng 50% hạn mức sử dụng hằng tuần cho Claude Code.
Trong các benchmark, GPT-5.6 Sol nổi bật trong lập trình. Trong bài đánh giá tác nhân lập trình AI, Sol đạt 80 điểm, cao hơn mức 77,2 điểm của Fable 5, đồng thời chỉ tiêu thụ khoảng một nửa số token và thời gian xử lý cũng chưa tới một nửa. Ở bài kiểm tra “Agents Last Exam” gồm 55 tác vụ chuyên môn, Sol đạt 53,6%, cao hơn đáng kể so với 40,5% của Fable 5. Với TerminalBench 2.1 ở chế độ hiệu năng cao nhất, Sol đạt 91,9%, còn Fable 5 là 83,1%.
Dù vậy, khoảng cách tổng thể giữa hai mô hình không quá lớn. Ở chỉ số “intelligence” tổng hợp từ 9 benchmark, Fable 5 lại cao hơn GPT-5.6 1 điểm.
Trong các thử nghiệm sử dụng thực tế, kết quả có sự phân hóa. Với bài viết sáng tác về nghịch lý du hành thời gian, Fable 5 được đánh giá cao hơn nhờ khả năng kết nối bối cảnh văn hóa và xây dựng quan hệ nhân - quả tự nhiên hơn. Ngược lại, GPT-5.6 Sol có xu hướng triển khai mạch truyện trực diện và thiên về giải thích cấu trúc. Với prompt yêu cầu biểu đạt ẩn dụ, Fable 5 nổi bật nhờ sử dụng các biểu tượng gắn với đồ vật, còn Sol tập trung làm rõ ý nghĩa.
Ở bài toán logic, cả hai mô hình đều mắc cùng một lỗi. Với biến thể của bài toán kinh điển bốn người qua cầu với một ngọn đuốc, cả hai đều đưa ra đáp án 17 phút, trong khi kết quả đúng là 10 phút, tương ứng với thời gian di chuyển của người chậm nhất. Decrypt cho rằng đây là hệ quả của việc áp dụng máy móc lời giải quen thuộc đã được học trước đó.
Trong bài kiểm tra lập trình game bắn súng gõ phím trên trình duyệt, Fable 5 tạo ra sản phẩm hoàn thiện hơn. Sol đưa ra ý tưởng độc đáo nhưng phần đồ họa và hiệu ứng hình ảnh còn tương đối đơn giản. Trong khi đó, Fable 5 triển khai thêm nhạc nền, hiệu ứng âm thanh, hoạt ảnh, chỉ số số lần gõ mỗi phút cùng các yếu tố power-up.
Decrypt nhận định nếu ưu tiên benchmark lập trình và hiệu quả chi phí, GPT-5.6 Sol đang có lợi thế. Ngược lại, với hội thoại phổ thông, viết lách và các tác vụ sáng tạo, Fable 5 vẫn giữ được sức cạnh tranh. Tuy nhiên, trong bối cảnh chênh lệch hiệu năng không lớn, việc Fable 5 quay lại cơ chế tính phí theo mức sử dụng, trong khi Sol, Terra và Luna đã được bao gồm trong gói ChatGPT trả phí, có thể khiến người dùng đặt nặng giá và khả năng tiếp cận hơn là khác biệt về hiệu năng.