Anthropic ngày 22/9 (giờ địa phương) công bố mô hình AI mới Claude Opus 5.5, phiên bản được hãng định vị với chi phí thấp hơn và tốc độ xử lý nhanh hơn so với Claude Opus 5. Theo công ty, chi phí cho các tác vụ phổ biến giảm 40%, trong khi tốc độ đầu ra tăng hơn 30%.
Claude Opus 5.5 là mô hình đầu tiên thuộc dòng Claude 5.5. Đây cũng là sản phẩm đầu tiên Anthropic ra mắt sau khi CEO Dario Amodei công bố bài luận hôm 12/9, trong đó kêu gọi siết điều tiết tốc độ phát triển AI.
Ngay từ ngày công bố, mô hình được mở cho các gói Claude Pro, Max, Team và Enterprise. Anthropic đồng thời nâng hạn mức sử dụng trong mỗi chu kỳ 5 giờ đối với các gói này, trong đó Team và Enterprise được áp dụng theo số lượng ghế. Công ty cũng bổ sung tùy chọn đặt lại thời điểm làm mới hạn mức, cho phép người dùng chủ động sử dụng vào thời gian mong muốn.
Với nhà phát triển, mô hình được gọi bằng tên “claude-opus-5-5”. Anthropic cho biết Claude API, Amazon Bedrock, Google Cloud và Microsoft Foundry đều bắt đầu cung cấp mô hình trong cùng ngày. GitHub cũng triển khai dần cho nhóm người dùng trả phí của GitHub Copilot. Trong vài tuần tới, Anthropic dự kiến tiếp tục ra mắt hai mẫu cỡ vừa và nhỏ là Claude Sonnet 5.5 và Claude Haiku 5.5.
Về giá API, Claude Opus 5.5 có mức 4 USD cho mỗi 1 triệu token đầu vào và 20 USD cho mỗi 1 triệu token đầu ra, thấp hơn 20% so với Opus 5. Chi phí đọc cache, một cấu phần tốn kém trong các tác vụ agent và lập trình, giảm 60%, xuống còn 0,2 USD cho mỗi 1 triệu token. Theo Anthropic, nếu tính cả phần token sử dụng giảm đi, tổng chi phí cho các tác vụ phổ biến ở cấu hình mặc định thấp hơn 40% so với Opus 5.
Công ty cũng nhấn mạnh tốc độ đầu ra của mô hình nhanh hơn 30%. Với gói “fast mode”, tốc độ có thể tăng tối đa 2,5 lần, với mức giá 8 USD cho mỗi 1 triệu token đầu vào và 40 USD cho mỗi 1 triệu token đầu ra.
Anthropic cũng thay đổi cách thiết lập dành cho nhà phát triển. Trên Claude Opus 5.5, người dùng không còn tùy chọn tắt chế độ suy luận, trong khi độ sâu suy luận được điều chỉnh thông qua tham số effort. Giá trị mặc định của effort được hạ từ high trên Opus 5 xuống medium.
Theo các chỉ số hiệu năng do Anthropic công bố, Claude Opus 5.5 dẫn đầu ở các bài toán lập trình agent, thao tác máy tính và công việc tri thức. Trên bài kiểm tra Terminal-Bench 4.0, mô hình đạt 66,4%, cao hơn mức 55,8% của Fable 5.1 và 57,9% của GPT-6 Astra từ OpenAI.
Dù vậy, ở một số hạng mục liên quan đến nghiên cứu khoa học và quy trình làm việc trong doanh nghiệp, mô hình này vẫn kém GPT-6 Astra. Anthropic cũng lưu ý rằng trong quá trình sử dụng nội bộ, khoảng cách so với Fable 5.1 không lớn như những gì các thang điểm thể hiện.
Cùng với đó, Anthropic công bố một số trường hợp sử dụng ban đầu. Theo hãng, một người thử nghiệm đã hoàn tất việc chuyển đổi mã nguồn quy mô 680.000 dòng trong chưa đầy một ngày. Trong thử nghiệm nội bộ, mô hình cũng chuyển load balancer HAProxy từ C sang Rust trong 9,5 giờ, nhanh hơn Fable 5.1 và giúp giảm 51% chi phí.
Anthropic cho biết hãng đã cải thiện khả năng diễn đạt của mô hình bằng cách ưu tiên thông tin quan trọng ở đầu câu, đồng thời giảm bớt thuật ngữ chuyên môn và các lối diễn đạt đặc thù.
Ở khía cạnh an toàn, Anthropic cho biết cả đánh giá nội bộ lẫn thử nghiệm từ các tổ chức bên ngoài đều kết luận mô hình chưa vượt qua ngưỡng năng lực tiếp theo. METR tại Mỹ nhận định khả năng tự động hóa hoạt động R&D AI của mô hình chỉ cải thiện nhẹ so với Fable 5.1, trong khi khả năng tự động hóa hoàn toàn R&D AI vẫn ở mức thấp. Anthropic cũng nói mô hình chưa vượt ngưỡng theo chính sách mở rộng có trách nhiệm của hãng.
Tuy nhiên, công ty thừa nhận rằng những mô hình mạnh hơn, có khả năng tự động hóa hoàn toàn nghiên cứu AI, sẽ đòi hỏi tiêu chuẩn an toàn cao hơn, và các biện pháp hiện tại chưa chắc đã đáp ứng được yêu cầu đó. Trên cơ sở này, Opus 5.5 được áp dụng mức bảo vệ an toàn tương đương Fable 5.1.
Trong lĩnh vực an ninh mạng, Anthropic cho biết mô hình có thể tự phát hiện và sửa lỗi trong chính đoạn mã do nó tạo ra, nhưng nhiều tác vụ khác sẽ tự động được chuyển sang Claude Opus 4.8. Với sinh học, công ty áp dụng các biện pháp bảo vệ tương tự Fable 5.1. Anthropic cũng thông báo kế hoạch mở rộng “chương trình xác minh an ninh mạng” và triển khai mới “chương trình xác minh khoa học sự sống” cho các tổ chức đã qua thẩm định.
Trong một cuộc kiểm toán về hành vi tự động dựa trên khoảng 2.000 kịch bản, mô hình nhìn chung cho kết quả tốt hơn các phiên bản Claude gần đây. Ở bài đánh giá mới nhằm đo xu hướng vượt qua các giới hạn hạn chế, số lần thử lách rào thấp hơn khoảng 85% so với Opus 5 và Mythos 5.1.
Dù vậy, trong các đánh giá không có biện pháp bảo vệ an toàn, vẫn có 1,5% trường hợp mô hình tìm cách thoát khỏi sandbox hoặc can thiệp vào môi trường chạy. Anthropic cũng ghi nhận hiện tượng “thụt lùi”, khi mô hình dễ làm theo các chỉ dẫn độc hại mà người dùng chèn vào prompt hơn. Công ty cho biết mức độ rủi ro gây thiệt hại thảm khốc vẫn được giữ ở mức “thấp”, tương tự báo cáo công bố hồi tháng 8.