DeepSeek V4.1 Flash đang cho thấy năng lực cạnh tranh sát với GPT-6 Astra của OpenAI trong một bài đánh giá thiết kế thực tế, dù chi phí vận hành thấp hơn rất nhiều.
Ngày 10/9 (giờ địa phương), theo Decrypt và các nguồn tin liên quan, OpenDesign Arena chấm DeepSeek V4.1 Flash ở mức 81,2/100 điểm. Mức này chỉ thấp hơn 1,5 điểm so với GPT-6 Astra, mẫu này đạt 82,7 điểm, tương đương khoảng 98% kết quả của mô hình từ OpenAI.
Khoảng cách lớn nhất nằm ở chi phí. GPT-6 Astra tiêu tốn 1,61 USD cho mỗi sản phẩm thiết kế hoàn chỉnh, trong khi DeepSeek V4.1 Flash chỉ cần 0,023 USD, tức bằng khoảng 1,4% chi phí của đối thủ. Về tốc độ, GPT-6 Astra mất trung bình 11,1 phút để hoàn thành một sản phẩm, còn V4.1 Flash cần 5,3 phút.
OpenDesign Arena thực hiện so sánh này bằng cách đưa cùng một đề bài thiết kế cho 13 mô hình AI. Danh sách gồm Claude Fable 5.1 của Anthropic, Grok 4.6, Qwen 3.8-Max và một số mô hình khác. Kết quả cho thấy ngoài GPT-6 Astra, không mô hình nào đạt điểm cao hơn V4.1 Flash; 11 mô hình còn lại đều có điểm số thấp hơn và chi phí cao hơn.
Theo OpenDesign Arena, các mô hình được đánh giá dựa trên những tác vụ thiết kế hằng ngày như web app, dashboard, màn hình di động và landing page, theo thang điểm 100. Trong đó, 30 điểm dành cho mức độ đáp ứng yêu cầu, 70 điểm còn lại chấm bố cục, phân cấp thông tin, màu sắc và độ phù hợp về phong cách. Đợt đánh giá này tập trung vào khả năng tạo ra sản phẩm thiết kế ổn định trong môi trường thực tế, thay vì đo năng lực suy luận hay lập trình nói chung.
Claude Fable 5.1 đạt 80,3 điểm, với thời gian xử lý trung bình 12,8 phút và chi phí 3,66 USD cho mỗi sản phẩm. So với mô hình này, chênh lệch điểm của V4.1 Flash không lớn, nhưng lợi thế về tốc độ và chi phí rõ rệt hơn nhiều.
DeepSeek cho biết hiệu quả chi phí của V4.1 Flash đến từ kiến trúc mô hình mới. Theo tài liệu kỹ thuật, đây là mô hình mixture-of-experts (MoE) với tổng cộng 552 tỷ tham số. Trong số đó, lượng tham số được kích hoạt khi xử lý đầu vào là 8 tỷ, còn ở giai đoạn tạo đầu ra là 16 tỷ. DeepSeek mô tả đây là kiến trúc “causal encoder-decoder”, được thiết kế để phân bổ quy mô tham số kích hoạt khác nhau giữa đầu vào và đầu ra nhằm tối ưu chi phí.
Tuy vậy, phạm vi kiểm chứng của bài đánh giá vẫn có giới hạn. Trong bài kiểm thử của OpenDesign, sản phẩm chỉ được chấm điểm nếu có thể render thành một trang web hoạt động thực tế. Nếu đầu ra là màn hình trống, giao diện bị vỡ hoặc bị cắt giữa chừng, bài làm sẽ bị tính 0 điểm và không được chấm lại. Vì vậy, benchmark này chủ yếu đo độ ổn định trong việc tạo ra các sản phẩm thiết kế hằng ngày có thể sử dụng được, thay vì phản ánh đầy đủ năng lực suy luận hoặc lập trình đa dụng.
GPT-6 Astra được OpenAI công bố ngày 3/9, nhắm đến nhiều lĩnh vực như sử dụng máy tính, kỹ nghệ phần mềm, an ninh mạng, khoa học và các công việc chuyên môn. Dù dẫn đầu về điểm số trong bài đánh giá thiết kế này, mô hình của OpenAI vẫn kém V4.1 Flash về tốc độ và chi phí.
Ở tiêu chí tỷ lệ sản phẩm được đánh giá là “có thể bàn giao ngay” mà không cần chỉnh sửa thêm, khoảng cách giữa hai mô hình không đáng kể. V4.1 Flash đạt 57,7%, GPT-6 Astra đạt 60%, còn Claude Fable 5.1 đạt 56,7%.
Gần đây, DeepSeek theo đuổi chiến lược thu hẹp khoảng cách hiệu năng với các đối thủ bằng lợi thế chi phí thấp. Trước đó, V4 Pro trong một benchmark khác cũng được đánh giá chỉ kém Claude Fable 5 khoảng 5%, đồng thời có mức giá thấp hơn. Tuy nhiên, kết quả này được tổng hợp từ nhiều bài đánh giá khác nhau và có thể thay đổi tùy theo phương pháp chấm.
Hồi tháng 5, DeepSeek cũng tuyển dụng tại Bắc Kinh các vị trí quản lý sản phẩm và kỹ sư R&D để phát triển Code Harness. Động thái này cho thấy công ty đang mở rộng từ mô hình nền tảng sang cả code agent và môi trường thực thi dành cho nhà phát triển.