OpenAI cho biết đã sử dụng mô hình AI mới GPT-5.6 Sol để tối ưu trực tiếp hạ tầng suy luận của mình, qua đó cắt giảm chi phí và nâng hiệu quả xử lý.
Theo Gizmodo ngày 30/7, sau khi cải tiến công cụ suy luận và cách khai thác GPU bằng GPT-5.6 Sol, OpenAI ghi nhận chi phí vận hành end-to-end giảm 20%, trong khi hiệu suất sinh token tăng 15%.
Thông tin này nằm trong nội dung giới thiệu dòng GPT-5.6 được OpenAI công bố hôm 9/7. Dòng mô hình này gồm Sol, Terra và Luna, lần lượt hướng tới hiệu năng cao, cân bằng và chi phí thấp. Trong đó, GPT-5.6 Sol được giới thiệu là mang lại hiệu năng cao trong khi chi phí chỉ bằng một nửa so với mô hình cạnh tranh Claude Fable 5.
Điểm đáng chú ý là GPT-5.6 Sol không chỉ được dùng để tạo phản hồi, mà còn được đưa vào bài toán tối ưu hạ tầng suy luận nội bộ. OpenAI cho biết công ty đã cải thiện các kernel cốt lõi của engine suy luận với sự hỗ trợ của mô hình này. GPT-5.6 Sol học các kỹ thuật tối ưu kernel dựa trên Triton và Gluon, từ đó nâng hiệu quả mã và giảm 20% tổng chi phí vận hành.
OpenAI đồng thời cải tiến kỹ thuật Speculative Decoding. Đây là phương pháp sử dụng một mô hình nhỏ để dự đoán trước token tiếp theo, sau đó để mô hình lớn kiểm chứng. Theo công ty, GPT-5.6 Sol đã được dùng để nâng hiệu năng của mô hình nháp, giúp hiệu suất sinh token tăng thêm 15%.
Ngoài ra, OpenAI cho biết GPT-5.6 còn được dùng để tối ưu cách xử lý KV cache và hệ thống phân bổ tác vụ trên GPU. Nhờ đó, tài nguyên tính toán trong quá trình suy luận được phân bổ hiệu quả hơn, cho phép xử lý nhiều yêu cầu hơn trên cùng một hạ tầng phần cứng.
Công ty cũng điều chỉnh cơ chế vận hành agent. Theo đó, MCP server và các kỹ năng chỉ được kích hoạt khi cần; đầu ra của công cụ mặc định bị giới hạn ở mức 10.000 token, và chỉ khi cần nhiều hơn mô hình mới gửi thêm yêu cầu. OpenAI cũng cố định thứ tự gọi công cụ để nâng tỷ lệ tận dụng bộ nhớ đệm.
Theo OpenAI, những thay đổi này giúp giảm lượng tính toán dư thừa và hạn chế biến động trong quá trình agent vận hành, đồng thời cải thiện cả hiệu năng suy luận lẫn hiệu quả chi phí.
Công ty cho biết “GPT-5.6 đã đóng góp đáng kể vào việc cải thiện engine suy luận và harness”, đồng thời bày tỏ tin tưởng tốc độ tối ưu sẽ tiếp tục được đẩy nhanh trong thời gian tới.
Giới phân tích cho rằng trường hợp này cho thấy AI không còn chỉ cạnh tranh ở chất lượng mô hình, mà đang bước sang giai đoạn tự tối ưu hạ tầng AI. Trong thời gian tới, bên cạnh hiệu năng, khả năng tự cải thiện chi phí vận hành dịch vụ và mức độ tận dụng GPU có thể trở thành một thước đo mới về năng lực cạnh tranh của các công ty AI.