Logo của Red Hat.

Red Hat ngày 10/9 công bố Red Hat AI 3.5, phiên bản mới của nền tảng AI doanh nghiệp, với trọng tâm là kiểm chứng bảo mật trước khi triển khai, chia sẻ hạ tầng GPU đa tenant, tăng cường khả năng quan sát vận hành và mở rộng công cụ phát triển agent.

Theo Red Hat, phiên bản 3.5 được thiết kế để giúp doanh nghiệp vận hành workload AI với tiêu chuẩn quản trị tương đương các hạ tầng cốt lõi khác, bao gồm bảo mật có thể kiểm chứng, theo dõi chi phí và quản trị tài nguyên ở mức chi tiết.

Để phục vụ mục tiêu này, hãng chính thức phát hành EvalHub. Công cụ này cho phép đánh giá mô hình, cấu hình RAG và agent trước khi triển khai nhằm xác định rủi ro, đồng thời gắn với báo cáo tuân thủ phục vụ kiểm toán. Người dùng có thể thẩm định mô hình từ sớm, xây dựng benchmark an toàn theo từng trọng tâm rủi ro và xuất tài liệu phục vụ yêu cầu tuân thủ.

Danh mục mô hình của nền tảng cũng được mở rộng với hơn 20 mô hình đã qua kiểm chứng, gồm Google Gemma 4, Nvidia Nemotron 3 và Alibaba Cloud Qwen. Bên cạnh benchmark hiệu năng, các mô hình này còn được bổ sung điểm bảo mật Garak, cùng các chỉ số về rủi ro rò rỉ dữ liệu cá nhân và mức độ độc hại.

Khả năng chia sẻ hạ tầng GPU là một điểm nhấn khác trong bản cập nhật. Theo Red Hat, cơ chế fair-share scheduling phân bổ tài nguyên theo từng tenant, trong khi chế độ serving theo mức ưu tiên giúp bảo vệ các tác vụ suy luận thời gian thực và phân phần tài nguyên còn lại cho tác vụ nền. Với nhu cầu tách biệt nghiêm ngặt hơn, doanh nghiệp có thể triển khai hosted control plane dựa trên OpenShift Virtualization.

Red Hat cho biết bộ lập lịch suy luận phân tán đã được bổ sung tính năng ưu tiên chọn máy chủ có thể tái sử dụng kết quả tính toán sẵn có để rút ngắn thời gian xử lý. Dự án mã nguồn mở LLM-D, nền tảng hỗ trợ suy luận LLM phân tán trên nhiều máy chủ, hiện cũng hỗ trợ chính thức CoreWeave CKS và Microsoft Azure ngoài OpenShift, đồng thời cung cấp bản preview trên Amazon EKS.

Ở mảng ứng dụng agent, Red Hat giới thiệu AutoRAG, công cụ kết nối trực tiếp nguồn dữ liệu nội bộ của doanh nghiệp với agent, hỗ trợ tài liệu đa ngôn ngữ và tìm kiếm theo ngữ cảnh. Công ty đồng thời phát hành bản chính thức của Responses API tích hợp RAG.

Responses API được tích hợp NeMo Guardrails để chặn các lệnh gọi công cụ độc hại. Trên AI Hub, người dùng có thể sử dụng ngay các mẫu agent dựng sẵn cho rà soát mã, xử lý tài liệu và quy trình nghiên cứu.

Về khả năng quan sát vận hành, hệ thống được bổ sung các dashboard giám sát trạng thái suy luận, mức sử dụng GPU và hiệu năng mô hình. Nền tảng cũng theo dõi lượng token tiêu thụ theo từng người dùng để phục vụ phân bổ chi phí, trong khi MLflow cung cấp khả năng theo dõi trực quan hoạt động của agent.

Từ khóa

#Red Hat #Red Hat AI 3.5 #EvalHub #AutoRAG #OpenShift #GPU #LLM #RAG
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.