Mistral AI vừa công bố Shieldstral, mô hình an toàn đa phương thức cỡ nhỏ dùng để phân loại đầu vào và đầu ra của các mô hình AI. Theo SiliconANGLE ngày 5/8/2026 (giờ địa phương), đây là mô hình open-weight, cho phép nhà phát triển nhập chính sách bằng ngôn ngữ tự nhiên trong quá trình vận hành, sau đó trả về điểm đánh giá an toàn cùng kết luận đạt hoặc không đạt.
Shieldstral có thể xử lý đồng thời văn bản và hình ảnh mà không cần huấn luyện lại. Quy trình sử dụng bắt đầu bằng việc nhà phát triển nhập một hướng dẫn tổng quát nêu rõ mục tiêu và tiêu chí đánh giá an toàn, sau đó đưa vào truy vấn của người dùng cùng nội dung cần kiểm tra.
Theo Mistral AI, Shieldstral không đơn thuần ghi nhớ câu chữ trong chính sách, mà được huấn luyện để phân biệt những tiêu chí gần nhau nhưng khác biệt về bản chất. Chẳng hạn, mô hình có thể phân biệt rõ nội dung “liên quan đến mã độc” với “thảo luận về an ninh mạng”, qua đó phát hiện trường hợp chỉ vi phạm một tiêu chí cụ thể.
Công ty cho biết Shieldstral đạt hiệu năng nổi bật trong nhóm mô hình cỡ nhỏ. Cụ thể, mô hình ghi nhận điểm an toàn văn bản trung bình 84,9% trên nhiều bộ đánh giá chuẩn, tương đương hoặc cao hơn các mô hình có quy mô lớn hơn 7 lần. Với các bộ đánh giá an toàn hình ảnh đa phương thức, điểm trung bình của Shieldstral đạt 83,8%, cao hơn tất cả mô hình cơ sở trong cùng nhóm đánh giá.