MegazoneCloud và New Relic ngày 16/9 đã giới thiệu quy trình tự động hóa 5 bước cho xử lý sự cố CNTT, bao phủ toàn bộ chuỗi vận hành từ thay đổi mã nguồn đến khôi phục dịch vụ. Theo hai doanh nghiệp, cách tiếp cận này có thể giúp rút ngắn MTTR tới 50%.
Thông tin được công bố tại sự kiện “FROM CODE TO RECOVERY” diễn ra ở Goos Island Brewhouse, quận Gangnam, Seoul. Tại đây, hai bên trình bày kịch bản tự động hóa toàn bộ quy trình ứng phó sự cố dành cho doanh nghiệp.
Theo MegazoneCloud, quy trình được giới thiệu gồm 5 bước: phát hiện dấu hiệu bất thường theo thời gian thực; đánh giá, trong đó AI hỗ trợ phân tích và phê duyệt; thực thi bằng cách tự động đưa hệ thống về phiên bản ổn định trước đó; xác minh hệ thống đã trở lại trạng thái bình thường; và cải tiến thông qua việc tự động ghi nhận phương án xử lý, phục vụ phân tích sau sự cố.
New Relic cho biết nền tảng của hãng liên kết dữ liệu thời gian thực từ ứng dụng, máy chủ và mạng để phát hiện bất thường. Hệ thống cũng tự động xác định các điểm nghi ngờ là nguyên nhân gây sự cố, qua đó giúp rút ngắn thời gian khoanh vùng vấn đề.
MegazoneCloud cho biết trong thời gian tới, công ty sẽ phân tích các giải pháp và quy trình vận hành mà khách hàng đang sử dụng để triển khai kết nối theo từng giai đoạn, ưu tiên các chức năng cần thiết trước. Doanh nghiệp cũng sẽ thiết kế kịch bản tự động hóa phù hợp với cấu trúc hệ thống, chính sách bảo mật, cơ cấu phụ trách và quy trình phê duyệt của từng khách hàng.
Bên cạnh đó, công ty cho biết sẽ hỗ trợ PoC nhằm kiểm chứng hiệu quả vận hành tích hợp trong môi trường thực tế của khách hàng, đồng thời cung cấp đánh giá môi trường vận hành bởi các chuyên gia SRE.
Ông Kim Hyun-su, Giám đốc điều hành phụ trách đơn vị kinh doanh giải pháp SRE của MegazoneCloud, nhận định nguyên nhân lớn nhất khiến việc ứng phó sự cố bị chậm không nằm ở hiệu năng của từng giải pháp đơn lẻ, mà ở sự đứt gãy giữa các công cụ, bộ phận phụ trách và quy trình công việc.
Theo ông, MegazoneCloud đã đề xuất một phương án tự động hóa tích hợp, kết nối toàn bộ quy trình từ mã nguồn đến khôi phục dịch vụ. Đây được xem là hướng xử lý cho bài toán “nhiều công cụ nhưng tốc độ xử lý sự cố vẫn chậm”.