AI与云服务公司MegazoneCloud与可观测性平台公司New Relic于16日在首尔江南区Goose Island Brewhouse举办“FROM CODE TO RECOVERY”活动,面向韩国企业IT从业者介绍了一套覆盖代码变更到服务恢复全流程的故障处置自动化方案。
据MegazoneCloud介绍,此次公开的自动化场景由五个阶段构成,分别为感知、研判、执行、验证和改进。具体来看,感知阶段负责实时识别异常信号;研判阶段由AI完成分析并联动审批;执行阶段可自动回滚至此前的稳定版本;验证阶段用于确认服务是否恢复正常;改进阶段则自动沉淀处置方法并完成事后复盘。
New Relic表示,平台可对应用、服务器和网络状态进行实时关联分析,识别异常信号,并自动定位疑似故障原因,帮助运维人员更快完成根因定位。
MegazoneCloud称,采用上述方案后,MTTR(平均故障恢复时间,Mean Time to Recovery)较以往最高可缩短50%。
MegazoneCloud还表示,计划先分析客户当前正在使用的解决方案及运维流程,再从实际所需功能入手,分阶段推进对接。针对不同企业的系统架构、安全策略、责任团队及审批流程,公司也将分别设计自动化场景,并提供可在客户真实环境中验证一体化运维效果的PoC,以及由SRE专家提供的运维环境诊断支持。
MegazoneCloud SRE解决方案业务单元常务Kim Hyunsoo表示,故障处置迟缓的主要原因,往往并不在于单一工具性能不足,而在于不同工具、责任团队与业务流程之间彼此割裂。基于这一判断,公司提出了打通从代码到恢复全流程的一体化自动化方案,以解决“工具很多,但响应仍然滞后”的问题。