监控
监控是在线监测、处理IT对象运行状况的工具与过程管理。监控相当于给 团队分配了成千上万的机器人,这些机器人驻扎在硬件、平台软件、应用系统等对象中,7*24不间断的采集指标数据,并将指标的异常情况,甚至故障点信息实时触达到正确的人,确保异常信息得到响应。监控是运维组织发现潜在风险与异常的主要手段,推动监控发现的覆盖面、准确率、告警触达能力的提升,是缩短故障发现时长的关键举措。
监控的目标是“不漏报、少误报、高响应”。“不漏报”主要来源于工具能力不足与工具应用不到位,前者关注平台能力建设,重点是选择一个可扩展性的监控技术平台、监控生态,以及持续完善的监控研发能力;后者重点是建立最小监控覆盖面基面、主动式的监控覆盖面治理,以及围绕监控覆盖面治理的流程机制的完善。“少误报”主要解决大量反复误报告警让运维人员麻木、消极,进而忽视监控告警,错过了真正的监控告警的处理的问题,主要从从报警策略与报警管理入手,前者关注源端监控工具策略的精准度、统一告警对告警的收敛与抑制,后者关注告警处置涉及的维护管理、告警数据治理。“高响应”指监控告警出现后的处理时效性管理,关注告警分级、触达、升级、治理,以及响应管理要求。
从工具角度看,监控工具是一个能力集合,行业主要的解决方案包括涉及基础设施、平台软件、应用软件、应用功能、客户体验等层面的源端监控工具,以及集中式的统一告警管理组成。如果组织监控工具投入资源可以得到保证,还会建立 监控性能指标数据的集中管理,这个解决方案目前越来越受一些中大型运维组织的青睐。
相比传统监控平台,可观测是一项综合整合多种数据的、解决“未知”问题的解决方案,监控是针对“已知”故障的监控,传统监控数据是可观测系统应用的一部分。监控需要提前了解系统数据,建立针对运行数据的监控策略,而可观测是从全局角度分析数据,良好的可观测能力需要在设计阶段进行非功能性前移,当系统异常时能够让运维快速了解问题的现状和影响,并能够深入探索、跟踪问题的根因。
巡检
巡检是 主动对IT运行风险的评估发现,包括常规巡检与深度巡检,前者是高频、例行的分析,通常融入到常规运维流程;后者主要从成本角度区别于常规巡检,比如加大评估分析面、分析深度、预测分析、协同范围、问题跟踪等,通常深度巡检带有一定的风险分析主题。
巡检的目标是“ 主动评估风险”,强调的是一种主动发现风险的数字化思维模式与组织协同文化。在数字化运维阶段,巡检需在操作上要进行升级,将巡检从常规操作性例行工作与监控管理区别开,不断鼓励、促进运维专家转变被动工作方式,建立巡检的管理机制,不断的固化巡检规则、任务、报告、数据感知等解决方案,是主动运营的一个转变表现方式。比如:围绕业务连续性保障相关的重要系统性能&容量&质量管理主题的数据运营、平台软件性能&容量&质量管理主题的数据运营、重系统运行状态感知、重要系统上下游看板、交易终端交易分布、客户订单感知、功能号运行感知、业务品种分析、清算过程管理等主题分析,以及扩展到IT服务管理相关的监控告警处置效率、生产变更发布风险、应急处置效率、生产已知缺陷看板、故障应急过程管理、配置管理等主题分析。
打造数字化IT风险管理的风险感知场景将是数字化运维体系的重要方向。 风险感知场景关键的三点是:影响风险的客观信息组合、专家知识的融入、扩展到决策与执行的闭环。