DevOps专业术语
SRE
Site Reliability Engineering
站点可靠性工程 · 用写代码的方式做运维
SRE可观测性
SRE
- 定义
- SRE(Site Reliability Engineering)是DevOps领域的专业术语。SRE 是 Google 提出的运维方法论:用软件工程的思维和工具来保障系统可靠性。
最后更新:2026-03-18
什么是SRE?
SRE 是 Google 提出的运维方法论:用软件工程的思维和工具来保障系统可靠性。SRE 团队写代码来自动化运维任务,用 SLO/SLI 量化可靠性目标,用 Error Budget 平衡可靠性和迭代速度。
- Google 提出,用软件工程方法做运维
- 核心概念:SLO、SLI、Error Budget
- SRE 不是运维的新名字,是一种工程文化
SRE详解
SRE 由 Google VP Ben Treynor 在 2003 年创立,核心理念是「用软件工程方法解决运维问题」。SRE 的关键实践包括:SLO(服务级别目标)定义可靠性标准、SLI(服务级别指标)量化实际表现、Error Budget(错误预算)在可靠性和迭代速度之间取得平衡。当 Error Budget 充足时加速发布,耗尽时冻结变更专注稳定性。SRE 文化强调自动化一切可自动化的工作,将 Toil(重复性手工操作)降到最低。
SRE的应用场景
正式定义
用软件工程方法和自动化工具保障大规模系统可靠性的工程实践体系
应用场景
- 大规模系统的可靠性保障
- 运维自动化和 Toil 消除
- 服务级别目标的定义和管理
常见误区
- SRE 不是运维的新名字,核心是工程化思维
- SRE 不追求 100% 可用性,而是在可靠性和迭代间平衡
- SRE 不只是 Google 的事,中小公司也能实践 SRE 理念
实际案例
📌 Google 的 Error Budget
Google 的 SRE 团队为每个服务设定 SLO(如 99.95% 可用性),对应每月 21.6 分钟的 Error Budget。当 Budget 耗尽时,团队必须停止新功能发布,专注于稳定性改进。
SRE的参考来源
关于SRE的常见问题
- SRE 和 DevOps 有什么区别
- DevOps 是文化和方法论,SRE 是 Google 提出的具体实践框架,SRE 可以看作 DevOps 的一种实现方式。
- SRE 的核心指标有哪些
- SLI(服务水平指标)、SLO(服务水平目标)、SLA(服务水平协议)、Error Budget(错误预算)。