老计聊SRE 09:容量规划,别等雪崩了才想起扩容

发布时间:2026/9/15 9:11:59

老计聊SRE 09:容量规划,别等雪崩了才想起扩容 老计聊SRE 09容量规划,别等雪崩了才想起扩容本系列的示例应用和脚本开源在 GitHub(仓库地址见文末)。本篇的压测数据来自对示例应用的真实实验。本篇目标上一篇我们让单个服务学会了自愈。但自愈解决的是坏了怎么恢复,没解决流量太大扛不住。大促、热点、突发流量,这些不是故障,是容量问题。容量规划要回答的核心问题是:你的系统到底能扛多少,瓶颈在哪,该怎么扩。学完本篇你将掌握:为什么容量规划的第一步不是加机器,而是找瓶颈怎么用压测测出真实的容量上限用一组反直觉的真实数据,看清瓶颈到底在哪找到瓶颈之后,扩容的正确方向一、扩容不是无脑加机器先说个很常见的误区。服务慢了、卡了,很多人的第一反应是:加机器。加到不卡为止。有时候确实管用,但很多时候,钱花了,问题还在。为什么?因为你可能加错了地方。一个系统的瓶颈可能在 CPU、可能在内存、可能在数据库连接数、可能在单进程的处理能力、也可能在某个第三方依赖。如果瓶颈在数据库,你把应用服务器加了十台,数据库照样是那个瓶颈,一点没缓解,只是白烧钱。所以容量规划的第一步,从来不是加机器,而是:先搞清楚瓶颈到底在哪。找错了瓶颈,后面全是无用功。怎么找?靠压测。二、压测:把系统压到极限,看它先在哪断压测就是主动给系统加压,一点点加大流量,观察它什么时候开始扛不住、以及是哪个环节先扛不住。压测时主要盯两个东西:吞吐量:系统每秒能处理多少个请求(req/s)。这是它的产能。延迟:随着压力增大,请求变慢了多少(还是看 P95/P99,别看平均)。理想情况是:流量加大,吞吐跟着涨,延迟基本稳定。直到某个点,吞吐涨不动了、或者延迟开始飙升、或者开始出错,那个点就是容量拐点,也暴露了瓶颈在哪。关键是:压测要压到系统真的开始难受为止,只有压到极限,才能看清它的天花板在哪。压一半就停,你永远不知道它还能扛多少、会先在哪断。三、动手:一组反直觉的真实压测我们对示例应用做了一次压测,不断加大并发,看它的吞吐和延迟怎么变。先看并发从小到大的结果:并发 1: 吞吐 134 req/s P99 1ms 并发 10: 吞吐 186 req/s P99 18ms 并发 50: 吞吐 ~185 req/s P99 ~18ms 并发 100: 吞吐 ~185 req/s P99 ~19ms并发从 1 加到 10,吞吐从 134 涨到了 186。但从 10 往上,不管加到 50 还是 100,吞吐都卡在 185 左右不动了。我们继续往极限压,把并发一路加到 800:并发 50 到 800: 吞吐稳定 181 到 186 req/s 零失败 P95/P99 稳定 14 到 22ms并发一路加到800,吞吐却死死卡在每秒185不动这个结果第一眼看很反直觉:并发从 50 加到 800,翻了16倍,吞吐居然一点没涨,还是 185 左右,而且零失败、延迟也稳。这说明什么?四、看懂数据:瓶颈不是并发,是单进程吞吐这组数据其实把瓶颈指得很清楚。并发加到 800 都零失败、延迟也稳,说明这个服务承载并发连接的能力绰绰有余,瓶颈根本不在能同时接多少请求上。真正的瓶颈是:吞吐死死卡在每秒 185 个请求。不管前面涌进来多少并发,它每秒就只能吐出 185 个。多出来的请求只是在排队,排到了就处理,所以不失败,但整体产能上不去。原因是这个服务跑的是单进程,单进程的处理能力就这么大(这台是2核的小机器)。这时候你要是去加并发、加连接数,一点用都没有,因为瓶颈不在那。正确的扩容方向是提升吞吐能力:比如把单进程改成多进程(多个 worker),或者部署多个实例用负载均衡分流。只有对着真正的瓶颈下手,扩容才有效果。瓶颈在单进程吞吐,加并发没用,要加worker或多实例这就是我开头说的:先找瓶颈,再扩容。如果没做这次压测,只看到服务好像到量了,很可能就去加并发、加连接池,结果白忙一场。压测让我们看清了真正的天花板在哪。五、容量规划不是一次性的找到瓶颈、扩了容,也不是就一劳永逸了。容量规划是个持续的事。留出余量(headroom):别把容量卡在刚好够用。流量有波动、有突发,通常要留一定的缓冲,比如让日常负载只占容量的一部分,给尖峰留空间。结合业务预期:大促、活动、季节性高峰,这些能预见的流量高峰,要提前按预期规划容量,别到时候临时抱佛脚。自动扩缩:对流量波动大的场景,可以用自动扩缩(根据负载自动增减实例),高峰自动扩、低谷自动缩,既扛得住又省钱。这也呼应了前面讲的健康检查,扩出来的新实例要健康检查通过才接流量。定期重新压测:系统在迭代,依赖在变,今天的容量结论过几个月可能就变了,要定期重新测。容量规划的目标是:在流量真正涨上来之前,就知道自己能扛多少、该怎么扩,而不是等雪崩了才手忙脚乱。容量要留出余量,别把日常负载卡在天花板六、小结扩容第一步不是加机器,是找瓶颈,加错地方等于白烧钱压测要把系统压到真正难受为止,盯住吞吐和延迟(P95/P99),找到容量拐点真实数据反直觉:并发从50加到800都零失败,但吞吐死卡在185 req/s,说明瓶颈是单进程吞吐而非并发对着真正的瓶颈扩容才有效:吞吐瓶颈要加 worker 或多实例,加并发没用容量规划是持续的:留余量、结合业务预期、用自动扩缩、定期重新压测下一篇:大部分线上故障其实都来自一次发布,变更管理,怎么让发布不再是故障的最大来源。参考链接本系列开源仓库(示例应用 压测脚本):https://github.com/Jich1123/sre-aws-labGoogle SRE Book - Software Engineering in SRE(容量与压测):https://sre.google/sre-book/software-engineering-in-sre/Google SRE Book - Handling Overload(过载处理):https://sre.google/sre-book/handling-overload/Google SRE Workbook - Managing Load:https://sre.google/workbook/managing-load/
延伸阅读

更多相关文章

2026/9/15 9:11:59

HarmonyOS 7 新特性(八十四)|进程管控时长:策略租约与恢复机制

HarmonyOS 7 已进入 26.0.0 Release 阶段。Enterprise Data Guard Kit 的本次能力适合解决“企业设备在考试或机密会议期间临时限制指定应用进程运行”这一类真实问题,但高质量接入绝不是复制一段 API 调用:还要补齐能力门禁、领域契约、状态机、异常恢复…

2026/9/15 9:06:58

BLM战略规划培训与实战案例【附全文阅读】

本 PPT 是战略咨询、企业战略规划、SP/BP 编制项目标杆培训素材,适配集团战略研讨、高管赋能、战略落地类投标与内训。完整拆解 IBM BLM 业务领先模型,打通从差距识别、战略规划到战略执行的全闭环。文档详解业绩差距、机会差距两类起点,覆盖…

2026/9/15 9:06:58

WeKnora:面向企业级RAG的DeepSeek Harness知识调度中枢

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/15 9:22:00

Open Moltbot多Agent系统部署与优化指南

1. Open Moltbot多Agent系统概述Open Moltbot作为新兴的多Agent开发框架,正在改变传统自动化任务的实现方式。这个开源项目通过分布式智能体协作机制,让复杂任务的分解与执行变得前所未有的简单。我在实际部署过程中发现,相比单Agent系统&…

2026/9/15 9:22:00

AmberTools25:分子模拟性能提升与跨学科应用

1. AmberTools25:分子模拟领域的重大突破作为一名从事计算化学研究十余年的从业者,我见证了分子模拟工具从简陋命令行到如今功能强大的完整套件的演进历程。AmberTools作为分子动力学模拟领域的标杆工具集,其最新发布的25版本带来了多项令人振…

2026/9/15 9:22:00

SSH整合实战:Struts2+Hibernate+Spring超市系统解析

简介:这份基于Struts2HibernateSpring框架的超市信息管理系统源码,面向正在学习Java EE三大框架整合的开发者、高校学生及课程设计人群。项目完整涵盖商品浏览、购物车管理、订单处理、用户登录与权限控制等典型电商业务模块,真实演示了Strut…

2026/9/15 9:22:00

BarTender软件及打印机驱动下载地址

BarTender 下载网址https://portal.seagullscientific.com/downloads/bartender大家可根据自己的电脑系统选择需要下载的安装包历史版本下载入口点击页面下方的「其他版本和选项」,即可查看并下载 BarTender 的历史版本安装包。BarTender打印机驱动官网网址https://…

2026/9/15 9:22:00

freertos相关问题

1. 列表与队列List 是 FreeRTOS 内核自己用来管理对象的内部数据结构。FreeRTOS 的 List 本质是一个链表管理结构Queue 是提供给用户任务/中断通信的数据结构。Queue 是 FreeRTOS 提供给用户的通信机制两者最大的区别ListQueue中文列表(使用链表实现)队列主要用途内核管理任务通…

2026/9/15 9:16:59

【2016-11-02】Python绘制框架tkinter简单学习笔记

[历史归档] 本文原发布于 cstriker1407.info 个人博客,内容为历史存档,仅供参考。 发布时间: 2016-11-02 | 标题:Python绘制框架tkinter简单学习笔记 | 分类: 编程 / python && jyt…

2026/9/15 4:54:30

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/15 0:01:16

AI英语单词APP开发:自适应学习算法与移动端优化实践

1. 项目概述 作为一名在移动应用开发领域摸爬滚打多年的老手,我最近完成了一个AI英语单词APP的开发项目。这个项目将传统单词记忆方法与现代AI技术相结合,打造了一款能够智能适应不同用户学习习惯的英语学习工具。 市面上大多数单词APP都存在一个通病&a…

2026/9/15 0:01:16

Flutter与OpenHarmony结合开发手语学习APP实战

1. 项目背景与核心价值作为一名同时接触过Flutter和OpenHarmony的开发者,最近我完成了一个基于Flutter for OpenHarmony的手语学习APP实战项目。这个项目最大的特点在于实现了跨平台框架与国产操作系统深度结合的创新实践——用Flutter开发的应用能完美运行在OpenHa…

2026/9/15 0:01:16

六个月成为机器人工程师:从ROS2到SLAM的实战路径

1. 六个月的紧迫感从哪来:先搞清楚你要成为哪种机器人工程师说实话,六个月的期限并不是一个宽松的时间线。市面上任何一本正经的机器人学教材都超过五百页,ROS2的官方文档可以翻到你怀疑人生,再加上ABB、KUKA这些工业机器人厂家动…

2026/9/14 11:59:31

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/14 13:53:59

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/14 11:22:57

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码