发布时间:2026/7/30 11:12:38
Docker Compose 实战:多服务编排、depends_on 与健康检查的正确姿势 Docker Compose 实战:多服务编排、depends_on 与健康检查的正确姿势一个稍微像样的后端项目,本地跑起来往往不止一个容器:一个 web 服务、一个 Postgres、一个 Redis。用docker run一个个手敲命令,端口、网络、环境变量全靠记忆,换台机器重来一遍——这活儿谁干谁烦。Docker Compose 就是把这套「多容器怎么起、怎么连、按什么顺序起」写进一个 YAML 文件,一条docker compose up全部拉起来。这篇不讲 Compose 是什么这种废话,直接从一个能跑的三服务项目出发,重点讲两个最容易踩坑的地方:服务依赖顺序和健康检查。一个最小可用的三服务编排假设项目结构是一个 Node/Python web 服务 Postgres Redis。docker-compose.yml这样写:services:web:build:.# 用当前目录的 Dockerfile 构建ports:-8080:8080# 宿主机:容器environment:DATABASE_URL:postgres://app:secretdb:5432/appdbREDIS_URL:redis://cache:6379depends_on:-db-cachedb:image:postgres:16environment:POSTGRES_USER:appPOSTGRES_PASSWORD:secretPOSTGRES_DB:appdbvolumes:-pgdata:/var/lib/postgresql/data# 数据持久化,别每次 down 就丢库cache:image:redis:7volumes:pgdata:# 具名卷,交给 Docker 管理docker compose up -d后台拉起三个容器。这里有个新手最容易忽略的关键点:web 服务连数据库的地址是db:5432,不是localhost:5432。因为 Compose 会自动建一个网络,把所有服务放进去,服务名(db、cache)就是 DNS 主机名,容器之间用服务名互访。写成localhost会连到容器自己身上,必然连不上——这是排查「本地能跑,Compose 里连不上数据库」的第一嫌疑。depends_on 的真相:它只保证「启动顺序」,不保证「就绪」上面用了depends_on: [db, cache],很多人以为这表示「等数据库准备好接受连接了,再启动 web」。错。depends_on只保证容器启动的先后顺序——db 容器先start,web 容器后start。但 Postgres 容器「进程起来了」和「数据库能接受连接了」之间还有几秒初始化时间。结果就是经典翻车现场:web 容器一启动就去连db:5432,而 Postgres 还在初始化,连接被拒,web 直接崩溃退出。web-1 | Error: connect ECONNREFUSED db:5432 web-1 exited with code 1要真正「等数据库就绪」,得给 db 加健康检查,再让 web 用depends_on的condition: service_healthy语法等它健康。用 healthcheck condition 等服务真正就绪改进版:services:web:build:.ports:-8080:8080environment:DATABASE_URL:postgres://app:secretdb:5432/appdbREDIS_URL:redis://cache:6379depends_on:db:condition:service_healthy# 等 db 健康检查通过再启动cache:condition:service_healthydb:image:postgres:16environment:POSTGRES_USER:appPOSTGRES_PASSWORD:secretPOSTGRES_DB:appdbvolumes:-pgdata:/var/lib/postgresql/datahealthcheck:# pg_isready 是 postgres 自带的探活命令,能连上才算健康test:[CMD-SHELL,pg_isready -U app -d appdb]interval:5s# 每 5s 探一次timeout:3s# 单次探测 3s 超时retries:5# 连续 5 次失败才判定 unhealthystart_period:10s# 前 10s 是启动宽限期,失败不计入 retriescache:image:redis:7healthcheck:test:[CMD,redis-cli,ping]# 返回 PONG 即健康interval:5stimeout:3sretries:5volumes:pgdata:现在的启动流程变成:db、cache 容器启动,Compose 开始跑它们的 healthcheck;pg_isready/redis-cli ping通过后,db、cache 状态变为healthy;此时web 才启动,连数据库时对面已经就绪,不会再 ECONNREFUSED。几个 healthcheck 参数别配错:start_period是关键。数据库启动本身要几秒,这段时间探测失败是正常的。设了start_period: 10s,前 10 秒的失败不算进retries,避免容器还在正常启动就被误判 unhealthy 而重启。interval × retries大致是「最坏多久判定挂掉」。上面是5s × 5 25s,按服务实际启动速度调。test用CMD是直接执行数组里的命令;用CMD-SHELL是丢给/bin/sh -c跑,需要用到管道、变量、时用后者。应用自己的健康检查:光连上不够,要能干活数据库pg_isready只说明「能连」,不代表「表建好了、迁移跑完了」。对你自己的 web 服务,健康检查应该打一个真正反映「能对外服务」的接口:web:build:.ports:-8080:8080healthcheck:# 假设应用暴露了 /healthz,内部会检查 DB 连接池等test:[CMD,curl,-f,http://localhost:8080/healthz]interval:10stimeout:3sretries:3start_period:15scurl -f在 HTTP 状态码非 2xx 时返回非零退出码,正好被 healthcheck 判为失败。这样docker compose ps能直接看出 web 是不是真的活着,而不是「进程在但接口 500」。注意:test里的命令必须是容器镜像里真实存在的。基于alpine的精简镜像可能没有curl,那就用wget -q -O- http://...或在 Dockerfile 里装上 curl,否则健康检查永远失败。常用运维命令速查写完编排,日常就这几条命令:# 构建并后台启动全部服务dockercompose up-d--build# 看每个服务状态(能看到 healthy / unhealthy)dockercomposeps# 跟踪某个服务的日志dockercompose logs-fweb# 进容器排查dockercomposeexecdb psql-Uapp-dappdb# 只重启一个服务(改了代码重新构建)dockercompose up-d--buildweb# 停止并删除容器、网络(具名卷默认保留,数据还在)dockercompose down# 连数据卷一起删(慎用,会清库)dockercompose down-vdown和down -v的区别是新手最爱踩的坑:down保留具名卷(pgdata),数据库数据还在;down -v会把卷也删掉,库就清空了。想重置环境从零来过才用-v,平时别手滑。小结Compose 自动建网络,服务名就是主机名,容器间互访用db:5432而不是localhost。depends_on只管启动顺序,不管就绪;要等服务真正可用,必须配healthcheckdepends_on: condition: service_healthy。healthcheck 的start_period给足启动宽限期,避免正常启动被误判重启;数据库用pg_isready、Redis 用redis-cli ping、web 打自己的/healthz。healthcheck 的test命令必须在镜像里真实存在(精简镜像可能没curl)。down保数据,down -v删卷清库,别搞混。记忆点:depends_on保证「谁先起」,healthcheck才保证「起好了没」——两个一起用,才是真正的按序拉起。

相关新闻

2026/7/30 11:12:38

【计算机毕业设计单片机案例】基于单片机阈值可调的婴儿监护设备开发 基于自动手动双模式的婴儿看护装置设计(012201)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/7/30 12:17:41

COMSOL模拟雪花枝晶生长:多物理场耦合与参数优化

1. 雪花枝晶体的物理本质与仿真价值雪花是大自然最精妙的艺术品之一,每个晶体都展现着独特的六边形对称结构。从物理学角度看,雪花属于枝晶生长(Dendritic Growth)的典型范例,其形成过程涉及复杂的相变动力学、热力学和…

2026/7/30 12:17:41

STM32硬件SPI驱动三线SPI-LCD:协议解析与DMA优化实践

1. 从三线SPI-LCD的“非主流”说起如果你玩过STM32驱动LCD,大概率用过8080并口或者标准的4线SPI。前者速度快但占引脚多,后者协议简单但也要4根线(SCK, MOSI, MISO, CS)。但最近在一些追求极致成本或特定封装的小尺寸LCD模块上&am…

2026/7/30 12:17:41

基于启发式搜索的最优路径规划算法研究7

引言路径规划问题的背景与重要性启发式搜索在路径规划中的核心作用研究目标与文章结构概述路径规划问题定义路径规划的数学建模(图论与状态空间表示)最优路径的评估标准(如最短距离、最少时间、最低成本)常见应用场景(…

2026/7/30 12:17:41

Python在芯片健康评估中的实战应用

1. 芯片健康评估:为什么需要Python这把"手术刀"在半导体行业摸爬滚打十几年,我见过太多工程师面对芯片异常时的手足无措。去年有个典型案例:某工业控制器批量出现间歇性死机,厂商更换了所有外围元件仍无法解决&#xff…

2026/7/30 12:17:41

隐含参数 _b_tree_bitmap_plans 导致 SQL 执行计划劣化

问题现象:同一关键 SQL,一厂平均执行 12ms,三厂平均执行 700ms(三厂数据量更小)根因:三厂数据库设置了隐含参数 _b_tree_bitmap_plansFALSE,禁用了 BITMAP CONVERSION TO ROWIDS 访问路径&#…

2026/7/30 12:12:41

MATLAB小波变换实战:信号去噪与数据压缩算法详解

1. 项目概述:从噪声中“听见”信号的艺术 在信号分析的世界里,我们常常面对一个尴尬的现实:采集到的原始信号,就像一张沾满灰尘的老照片,有用的信息总是被各种噪声所掩盖。无论是心电图中混杂的肌电干扰,还…

2026/7/29 22:32:30

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

2026/7/30 0:01:39

[GESP202606 四级] 扫雷

B4557 [GESP202606 四级] 扫雷 https://www.luogu.com.cn/problem/B4557 中国计算机学会(CCF)2026年6月C四级讲解——扫雷 https://www.bilibili.com/video/BV1MCMg6AEXR/ B4557 [GESP202606 四级] 扫雷 https://www.bilibili.com/video/BV1ZKTj6ZEVh/ 2…

2026/7/30 0:01:39

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/29 13:12:43

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…