发布时间:2026/8/10 6:29:29
AlmaLinux容器化部署Prometheus+Grafana监控系统实战 1. 项目概述在AlmaLinux系统上通过容器化方式部署PrometheusGrafana监控套件是当前企业级监控系统搭建的主流方案之一。作为CentOS的替代品AlmaLinux凭借其稳定性和长期支持特性成为众多运维团队的首选操作系统。而将Prometheus指标采集与Grafana数据可视化这两个黄金组合以Docker容器方式部署既能保证环境隔离又能简化依赖管理。我最近在客户生产环境中实际部署了这套监控系统发现相比传统二进制安装方式容器化部署可以节省约60%的配置时间且更容易实现版本管理和快速迁移。下面将详细介绍从零开始完成整套部署的关键步骤和实战技巧。2. 环境准备2.1 系统基础配置首先确保使用AlmaLinux 8或9版本推荐9.3执行系统更新sudo dnf update -y sudo dnf install -y yum-utils device-mapper-persistent-data lvm2注意如果是从CentOS迁移过来的系统建议检查/etc/os-release确认系统类型避免残留的CentOS源导致依赖冲突。2.2 Docker环境安装添加Docker官方仓库sudo yum-config-manager --add-repo https://download.docker.com/linux/centos/docker-ce.repo安装Docker引擎sudo dnf install -y docker-ce docker-ce-cli containerd.io启动并设置开机自启sudo systemctl enable --now docker验证安装sudo docker run hello-world2.3 防火墙与SELinux配置AlmaLinux默认启用了firewalld和SELinux需要适当调整# 放行Docker使用的端口范围 sudo firewall-cmd --permanent --zonepublic --add-port3000/tcp # Grafana sudo firewall-cmd --permanent --zonepublic --add-port9090/tcp # Prometheus sudo firewall-cmd --reload # SELinux设置为permissive模式生产环境建议保持enforcing并配置正确策略 sudo setenforce 0 sudo sed -i s/^SELINUXenforcing/SELINUXpermissive/ /etc/selinux/config3. Prometheus容器化部署3.1 配置文件准备创建配置目录结构mkdir -p ~/monitoring/prometheus/{data,conf} chmod 777 ~/monitoring/prometheus/data # 确保容器有写入权限编写Prometheus主配置文件~/monitoring/prometheus/conf/prometheus.ymlglobal: scrape_interval: 15s evaluation_interval: 15s scrape_configs: - job_name: prometheus static_configs: - targets: [localhost:9090]3.2 启动Prometheus容器使用官方镜像运行容器docker run -d \ --nameprometheus \ --restartalways \ -p 9090:9090 \ -v ~/monitoring/prometheus/conf:/etc/prometheus \ -v ~/monitoring/prometheus/data:/prometheus \ prom/prometheus:latest \ --config.file/etc/prometheus/prometheus.yml \ --storage.tsdb.path/prometheus \ --web.console.templates/etc/prometheus/consoles \ --web.console.libraries/etc/prometheus/console_libraries关键参数说明--restartalways确保容器异常退出后自动重启-v挂载卷持久化配置和时序数据--storage.tsdb.path指定TSDB存储路径3.3 验证部署访问http://服务器IP:9090应该能看到Prometheus Web界面。通过Status Targets可以查看当前监控目标状态。4. Grafana容器化部署4.1 启动Grafana容器docker run -d \ --namegrafana \ --restartalways \ -p 3000:3000 \ -v ~/monitoring/grafana/data:/var/lib/grafana \ grafana/grafana-oss:latest4.2 初始配置访问http://服务器IP:3000默认账号admin/admin首次登录会要求修改密码添加Prometheus数据源Configuration Data Sources Add data source选择PrometheusURL填写http://prometheus容器IP:9090点击Save Test技巧如果不知道Prometheus容器IP可以用docker inspect prometheus | grep IPAddress查询4.3 导入仪表盘Grafana官方提供丰富的仪表盘模板导航到Dashboards New Import输入模板ID如1860用于Node Exporter仪表盘选择刚添加的Prometheus数据源点击Import完成导入5. 进阶配置与优化5.1 使用Docker Compose编排创建docker-compose.yml统一管理服务version: 3 services: prometheus: image: prom/prometheus:latest container_name: prometheus restart: always ports: - 9090:9090 volumes: - ./prometheus/conf:/etc/prometheus - ./prometheus/data:/prometheus command: - --config.file/etc/prometheus/prometheus.yml - --storage.tsdb.path/prometheus - --web.console.templates/etc/prometheus/consoles - --web.console.libraries/etc/prometheus/console_libraries grafana: image: grafana/grafana-oss:latest container_name: grafana restart: always ports: - 3000:3000 volumes: - ./grafana/data:/var/lib/grafana depends_on: - prometheus启动服务docker-compose up -d5.2 添加Node Exporter监控主机在需要监控的机器上运行docker run -d \ --namenode_exporter \ --restartalways \ --nethost \ --pidhost \ -v /:/host:ro,rslave \ prom/node-exporter:latest \ --path.rootfs/host然后在Prometheus配置中添加jobscrape_configs: - job_name: node static_configs: - targets: [主机IP:9100]5.3 配置告警规则在prometheus.yml同目录创建alerts.ymlgroups: - name: host_stats rules: - alert: HighMemoryUsage expr: (node_memory_MemTotal_bytes - node_memory_MemAvailable_bytes) / node_memory_MemTotal_bytes * 100 90 for: 5m labels: severity: warning annotations: summary: High memory usage on {{ $labels.instance }} description: Memory usage is {{ $value }}%在prometheus.yml中启用告警规则rule_files: - alerts.yml6. 常见问题排查6.1 容器无法访问外部网络现象Prometheus无法抓取其他主机的exporter数据解决方案# 检查Docker网络模式 docker network inspect bridge # 临时解决方案使用host网络模式 docker run --nethost ...6.2 数据卷权限问题现象容器启动失败日志显示permission denied解决方案# 递归修改数据目录权限 sudo chown -R 472:472 ~/monitoring/grafana/data sudo chown -R nobody:nobody ~/monitoring/prometheus/data6.3 Prometheus存储优化对于长期运行的监控系统需要调整TSDB配置# 在prometheus.yml中添加 storage: tsdb: retention: 15d # 数据保留周期 wal_compression: true # 启用WAL压缩7. 生产环境建议资源限制为容器设置合理的CPU和内存限制docker run --memory2g --cpus1 ...日志管理配置日志轮转docker run --log-driverjson-file --log-opt max-size50m --log-opt max-file3 ...备份策略定期备份重要数据# 备份Prometheus数据 tar czvf prometheus_backup.tar.gz ~/monitoring/prometheus/data # 备份Grafana配置 docker exec grafana grafana-cli admin backup backup-fileHTTPS配置通过Nginx反向代理添加SSL证书高可用方案考虑部署Prometheus HA集群和Grafana多实例这套容器化监控方案已经在多个生产环境稳定运行相比传统部署方式最大的优势在于环境隔离避免与系统其他服务产生依赖冲突快速部署全新环境10分钟内可完成全套部署易于维护通过容器编排工具实现一键更新和回滚资源可控精确限制每个组件的资源使用量实际使用中建议配合cAdvisor实现容器监控再结合Alertmanager构建完整的告警体系。对于大规模环境可以考虑使用VictoriaMetrics替代Prometheus以获得更好的性能。

相关新闻

2026/8/10 6:29:29

石景山网站建设公司怎么做才能让客户满意及价格透明的深度解析与避坑指南

咱们今天不整那些虚头巴脑的互联网黑话,也不谈什么颠覆行业的大宏观叙事,就聊聊一个特别接地气,但又让很多石景山老板们头疼的事儿:怎么找一家靠谱的石景山网站建设公司。我见过太多创业者,手里攥着几万到几十万的预算,满心欢喜地去找人做网站,结果回来哭得比谁都惨。有…

2026/8/10 6:24:29

算法面试——动态规划:0-1背包、最长子序列

一、0-1 背包 public int knapsack(int[] weights, int[] values, int capacity) {int n weights.length;int[][] dp new int[n 1][capacity 1];for (int i 1; i < n; i) {for (int w 1; w < capacity; w) {if (weights[i-1] > w) {dp[i][w] dp[i-1][w];} else…

2026/8/10 6:24:29

Java集合框架详解:List与Set核心实现与性能优化

1. Java集合框架概述Java集合框架是Java语言中最重要的基础库之一&#xff0c;它为开发者提供了一套完善的容器类&#xff0c;用于存储和操作对象组。这套框架从JDK 1.2开始引入&#xff0c;经过20多年的发展已经成为Java开发中不可或缺的部分。集合框架的核心设计理念是提供高…

2026/8/10 7:19:31

考研数学高效刷题:250题递进式巩固与知识网络构建指南

这类考研数学强化题的合集&#xff0c;最值得关注的不是它有多少道题&#xff0c;而是它“以题带点、前后关联”的编排逻辑。如果你正在做《660题》、《880题》或者真题&#xff0c;感觉知识点是散的&#xff0c;题目之间没有联系&#xff0c;那么这个“250题”的思路就很适合你…

2026/8/10 7:19:31

Unity网络编程基础:从Socket到TCP客户端服务器实现

1. 项目概述与核心价值最近在带几个刚入行的Unity新人&#xff0c;发现他们一提到网络通讯&#xff0c;第一反应就是去找Asset Store里的插件&#xff0c;或者直接上Unity自带的UNet&#xff08;虽然现在官方主推Netcode for GameObjects&#xff09;。这其实挺可惜的&#xff…

2026/8/10 7:19:31

AI编程助手进阶:Hermes 0.18.2 Goal功能实战,实现任务规划与自动验证

如果你最近在关注 AI 编程助手&#xff0c;可能会发现一个现象&#xff1a;很多工具都在强调“理解复杂任务”和“自动拆解执行”。但当你真正把一个模糊的需求丢给它时&#xff0c;得到的往往是一堆零散的代码片段&#xff0c;或者干脆告诉你“这超出了我的能力范围”。问题出…

2026/8/10 7:19:31

AI Agent任务规划新范式:Hermes Goal与LLM-as-Judge实战解析

如果你最近在关注 AI Agent 开发&#xff0c;尤其是基于开源框架构建智能体&#xff0c;那么“如何让 Agent 理解并执行复杂任务”这个问题&#xff0c;一定让你头疼过。我们常常遇到这样的困境&#xff1a;给 Agent 一个简单的指令&#xff0c;比如“写个冒泡排序”&#xff0…

2026/8/10 7:14:31

从零搭建本地AI编程环境:Codex生态核心组件与实战指南

如果你是一名开发者&#xff0c;最近一定在各种技术社区和社群里频繁看到“Codex”这个词。它可能和“AI编程助手”、“自动生成代码”、“GitHub Copilot背后的模型”这些描述联系在一起。但当你真正想上手试试时&#xff0c;却发现信息很零散&#xff1a;官网在哪&#xff1f…

2026/8/9 0:01:56

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片&#xff1a;Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/10 5:09:58

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map&#xff0c;七种策略与六类陷阱引言&#xff1a;128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token&#xff08;≈ 0.5MB ~ 4MB 文本&#xff09;&#xff0c;但 LLM 想要处理的真实数据规模远远超过这个量级&#xff1a;真实…

2026/8/10 0:04:00

# AI视频生成2026:多模态控制与工程化落地的技术跃迁

## AI视频生成2026&#xff1a;多模态控制与工程化落地的技术跃迁### 背景&#xff1a;从"抽卡"到"导演"的范式转移2024年&#xff0c;Sora的问世让AI视频生成首次进入公众视野&#xff0c;但彼时的技术被开发者戏称为"抽卡"——输入一段Prompt&…

2026/8/10 0:04:00

2026年五大AI编码CLI工具深度横评:从原理到实战选型指南

1. 项目概述&#xff1a;为什么我们需要对比AI编码CLI工具&#xff1f;如果你和我一样&#xff0c;每天有超过一半的时间是在终端里度过的&#xff0c;那么“效率”就是你最核心的追求。从最初的代码补全插件&#xff0c;到集成在IDE里的智能助手&#xff0c;再到如今能直接在命…

2026/8/7 9:44:18

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站&#xff0c;核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测&#xff0c;千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队&#xff0c;覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/7 19:03:32

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站&#xff0c;核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测&#xff0c;千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队&#xff0c;覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/9 15:24:19

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具&#xff0c;覆盖选题构思、文献整理、内容生成、格式排版等核心场景&#xff0c;真正帮你高效搞定论文难题。 一、全流程王者&#xff1a;一站式搞定论文全链路&#xff08;一天定稿首…