发布时间:2026/8/24 1:29:27
Kubernetes Descheduler Helm 部署:策略怎么选,装完如何确认它在干活 Kubernetes Descheduler Helm 部署策略怎么选装完如何确认它在干活【免费下载链接】deschedulerDescheduler for Kubernetes项目地址: https://gitcode.com/gh_mirrors/de/deschedulerDescheduler for Kubernetes 会周期性扫描集群把节点放错位置的 Pod 驱逐掉交给调度器重新安置。官方仓库里自带 Helm chart一条helm install就能把 CronJob、RBAC 和策略 ConfigMap 全部铺好。本文按先判断值不值得上 → 怎么装 → 策略取舍 → 验证生效的顺序走一遍全程只用最小可运行的命令集。一、先判断你的集群有哪些 Pod 值得被挪走一个跑了几个月的集群常见病灶是节点冷热不均一部分节点 CPU 长期贴着 90%另一部分刚过 10%而调度器只管能不能放得下不管放得匀不匀。Descheduler 解决的就是这类存量问题它盯的信号可以归纳成 4 类资源占用失衡节点负载明显低于目标水位或个别节点长期过载对应LowNodeUtilization/HighNodeUtilization。规则违反Pod 所在节点已经不满足它的节点亲和、污点容忍、Pod 间反亲和或拓扑分布约束对应RemovePodsViolatingNodeAffinity、RemovePodsViolatingNodeTaints、RemovePodsViolatingInterPodAntiAffinity、RemovePodsViolatingTopologySpreadConstraint。冗余副本同一 Deployment 的多个副本挤在同一个节点上对应RemoveDuplicates。健康异常容器反复崩溃、重启次数越过阈值对应RemovePodsHavingTooManyRestarts。如果你的集群里这四类问题一个都没有Descheduler 开了也是空转如果第一类是主要矛盾那核心就是后面要讲的LowNodeUtilization阈值怎么调。二、Descheduler 怎么装前置检查与 chart 安装先过三关版本对应Descheduler 的版本号和 Kubernetes 小版本是对齐的比如 v0.36 对应 K8s v1.36且每个版本只在最近 3 个 K8s 小版本上测试过。装之前先kubectl version确认集群不低于 1.21并据此选镜像 tag。Helm 3.xchart 用了batch/v1的 CronJobHelm 2 直接不可用。集群管理员权限chart 要创建 ClusterRole、ClusterRoleBinding 和 ServiceAccount没有 cluster-admin 等价权限会在渲染后 apply 失败。拿到 chart 的方式是克隆仓库进入 chart 目录git clone https://gitcode.com/gh_mirrors/de/descheduler cd descheduler/charts/descheduler安装时只改最影响行为的两三个参数即可helm install descheduler . -n kube-system --set schedule*/15 * * * *values.yaml 里值得注意的 key 有这几个scheduleCronJob 触发周期chart 默认是*/2 * * * *每 2 分钟一轮生产环境建议放宽到 10~15 分钟避免驱逐风暴。image.tag留空时取 chart 的 appVersion当前 v0.36.0想锁定版本就显式给值。kind默认CronJob改Deployment则常驻运行按deschedulingInterval循环需要同时配置leaderElection。deschedulerPolicy策略本体以profilesplugins的形式渲染成 ConfigMap 挂到 Pod 的/policy-dir/policy.yaml下一节展开。serviceMonitor.enabled默认 false装了 Prometheus Operator 再打开见第四节。改deschedulerPolicy后 Job Pod 会带checksum/config注解ConfigMap 一变就自动滚动重建不需要额外操作。三、内置策略的取舍默认开了什么HighNodeUtilization 为什么关着Descheduler 的每个调度周期都会按 profile 依次执行 Sort → Filter → 驱逐插件一轮跑完叫一个 Descheduling Cycle策略插件的实现都放在 pkg/framework/plugins/ 目录可以直接对照源码看每个插件的入参。默认渲染出的 policy 已经把插件分成了两组balance 组RemoveDuplicates、RemovePodsViolatingTopologySpreadConstraint、LowNodeUtilization目标是把负载摊匀是集群调优的主力。deschedule 组RemovePodsHavingTooManyRestarts、RemovePodsViolatingNodeTaints、RemovePodsViolatingNodeAffinity、RemovePodsViolatingInterPodAntiAffinity目标是清理不该在这的 Pod。各策略的适用形态可以对照这张图左边是重复副本与高重启次数中间是反亲和与拓扑分布右边是污点与节点标签几个取舍建议LowNodeUtilization 的阈值是重点。默认thresholds为 cpu/memory/pods 各 20、targetThresholds各 50含义是只有当某节点利用率低于 20 且集群平均低于 50 时才启动驱逐以把该节点抬到 50 附近为目标。业务波动大的集群可以把 target 压到 30防止来回搬 Pod。HighNodeUtilization 默认不开它需要接 metrics.k8s.io 的实时用量要在 policy 里加metricsProviderssource 为 KubernetesMetricschart 检测到后会为 ClusterRole 追加 metrics 资源权限。开了 balance 组的 LowNodeUtilization 后通常不需要再叠加它。DefaultEvictor 的 Pod 保护默认禁用了PodsWithLocalStorage带本地盘的 Pod 不动启用了PodsWithPVC。如果你的业务大量使用 emptyDir/emptyDir本地存储驱逐前务必确认这一项。RemovePodsHavingTooManyRestarts默认阈值是 100 次对频繁重启但没坏透的 Pod 很激进建议按业务容忍度上调。权限方面 chart 遵循最小集只有对pods/eviction的 create 权限会真正产生驱逐其余 nodes/namespaces/pods/PDB 等只是只读 watchevents 用于记录驱逐事件只有在配置了 KubernetesMetrics 时才会额外授予 metrics.k8s.io 的 get/list。想核对完整规则可以看 clusterrole.yaml。四、装完之后如何确认它真的在工作安装后等第一个 schedule 周期触发看最近一次 Job 的日志最直接kubectl get pods -n kube-system -l app.kubernetes.io/namedescheduler日志里出现running profile default以及各策略的执行记录说明周期在跑看到evicting pod说明确实有 Pod 被挪动。确认没有误伤的方式是紧接着跑一遍kubectl get pods -A核对被驱逐的 Pod 都在其他节点重新拉起了。指标层面Descheduler 在 10258 端口暴露/metrics核心有四个descheduler_pods_evicted_total按策略、命名空间、节点分标签的驱逐计数resulterror表示驱逐失败这个标签最值得配告警。descheduler_loop_duration_seconds一个完整周期耗时接近 schedule 间隔就说明周期太密了。descheduler_strategy_duration_seconds单个策略耗时能定位哪个插件拖慢周期。descheduler_build_info版本核对用。Prometheus 集成只需--set serviceMonitor.enabledtruechart 会渲染一个 monitoring.coreos.com/v1 的 ServiceMonitor配合namespace指向 Prometheus 所在命名空间即可。五、收尾前检查一遍的三件事跑完验证后把这三项过一遍再收工schedule是否已放宽到业务可接受的间隔LowNodeUtilization的targetThresholds是否贴合当前集群水位以及descheduler_pods_evicted_total{resulterror}是否持续为零。之后每周一看一次descheduler_loop_duration_seconds和驱逐计数即可等下一个 schedule 周期触发翻一遍 Job 日志确认没有任何 Pod 被误驱逐这次部署就算落地了。【免费下载链接】deschedulerDescheduler for Kubernetes项目地址: https://gitcode.com/gh_mirrors/de/descheduler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/24 1:24:27

如何用 ipatool 三步搜索 App Store 并下载 iOS IPA 应用包

如何用 ipatool 三步搜索 App Store 并下载 iOS IPA 应用包 【免费下载链接】ipatool Command-line tool that allows searching and downloading app packages (known as ipa files) from the iOS App Store 项目地址: https://gitcode.com/GitHub_Trending/ip/ipatool …

2026/8/24 6:00:03

二叉树算法精讲:Hot100高频考点与面试技巧

1. 项目概述"hot100-二叉树III"这个标题乍看简单,实则包含了三个关键信息点。作为刷过300道算法题的过来人,我深知hot100系列在面试准备中的分量,而二叉树作为数据结构中的常青树,其重要性更是不言而喻。这个系列显然已…

2026/8/24 6:00:03

开源模型实战指南:从DataCamp学习到生产环境部署的决策框架

1. 这篇文章真正要解决的问题当“开源模型”和“实战”成为技术社区的热门标签,一个核心的决策困境也随之浮现:面对琳琅满目的开源模型和层出不穷的实战教程,我们究竟该如何选择?是追逐最新的前沿模型,还是深耕一个成熟…

2026/8/24 6:00:03

Linux下Python后台持久化:nohup与screen原理及实战

1. 项目概述:让Python程序真正“离线干活”,不是靠重启或手动守着终端你写好了一个Python脚本——可能是爬虫定时抓取数据、训练模型跑通一个epoch、监听某个API接口做自动响应,或者只是个持续写日志的后台服务。本地电脑一关机,程…

2026/8/24 6:00:03

规模化招聘的五大挑战与智能解决方案

1. 招聘规模化的本质与困境当企业年招聘需求突破500人门槛时,传统招聘模式就会像老旧的单车道遇上春运车流一样捉襟见肘。去年服务某跨境电商客户时,他们需要在3个月内完成800人的技术团队扩建,HR部门最初沿用"熟人推荐猎头合作"的…

2026/8/24 6:00:03

数据库与软件工程笔试核心考点与备考策略

1. 数据库与软件工程笔试备考指南作为计算机专业研究生入学考试的核心科目,数据库和软件工程一直是笔试中的重点难点。这套训练题集针对日本大学院入学考试的第九套模拟试题,涵盖了关系数据库设计、SQL查询优化、软件生命周期管理等多个关键知识点。我在…

2026/8/24 5:55:03

UE大世界射击游戏开发面试全解析与核心技术剖析

1. 面试过程全记录上周参加了鹅厂UE大世界射击游戏客户端开发的面试,整个流程持续了约90分钟。面试官是位从业8年以上的资深技术专家,主要考察方向集中在UE引擎底层原理、大世界场景优化和射击游戏核心技术实现三个方面。整个面试分为四个环节&#xff1…

2026/8/24 0:07:22

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 1:12:32

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/23 0:02:04

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/24 1:09:25

3条命令跑通LocalAI:无GPU本地AI引擎部署

3条命令跑通LocalAI:无GPU本地AI引擎部署 【免费下载链接】LocalAI LocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required. 项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI…

2026/8/24 1:09:25

AI推理性能测试怎么做:MLPerf Inference完整上手指南

AI推理性能测试怎么做:MLPerf Inference完整上手指南 【免费下载链接】inference Reference implementations of MLPerf inference benchmarks 项目地址: https://gitcode.com/gh_mirrors/inf/inference 同一个模型换一张卡,速度快多少你知道吗&a…

2026/8/23 13:29:45

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/23 6:14:43

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/23 4:22:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…