avatar
文章
208
标签
97
分类
48

首页
归档
标签
分类
友链
关于
广告
IT老男孩
搜索
首页
归档
标签
分类
友链
关于
广告
Rancher Monitoring 迁移至 kube-prometheus-stack
发表:2026-09-21|更新:2026-09-21|分类:prometheus
本文永久链接: https://www.xtplayer.cn/prometheus/rancher-monitoring-migration-to-kube-prometheus-stack/ 概述根据 Rancher 官方文档说明,https://ranchermanager.docs.rancher.com/v2.15/integrations-in-rancher/monitoring-and-alerting/ ,从 Rancher v2.15 开始, Rancher monitoring 将发生重大架构变化,新的监控 Chart 由 rancher-monitoring 替换为 rancher-monitoring-dashboards。 新旧 Chart 的定位 Chart 名称 状态 说明 rancher-monitoring 旧版,已停止更新 Rancher 仅保留它来支持已有部署,不会有新功能或修复 rancher-monitoring-dashboards 新版,推荐使用 从 v2.15.0 起,新安装的监控都使用这个解耦后的 chart 新 ...
阅读全文
Grafana 自动加载自定义指标图表 json ConfigMaps
发表:2026-09-20|更新:2026-09-20|分类:prometheus
本文永久链接: https://www.xtplayer.cn/prometheus/grafana-automatically-loads-custom-metric-dashboard-json-configmaps/ 如果直接在 Grafana UI 中创建某个应用的监控图表集,这种方法创建的监控图表不能持久,Grafana Pod 重启后监控图表将丢失。 创建监控图表 ConfigMap想要持久监控图表,可以在创建好监控图表后,将其 json 导出,然后按照如下的 ConfigMap 示例编辑。 添加 labels grafana_dashboard: “1”:Grafana 中的 sidecar 会读取带有此 labels 的 ConfigMap,并将其加载到 Grafana。 添加 grafana_folder:如果多个监控图表属于某个应用或者 Pod,可以添加此参数将多个 ConfigMap 配置归纳到某个目录下。 apiVersion: v1kind: ConfigMapmetadata: name: my-custom-dashboard namespace ...
阅读全文
Rancher UI 开启 Cilium 指标监控
发表:2026-09-20|更新:2026-09-20|分类:cilium
本文永久链接: https://www.xtplayer.cn/cilium/rancher-ui-enables-cilium-metric-monitoring/ 如果在 Rancher UI 创建集群使用内置的 Cilium CNI 驱动,默认是没有启用 Cilium 的指标监控功能。Cilium Chart 是有启用监控指标功能参数的,比如如下链接所示: https://github.com/rancher/rke2-charts/blob/main/charts/rke2-cilium/rke2-cilium/1.20.103/values.yaml#L1938 因此如果需要启用 Cilium 的指标监控,需要自定义 Cilium Chart 运行参数。 Cilium Chart 自定义参数在 Rancher UI 创建集群,有两种方法自定义 Cilium Chart 参数。 通过 chartValues 自定义 Cilium Chart 参数编辑集群的 YAML 配置,在 spec.rkeConfig.chartValues 下可以自定义 Chart 参数。配置示例如下: ...
阅读全文
在 Rancher UI 查看 Pod 日志显示已断开连接
发表:2026-09-18|更新:2026-09-18|分类:rancher
本文永久链接: https://www.xtplayer.cn/rancher/viewing-pod-logs-in-the-rancher-ui-will-automatically-disconnect/ 在 Rancher UI 中查看日志时,打开日志窗口后,窗口右下角立刻显示“已断开连接”。具体原因有以下几种: Rancher Local 集群前面的反向代理(如 F5、Nginx、HAProxy )没有正确支持 WebSocket 协议。 如果你是新创建的 rancher 和下游集群,并且 local 集群 ingress 之前有外部的七层负载均衡服务,如 F5、Nginx、HAProxy 服务。那么有可能是七层负载均衡服务没有正确支持 WebSocket 协议。可以根据以下文档,了解外部负载均衡服务需要支持哪些参数。 https://docs.rancher.cn/docs/rancher2.5/installation/resources/F5-7-layer-loadbalancer/ https://docs.rancher.cn/docs/rancher2.5/ ...
阅读全文
/v3/connect/agent 无条件返回 503 导致新节点注册被阻塞
发表:2026-09-16|更新:2026-09-18|分类:rancher
本文永久链接: https://www.xtplayer.cn/rancher/v3-connect-agent-unconditional-503-empty-body-blocks-new-node-registration/ 描述GET /v3/connect/agent 会无条件返回 503 Service Unavailable,且响应体为空,无论身份验证、请求头、CA 验证或 HTTP 协议版本如何。这导致所有通过 system-agent-install.sh 进行的新节点注册(无论是 nodeCommand 还是 insecureNodeCommand 变体)全部被阻塞,即便 Rancher 服务器、其管理控制器以及受影响下游集群的现有 Agent 隧道在其他方面都运行正常。 Rancher server 配置 Rancher 版本:v2.14.3(CATTLE_SERVER_VERSION=v2.14.3) 下游集群 自定义/RKE2 集群(沙箱环境),通过 Rancher 的自定义节点注册流程创建 Cluster.provisioning.c ...
阅读全文
RKE2 Canal 设置 Backends 为 host-gw
发表:2026-09-12|更新:2026-09-12|分类:rke2
本文永久链接: https://www.xtplayer.cn/rke2/set-the-backends-in-rke2-canal-to-host-gw/ Canal 由 Flannel(负责 Pod 间网络)和 Calico(负责 NetworkPolicy)组成,Flannel 的后端默认为 VXLAN。VXLAN 切换为 host-gw,本质上是从 Overlay 网络切换到 Underlay 网络。这一变更的核心价值是显著降低数据平面性能开销 —— host-gw 的性能损失约在 10% 左右,而 VXLAN 则在 20%~30%。 切换前务必确认:所有节点处于相同二层子网,若节点跨子网、跨 VLAN 或处于公有云多可用区,不应启用 host-gw。 VXLAN 与 host-gw 的利弊对比VXLAN 模式(默认)工作原理:VXLAN 采用 Overlay 技术,将二层以太网帧封装在 UDP 报文中,通过三层网络传输,构建出一个虚拟的大二层网络。Canal 默认使用此模式,在标准网络环境下即可工作。 维度 说明 优势 ① 拓扑灵活:可跨越不同子网、VLAN ...
阅读全文
设置 kubeProxyReplacement=true 禁用 kube-proxy 后 cilium Pod 无法运行
发表:2026-08-20|更新:2026-08-20|分类:cilium
本文永久链接: https://www.xtplayer.cn/cilium/after-disabling-kube-proxy-the-cilium-component-pods-cannot-run/ 为什么要设置 kubeProxyReplacement=true背景:kube-proxy 的角色与局限在标准的 Kubernetes 集群中,kube-proxy 负责实现 Service 的 ClusterIP 和 NodePort 等负载均衡机制。传统实现基于 iptables 或 IPVS,在大量 Service 场景下存在性能瓶颈——iptables 规则链线性匹配,规则更新时需全量刷新,大规模集群中可能造成 API Server 压力激增和服务延迟。 Cilium 的 eBPF 替代方案Cilium 的 kubeProxyReplacement=true 启用后,使用 eBPF 技术在 Linux 内核层面直接处理 Service 的负载均衡,完全替代 kube-proxy。这一机制具有以下优势: 性能提升:eBPF 程序在内核中高效运行,绕过 iptab ...
阅读全文
rancher2.12+ failed to find chartName <name>:<version>: NotFound 404
发表:2026-08-13|更新:2026-08-13|分类:rancher
本文永久链接: https://www.xtplayer.cn/rancher/rancher2-12-failed-to-find-chartname-name-version-notfound-404/ 如图,在 rancher ui 更新/安装 App 时有时可能会出现 failed to find chartName <name>:<version>: NotFound 404 的错误。 问题分析出现这个问题,是因为下游集群 cluster agent pod 中没有找到对应的 chart 文件。可以进入 cluster agent pod shell,再 cd 进入 /var/lib/rancher-data/local-catalogs/v2/rancher-charts/xxxx ,查看是否有 chart 文件,两个 cluster agent pod 都需要查看。 排查步骤检查 chart 仓库是否都为 Active进入 集群管理|高级选项|Chart 仓库,检查所有 Chart 仓库是否都为 Active 状态。在非离线模式部署 ...
阅读全文
从 1.18.6 升级到 1.19.1 时,不允许使用 hubble-relay,operation not permitted
发表:2026-08-05|更新:2026-08-13|分类:rke2
本文永久链接: https://www.xtplayer.cn/rke2/hubble-relay-operation-not-permitted-on-upgrade-from-1-18-6-to-1-19-1/ 环境运行 rke2-cilium v1.18.6 的 Rancher 配置的 RKE2 集群正在升级到 rke2-cilium 1.19.1。 受影响的 RKE2 版本包括: v1.32.13+rke2r1 v1.33.9+rke2r1 v1.34.5+rke2r1 v1.35.2+rke2r1 问题背景在 Rancher 配置的 RKE2 集群中,运行 rke2-cilium v1.18.6,并采用类似的 cilium 配置: rke2-cilium: bandwidthManager: bbr: true enabled: true bpf: hostLegacyRouting: false masquerade: true hubble: enabled: true relay: enabled: true ...
阅读全文
rke2 server token rotate
发表:2026-07-30|更新:2026-07-30|分类:rke2
本文永久链接: https://www.xtplayer.cn/rke2/server-token-rotate/ 为什么需要 Server Token 轮换?RKE2 使用 Token 来保障节点加入集群的安全,并对持久化到数据存储中的机密信息进行加密。Server Token 拥有最高权限,其重要性体现在两个方面: 认证凭证:Server Token 可用于将任何新节点(无论是 Server 还是 Agent)加入集群。这意味着,任何持有此 Token 的人,都等同于拥有集群的完全管理员权限。 加密密钥:Server Token 还充当 PBKDF2 的加密口令,用于加密存储在数据存储(ETCD)中的核心机密数据,即“引导数据”(bootstrap data)。引导数据对于新 Server 节点的加入和从快照恢复集群至关重要。 正因为 Server Token 既是“通行证”又是“保险柜钥匙”,它在日常运维中面临多重泄露风险: 配置管理不当:Token 可能被明文写入自动化脚本、配置文件(如 config.yaml)或代码仓库中,意外泄露。有用户就曾在社区反馈,自己不慎将 ...
阅读全文
rancher-rke2 修改 server-url
发表:2026-07-29|更新:2026-07-30|分类:rancher
本文永久链接: https://www.xtplayer.cn/rancher/rancher-rke2-change-server-url/ 更新 rancher helm 安装参数使用安装或者上一次更新 rancher 的 helm 参数,修改其中的 hostname,然后重新执行更新。 更新 rancher ssl 证书ssl 证书与域名存在绑定关系,更换 rancher 访问域名,通常需要涉及到域名 ssl 证书更新。如果 ssl 证书是绑定在 ingress 上,那么可以使用以下命令,在 local 集群中更新 rancher 域名 ssl 证书。 kubectl -n cattle-system create secret tls tls-rancher-ingress \ --cert=tls.crt \ --key=tls.key \ --dry-run --save-config -o yaml | kubectl apply -f - 如果是自签名 ssl 证书,还需要涉及到 CA 证书更新。 kubectl -n cattle-system create ...
阅读全文
A larger PVC is required during Harvester upgrade.
发表:2026-07-09|更新:2026-07-29|分类:harvester
本文永久链接: https://www.xtplayer.cn/harvester/a-larger-pvc-is-required-during-harvester-upgrade/ harvester 从1.8.0 版本升级到1.8.1版本时,importer-prime pod 出现 CrashLoopBackOff,日志显示: CrashLoopBackOff (back-off 5m0s restarting failed container=importer pod=importer-prime-50de6518-c97f-4872-9b0e-9a74c0d0a63f_harvester-system(b702ad80-1528-4441-9f18-65adf8ef765e)) | Last state: Terminated with 1: Error (Unable to process data: Unable to convert source data to target format: virtual image size 8227454976 is larg ...
阅读全文
K8S 1.35 以及以上版本不能使用本地已有的镜像
发表:2026-07-09|更新:2026-09-03|分类:kubernetes
本文永久链接: https://www.xtplayer.cn/kubernetes/k8s-1-35-cannot-use-the-existing-local-images/ 在 Kubernetes v1.33 之前,IfNotPresent 策略的行为比较”单纯”:只要节点本地有镜像,不管当前 Pod 有没有权限,kubelet 都会直接使用,不会去检查凭证。 这就导致了一个安全隐患:假如节点上有一个从私有仓库拉取的镜像,后续任何一个 Pod 只要也引用同名镜像(哪怕没有拉取凭证),kubelet 发现本地镜像存在,就会直接让这个 Pod 用上它。这等于让未授权的 Pod 绕过了权限检查。 为了解决这个问题,Kubernetes 社区从 v1.33 版本开始引入了一个新特性。当这个特性启用后,IfNotPresent 的行为变了:如果镜像已存在,kubelet 会验证当前 Pod 的凭证是否有权拉取该镜像。如果凭证不匹配或无效,kubelet 会为了执行鉴权而重新拉取镜像,从而保障安全。 排查小贴士:如果你使用的是 Kubernetes v1.33 或更新版本,可以检查 ku ...
阅读全文
longhorn stuck upgradewaitforoldlonghornmanagerstobefullyremoved
发表:2026-07-09|更新:2026-07-09|分类:longhorn
本文永久链接: https://www.xtplayer.cn/longhorn/stuck-upgrade-waitforoldlonghornmanagerstobefullyremoved/ 问题描述在访问 Longhorn UI 时,页面报 Request failed with status code 502 错误。搜集 Longhorn pod 日志后,发现在 longhorn-manager Pod 的日志中,观察到以下信息持续输出。 time="2026-07-07T09:50:13.702201949Z" level=info msg="Found old longhorn manager: longhorn-manager-chb2n with image xxx.xxx.cn/longhornio/longhorn-manager:v1.11.1" func=upgrade.waitForOldLonghornManagersToBeFullyRemoved file="upgrade.go:316" ...
阅读全文
将 rke2 集群证书延长至 10 年
发表:2026-06-05|更新:2026-06-05|分类:rke2
本文永久链接: https://www.xtplayer.cn/rke2/extend-the-rke2-certificate-to-a-period-of-10-years/ 在使用 RKE2 搭建生产环境时,大家或许遇到过证书有效期过短的问题。默认情况下,RKE2 中的系统证书有效期为 12 个月,临近过期后在服务重启时会自动轮换。然而,在实际部署中,我们常常希望将证书有效期设置得更长,避免频繁运维。 本文将介绍如何在 RKE2 初始安装阶段 或 已有集群中,通过配置环境变量 CATTLE_NEW_SIGNED_CERT_EXPIRATION_DAYS,将证书有效期延长至 5 年、甚至 10 年,让你的集群更“省心”。 注意:CATTLE_NEW_SIGNED_CERT_EXPIRATION_DAYS 的最大值为 3650(即 10 年),因为 RKE2 内部 CA 的最大有效期也是 10 年。 初始安装集群设置证书有效期Step 1:配置环境变量在安装 每个 RKE2 Server(Control-plane/etcd)节点 时,添加如下环境变量: cat &l ...
阅读全文
Istio DiscoverySelectors 过滤命名空间
发表:2026-06-03|更新:2026-06-03|分类:istio
本文永久链接: https://www.xtplayer.cn/istio/istio-discoveryselectors-filter-the-namespaces/ 在 Istio 服务网格中,discoverySelectors 是 MeshConfig 里的一个配置字段。它的作用是限制 Istio 控制平面(Istiod)需要监控和发现哪些命名空间(Namespace)。忽略掉不必要的命名空间,从而优化性能。 核心价值在大型 Kubernetes 集群中,如果所有命名空间都在服务网格内,Istiod 会监视和处理所有命名空间的 services, pods, and endpoints,这将消耗大量 CPU 和内存去处理所有服务的配置。为了解决这个问题,可通过 discoverySelectors 过滤不必要的命名空间,让 Istio 只关心你指定的命名空间,有效降低控制平面的负载。 配置方式你可以在 IstioOperator 自定义资源中配置 meshConfig.discoverySelectors,使用标准的 Kubernetes 标签选择器。 示例 1:基于标签 ...
阅读全文
CAPIcluster or RKEControlPlane is paused
发表:2026-05-28|更新:2026-05-29|分类:rancher
本文永久链接: https://www.xtplayer.cn/rancher/capi-cluster-or-rkecontrolplane-is-paused/ 当 CAPI Cluster 或 RKEControlPlane 处于 paused 状态时,通常意味着集群或控制平面组件处于“暂停”状态,CAPI 控制器不会对其进行调和(Reconcile)操作,解决方法是找到并移除 spec.paused 标志。 “暂停”状态的含义在 CAPI 中,.spec.paused: true 是一个维护标志——当集群被暂停时,控制器不会对其执行任何调和操作。这意味着: 创建、更新、删除等操作都不会被处理 集群状态会“卡住”,无法继续推进 这常用于故障排查或维护期间防止自动化操作干扰 paused 状态的常见原因设置 paused: true 是一种防止控制器对集群进行更改的保护机制。了解其触发原因,有助于避免问题复发。 常见原因 说明 1.ETCD 快照恢复失败 在执行 etcd 快照恢复等 DR 操作时,如果流程意外中断或失败,集群可能卡在 paused 状态。通常按上 ...
阅读全文
启用 node-exporter 的访问认证
发表:2026-05-25|更新:2026-05-29|分类:prometheus
本文永久链接: https://www.xtplayer.cn/prometheus/enable-access-authentication-for-node-exporter/ 步骤一、创建 node-exporter 配置密文这一步骤中,根据需要修改用户名, 然后输入密码,其他参数不要修改。 # 1. 定义用户名和生成密码哈希export USERNAME=node-exporter# 命令执行后会提示 "New password:",输入你的用户名密码export HASH=$(htpasswd -nBC 12 "" | tr -d ':\n')# 2. 创建配置文件cat > web-config.yml <<EOFbasic_auth_users: ${USERNAME}: ${HASH}EOF# 3. 查看生成的配置(确认没有空格)cat web-config.yml# 4. 创建 Secretkubectl create secret generic ...
阅读全文
Rancher Monitoring v2 自定义 prometheus 连接 Url
发表:2026-05-20|更新:2026-05-20|分类:prometheus
本文永久链接: https://www.xtplayer.cn/prometheus/customize-the-prometheus-access-url/ 通过 NodePort将以下 yaml 导入集群,会创建一个 NodePort 类型的 svc。通过节点 ip + NodePort 端口即可获取 Prometheus 的原始监控数据。 apiVersion: v1kind: Servicemetadata: name: prometheus-nodeport namespace: cattle-monitoring-systemspec: externalTrafficPolicy: Cluster internalTrafficPolicy: Cluster ipFamilies: - IPv4 ipFamilyPolicy: SingleStack ports: - name: p9090 port: 9090 protocol: TCP targetPort: 8081 selector: app.kub ...
阅读全文
自定义 Prometheus 健康检查配置参数
发表:2026-05-20|更新:2026-05-20|分类:prometheus
本文永久链接: https://www.xtplayer.cn/prometheus/Customize-the-configuration-parameters-for-Prometheus-health-checks/ 进入 rancher ui,切换到 cluster | tools 界面,编辑 monitoring APP,然后编辑 yaml。搜索 name: prometheus-proxy,在name: prometheus-proxy 和 containers: | 之间插入如下的配置。健康检查参数根据需要进行调整。 configMaps: []containers: | - name: prometheus livenessProbe: httpGet: path: /-/healthy port: http-web scheme: HTTP failureThreshold: 10 initialDelaySeconds: 60 periodSeconds: 30 ...
阅读全文
rke2 配置更新当 rancher 更换 url 或者 ca 证书
发表:2026-05-07|更新:2026-05-07|分类:rke2
本文永久链接: https://www.xtplayer.cn/rke2/rke2-configuration-update-occurs-when-rancher-changes-the-url-or-ca-certificate/ 当 Rancher 的访问 URL 或 CA 证书发生变化时,RKE2 集群中的 Agent 节点(Worker 节点)会因为无法正确连接到 Rancher Server(即 RKE2 的 Server 节点)而失联。你需要更新每个 RKE2 Agent 节点的配置,然后重启服务。 Rancher 全局 server-url 更新 登录 Rancher UI,在左上角点击下拉菜单,进入 全局设置(Global Settings)。 在“系统设置”(Advanced/System Settings)选项卡中,找到 server-url 这一项。 点击编辑,将其值修改为你的新 Rancher Server 地址(例如 https://new-rancher.yourdomain.com),然后保存。 更新下游集群 rancher-system- ...
阅读全文
12…10下一页
avatar
IT老男孩
IT老男孩 - 分享 IT 相关技术文章,分享工作中的最佳实践。
文章
208
标签
97
分类
48
Follow Me
公告
我的博客
最新文章
Rancher Monitoring 迁移至 kube-prometheus-stack2026-09-21
Grafana 自动加载自定义指标图表 json ConfigMaps2026-09-20
Rancher UI 开启 Cilium 指标监控2026-09-20
在 Rancher UI 查看 Pod 日志显示已断开连接2026-09-18
/v3/connect/agent 无条件返回 503 导致新节点注册被阻塞2026-09-16
RKE2 Canal 设置 Backends 为 host-gw2026-09-12
设置 kubeProxyReplacement=true 禁用 kube-proxy 后 cilium Pod 无法运行2026-08-20
rancher2.12+ failed to find chartName <name>:<version>: NotFound 4042026-08-13
分类
  • calico2
  • cicd1
  • cilium3
  • containerd1
  • coredns4
  • csdn1
  • devops1
  • docker1
  • etcd5
  • f51
  • git2
  • harvester1
  • hci1
  • ingress2
  • istio1
标签
containerdcorednscoredns 最佳实践coreDNS 加速外部域名解析CSDNdevopsDevOps自动化dockeretcdPrometheusBGPcalicoF5GitOpsHCIHarvesterk3deBPFsysstatLonghorn ARMlonghorncicdkubernetesserviceaccountTaintBasedEvictionsterminatedingress弹性伸缩KubernetesEvictedFaileddevice or resource busypodflannelcgroupReleased pvstoragemacOS Big Surmacos
归档
  • 九月 20266
  • 八月 20263
  • 七月 20265
  • 六月 20262
  • 五月 20267
  • 四月 20266
  • 三月 20262
  • 二月 20261
  • 一月 20262
  • 十二月 20252
  • 十一月 20253
  • 十月 20255
网站资讯
文章数目 :
208
已运行时间 :
本站总字数 :
265.3k
本站访客数 :
本站总访问量 :
最后更新时间 :
©2020 - 2026 By IT老男孩
框架 Hexo|主题 Butterfly
icp蜀ICP备20023095号-1 川公网安备51010702002006号
本地搜索