Skip to content

fix: EKS環境でのKubeControllerManagerDown / KubeSchedulerDown / KubeProxyDownアラート誤検知を修正 #796

Description

概要

EKS環境において、以下の3つのアラートが常時発火している。いずれも誤検知(false positive)であり、kube-prometheus-stackの設定変更で解消できる。

発火しているアラート

  • KubeControllerManagerDown
  • KubeSchedulerDown
  • KubeProxyDown

根本原因

KubeControllerManagerDown / KubeSchedulerDown

クラスターはAmazon EKS(v1.36.2-eks-254016e、リージョン: ap-northeast-1)で動作しており、コントロールプレーンコンポーネント(kube-controller-manager、kube-scheduler)はAWSが管理するマネージドインフラ上で動作している。そのため:

  • kube-system namespaceに該当Podが存在しない
  • kube-prometheus-stack-kube-controller-manager / kube-prometheus-stack-kube-scheduler ServiceのEndpointsが空(<none>
  • Prometheusがスクレイプターゲットを発見できず、up{job="kube-controller-manager"} / up{job="kube-scheduler"} メトリクスが存在しない
  • アラートが常時発火する

KubeProxyDown

kube-proxyは意図的に無効化されており、Ciliumがkube-proxy replacementモード(kube-proxy-replacement: "true")で完全代替として動作している。

  • kube-system namespaceにkube-proxyのDaemonSet・Podが存在しない
  • Cilium DaemonSetは全5ノードで正常稼働中(5/5 Ready
  • kube-prometheus-stack-kube-proxy ServiceのEndpointsが空 → Prometheusがスクレイプ不可
  • ネットワーク機能は正常だがKubeProxyDownアラートが発火し続ける

対応方法

kube-prometheus-stackのHelm valuesに以下を追加する:

kubeControllerManager:
  enabled: false

kubeScheduler:
  enabled: false

kubeProxy:
  enabled: false

# etcdも同様にEKSではスクレイプ不可のため合わせて無効化を推奨
kubeEtcd:
  enabled: false

これにより、各コンポーネントのServiceMonitor・Serviceが削除され、誤検知アラートが解消される。

参考

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions