我們在 GKE 上部署了一個應用程式,共有 10 個 Pod 運行并為該應用程式提供服務。我正在嘗試找到可以在我的 Pod 出現故障時創建警報的指標,或者有沒有辦法檢查 Pod 的狀態以便我可以根據該條件設定警報?
我探索了 GCP 并查看了他們的檔案,但找不到任何東西。我能找到的是下面的一個指標,但我不知道它衡量的是什么。在我看來,Kubernetes 多次認為 pod 已經死亡并重新啟動了 pod。
Metric: kubernetes.io/container/restart_count
Resource type: k8s_container
對此的任何建議都非常感謝,因為我們可以根據該指標改進我們的監控

uj5u.com熱心網友回復:
該指標與您是對的相同,它將計算 POD 重新啟動的計數。
容器重新啟動的次數。每 60 秒采樣一次。采樣后,最長 120 秒內資料不可見。
閱讀更多:https ://cloud.google.com/monitoring/api/metrics_kubernetes
或者
您可以使用 Prometheus 獲取指標并使用Grafana進行監控
sum(kube_pod_container_status_restarts_total{cluster="$cluster",namespace="$namespace",pod=~"$service.*"})
這將給出 POD 重新啟動計數的值。
或者
您還可以使用BotKube:https ://www.botkube.io/installation/
您可以設定在您的準備活躍度未能松弛通知等時通知。
或者
您撰寫自己的腳本并在 Kubernetes 上運行它來監控和通知集群中任何 POD 何時重新啟動。
示例 github:https ://github.com/harsh4870/Slack-Post-On-POD-Ready-State
當 POD 在部署后準備就緒時,此腳本會在 slack 中通知,您可以更改它以監控重新啟動計數。
我建議使用Prometheus,Grafana選項,但是,stackdriver很好,但我不是 Google 員工。
uj5u.com熱心網友回復:
為什么要監視 pod 何時關閉?Kubernetes 將立即嘗試在同一個節點上啟動它,或者如果該節點由于某種原因而關閉,則在另一個節點上啟動它。
相反,您必須監控其他指標。就像 restart_count 一樣,它可能表明 pod 沒有重新上線。但還有其他指標,如
- kube_pod_container_status_restarts_total
- kube_pod_status_phase
- kube_pod_container_status_running
- kube_pod_status_phase 與 kube_node_status_capacity_pods
本文有很多有趣的指標可以監控https://medium.com/google-cloud/gke-monitoring-84170ea44833
轉載請註明出處,本文鏈接:https://www.uj5u.com/qukuanlian/410377.html
標籤:
