説明
ACKのノード自動修復は、対応するノードの異常を確認して復旧処理を実行します。無効な場合は、手作業や別の自動化による復旧が必要です。
想定される影響
障害ノードの復旧が遅れると、ワークロードの可用性が低下するおそれがあります。
対処方法
管理対象ノードプールにmanagement.enable = trueとauto_repair = trueを設定してください。再起動や同時中断数の上限がワークロードに与える影響を確認してください。
例
以下は管理機能と自動修復を有効にする抜粋です。ノードの認証とディスク設定は省略しています。自動アップグレードなど、併記した運用オプションも確認してください。
変更前
hcl
resource "alicloud_cs_kubernetes_node_pool" "default" {
name = var.name
cluster_id = alicloud_cs_managed_kubernetes.default.0.id
vswitch_ids = [alicloud_vswitch.default.id]
instance_types = [data.alicloud_instance_types.default.instance_types.0.id]
desired_size = 1
}
変更後
hcl
resource "alicloud_cs_kubernetes_node_pool" "default" {
name = var.name
cluster_id = alicloud_cs_managed_kubernetes.default.0.id
vswitch_ids = [alicloud_vswitch.default.id]
instance_types = [data.alicloud_instance_types.default.instance_types.0.id]
desired_size = 1
management {
enable = true
auto_repair = true
auto_upgrade = true
surge = 1
max_unavailable = 1
}
}