ECSのタスクが起動・継続しないときの確認手順
サービスの希望数・稼働数とイベント、停止したタスクの理由を順に確認します。起動前の失敗と、起動後のアプリ・ヘルスチェックの失敗を分けると調査対象を絞れます。
どんな時に使うか
ECSのサービスで希望した数のタスクが起動しない、すぐ停止する、ヘルスチェックに通らないときに、調べる場所と次の対応を絞るために使います。
順に確認して、次の対応を決める
対象を固定する
クラスター、サービス、タスク定義の版、直前のデプロイ、希望数・稼働数を記録する。
判断すること一部のタスクか全体か、デプロイ前後かを分ける。
起動前の失敗を調べる
サービスイベントと停止理由を確認。イメージ取得、実行ロール、秘密情報、ネットワーク・リソース不足を切り分ける。
判断すること認証・構成の問題を単純な再起動で解決したと扱わない。
起動後の失敗を調べる
コンテナの終了コードとログ、ロードバランサーのターゲット状態、ヘルスチェックのパス・ポートを照合する。
判断することアプリ例外か到達性・ヘルスチェックかを絞ってから変更する。
変更と復旧を検証する
検証環境で一つずつ修正し、起動・負荷・監視を確かめる。既知の正常なタスク定義に戻す条件を決める。
判断すること稼働数の回復に加え、業務リクエストが成功したことを確認して復旧とする。
確認の例
合成例:希望数2に対して稼働数0。停止理由がイメージ取得失敗なら、まずイメージ名・参照権限・通信経路を確認する。アプリの処理変更から着手しない。
説明用の合成例です。実際の障害・顧客事例ではありません。
担当者へ渡す記録
タスク定義の版、サービスイベント、停止理由・終了コード、発生時刻、機密情報を除いたログ、変更内容と切戻し条件を残す。
根拠となる提供元の資料
資料確認・手順の編集:2026-10-10。当社が整理した確認手順です。