どんな場面で検討するか
GPU付きコンテナでAI処理を試すPod、または変動する推論要求をServerless workerで処理し、GPU時間と待ち時間を比較したい場合。
組織で使う条件
必要データをnetwork volumeや独立バックアップへ置き、Pod終了前に保存を確認する。 worker上限・execution timeout・idle時間を管理し、残高と支出上限を監視する。
採用前に試すこと
- 小型公開モデルと合成入力100件をPodで動かし、weights/cache/結果の保存先を記録する。
- 同じ処理をServerless Flex/Activeで試し、cold/warm待ち時間と起動/idleを含む秒数を比べる。
- Podの停止/再配置とworker失敗を模擬し、保存結果の読戻しと重複処理防止を試す。
合格と判断する条件
- GPUに載り、結果100件が入力IDと対応する。
- 必要応答時間と1件費用を満たす方式を、実行時間以外の課金も含め説明できる。
- 再配置/再試行後に欠落・重複がなく、GPU再確保不能でもデータを取り出せる。
見落としたくない点
- 停止Podを必ず同じGPUで再起動できるとみなさない。 即時応答が常に必要ならFlexの起動待ちとActiveの常時費用を比較する。
- 停止Podを必ず同じGPUで再起動できるとみなさない。
- 即時応答が常に必要ならFlexの起動待ちとActiveの常時費用を比較する。