どんな場面で検討するか
自社のモデルweightsを専用GPUで推論し、GPU種類・容量予約・autoscalingとgatewayを制御したい場合。学習用GPU基盤と共通の容量管理を検討する場合にも候補になる。
組織で使う条件
runtime/version、weights版、gateway認証、capacity claim、autoscalingを記録する。 自分のdeploymentのGPU memory・待ち行列・成功率を見て、過少/過剰容量を調整する。
採用前に試すこと
- 利用権を確認した小型公開モデルと合成質問100件で、weights・runtime・GPUを固定してdeployする。
- 同時実行1/複数を流し、GPU memory・待ち行列・tokens/sec・誤応答を測る。
- 最大replica制限と低負荷時の縮退を試し、GPU-hoursと旧weightsへの戻しを確認する。
合格と判断する条件
- モデルがOOMなしで起動し、認可された経路からのみ利用できる。
- 合意した品質・p95待ち時間と並列度を満たすGPU構成を説明できる。
- 過剰scaleを防ぎ、旧weightsへ戻せ、予約/従量を含めた費用が予算内になる。
見落としたくない点
- 少量のAPI呼出しだけで足りる場合はmanagedモデルAPI/Serverless Inferenceと比較する。 GPUが小さければ必ず安いとみなさず、モデルが載るかと必要並列度を確認する。
- 少量のAPI呼出しだけで足りる場合はmanagedモデルAPI/Serverless Inferenceと比較する。
- GPUが小さければ必ず安いとみなさず、モデルが載るかと必要並列度を確認する。