製品・モデルの詳細
CoreWeave

CoreWeave

AI処理向けのクラウド基盤

提供元の資料を開く

どんな場面で検討するか

自社のモデルweightsを専用GPUで推論し、GPU種類・容量予約・autoscalingとgatewayを制御したい場合。学習用GPU基盤と共通の容量管理を検討する場合にも候補になる。

組織で使う条件

runtime/version、weights版、gateway認証、capacity claim、autoscalingを記録する。 自分のdeploymentのGPU memory・待ち行列・成功率を見て、過少/過剰容量を調整する。

採用前に試すこと

  • 利用権を確認した小型公開モデルと合成質問100件で、weights・runtime・GPUを固定してdeployする。
  • 同時実行1/複数を流し、GPU memory・待ち行列・tokens/sec・誤応答を測る。
  • 最大replica制限と低負荷時の縮退を試し、GPU-hoursと旧weightsへの戻しを確認する。

合格と判断する条件

  • モデルがOOMなしで起動し、認可された経路からのみ利用できる。
  • 合意した品質・p95待ち時間と並列度を満たすGPU構成を説明できる。
  • 過剰scaleを防ぎ、旧weightsへ戻せ、予約/従量を含めた費用が予算内になる。

見落としたくない点

  • 少量のAPI呼出しだけで足りる場合はmanagedモデルAPI/Serverless Inferenceと比較する。 GPUが小さければ必ず安いとみなさず、モデルが載るかと必要並列度を確認する。
  • 少量のAPI呼出しだけで足りる場合はmanagedモデルAPI/Serverless Inferenceと比較する。
  • GPUが小さければ必ず安いとみなさず、モデルが載るかと必要並列度を確認する。

根拠となる資料

About Dedicated Inference

Billing - CoreWeave Dedicated Inference