サーバーレス推論
自動スケールでゼロまでのスケーリング、組み込みバッチ処理、レイテンシを考慮したスケジューリング、LLMおよびマルチモーダルモデル向けの本番対応APIを備えた推論を実行できます。
GMI Cloudは、NVIDIA GPUで本番推論、学習、ファインチューニングを行うAIインフラ基盤。サーバーレス推論、専用クラスタ、ベアメタルを柔軟に提供し、拡張可能なGPU容量に対応します。
GMI Cloudは、NVIDIAインフラ上の本番AIワークロード向けに構築されたAIネイティブな推論クラウドです。サーバーレス推論、専用GPUクラスタ、ベアメタルGPUデプロイメントを1つのプラットフォームに統合し、チームは管理された推論から始めて、必要に応じてより深いインフラ制御へ移行できます。
このプラットフォームは、推論、学習、ファインチューニング、大規模GPUワークロード向けに位置付けられています。ソースでは、共有環境ではなく予測可能なパフォーマンス、自動スケーリング、専用リソースが強調され、特定のNVIDIA GPUクラスと容量オプションの料金が公開されています。
自動スケールでゼロまでのスケーリング、組み込みバッチ処理、レイテンシを考慮したスケジューリング、LLMおよびマルチモーダルモデル向けの本番対応APIを備えた推論を実行できます。
同じインフラ基盤を各デプロイモードで使いながら、APIベースの推論から専用GPUクラスタへプラットフォームを変えずに移行できます。
GMIが運用するデータセンター内の専用NVIDIA GPUを使用し、予測可能な性能と分離されたリソースを必要とする継続的なワークロードに対応します。
インフラの制御が管理された抽象化より重要な場合に、フルrootアクセスとカスタムスタックを備えたベアメタルサーバーをデプロイできます。
安定したスループットを継続的な負荷下で必要とするワークロード向けに、RDMA対応ネットワーキングを備えたマルチノードGPUクラスタを実行できます。
NVIDIA H100、H200、Blackwell、GB200、GB300、B200の各オファリングで、オンデマンド、予約、または事前注文の容量を選択できます。
LLMまたはマルチモーダルモデル向けの管理された推論から始め、トラフィックの増加に伴って、より多くの制御や容量が必要になっても同じプラットフォームを使い続けられます。
予測可能な性能と分離されたリソースを備えた専用NVIDIA GPU上で、長時間稼働または高稼働率の学習・ファインチューニングジョブを実行できます。
安定したスループットを大規模に必要とする分散ワークロード向けに、RDMA対応ネットワーキングを備えたマルチノードGPUクラスタを使用できます。
rootアクセス、ハードウェアレベルの制御、または特定のインフラ構成が必要な場合に、ベアメタルサーバーとカスタムスタックをデプロイできます。
短期的な実験、柔軟な成長、またはより予測しやすい長期利用に合わせて、オンデマンドまたは予約済みのGPU容量を選択できます。
GMI Cloudは、NVIDIAハードウェア上でサーバーレス推論、専用GPUクラスタ、ベアメタルGPUデプロイメントを提供する本番向けAIインフラ基盤です。
ソースでは、まずサーバーレス推論を提供し、ワークロードが増えたり、より多くの制御が必要になったりした場合に専用GPUインフラへスケールする形で説明されています。
料金ページには、NVIDIA H100、H200、Blackwell、GB200、GB300、B200のオプションが掲載されており、一部のGPUは現在利用可能で、ほかは予約注文または営業への問い合わせとなっています。
ソースでは、専用リソース、オンデマンドおよび予約済み容量オプション、隠れた費用がないことが示されていますが、ネットワークやストレージ料金の全体的な内訳は提供されていません。