Serverless 推論
透過自動縮放至零、內建批次處理、延遲感知排程,以及可供 LLM 與多模態模型使用的生產級 API 來執行推論。
GMI Cloud 是一個 AI 基礎架構平台,可在 NVIDIA GPU 上執行生產級推論、訓練與微調,結合 serverless 推論、專屬叢集與裸機部署,滿足可擴充 GPU 容量需求。
GMI Cloud 是一個以 AI 為原生的推論雲端,專為 NVIDIA 基礎架構上的生產級 AI 工作負載而打造。它在單一平台上結合 serverless 推論、專屬 GPU 叢集與裸機 GPU 部署,讓團隊可以先使用代管推論,並隨著需求成長再進一步取得更深層的基礎架構控制。
此平台定位於推論、訓練、微調與大規模 GPU 工作負載。來源強調可預測的效能、自動擴展與專屬資源,而非共享環境,並針對特定 NVIDIA GPU 類別與容量選項公開定價。
透過自動縮放至零、內建批次處理、延遲感知排程,以及可供 LLM 與多模態模型使用的生產級 API 來執行推論。
在不更換平台的情況下,從 API 型推論切換到專屬 GPU 叢集,並在不同部署模式間使用相同的基礎架構。
在 GMI 營運的資料中心內使用專屬 NVIDIA GPU,以支援需要可預測效能與隔離資源的持續性工作負載。
當基礎架構控制比代管抽象化更重要時,可部署具備完整 root 存取權與自訂堆疊的裸機伺服器。
針對需要在持續負載下維持穩定吞吐量的工作負載,使用具備 RDMA-ready 網路的多節點 GPU 叢集。
可在 NVIDIA H100、H200、Blackwell、GB200、GB300 與 B200 產品中選擇隨需、保留或預購容量。
先以 LLM 或多模態模型的代管推論開始,之後當流量成長並需要更多控制或容量時,繼續使用同一平台。
在具備可預測效能與隔離資源的專屬 NVIDIA GPU 上執行長時間或高使用率的訓練與微調工作。
使用具備 RDMA-ready 網路的多節點 GPU 叢集來處理需要大規模穩定吞吐量的分散式工作負載。
當您需要 root 存取權、硬體層級控制或特定基礎架構設定時,部署裸機伺服器與自訂堆疊。
選擇隨需或保留 GPU 容量,以符合短期實驗、彈性成長或較可預測的長期使用需求。
GMI Cloud 提供用於 NVIDIA 硬體上的生產級 AI 基礎架構,涵蓋 serverless 推論、專屬 GPU 叢集與裸機 GPU 部署。
來源說明其預設為 serverless 推論,並在工作負載成長或需要更多控制時,擴展到專屬 GPU 基礎架構。
定價頁列出 NVIDIA H100、H200、Blackwell、GB200、GB300 與 B200 選項,其中部分 GPU 可立即使用,其他則標示為預購或聯絡銷售。
來源指出有專屬資源、隨需與保留容量選項,且沒有隱藏費用,但未提供網路或儲存費用的完整明細。