GMI Cloud logo

GMI Cloud

认领

GMI Cloud 是面向生产推理、训练和微调的 AI 基础设施平台,基于 NVIDIA GPU,结合无服务器推理、专用集群与裸金属部署,满足可扩展 GPU 算力需求。

GMI Cloud preview

概述

GMI Cloud 是一个 AI 原生推理云,专为运行在 NVIDIA 基础设施上的生产级 AI 工作负载而构建。它将无服务器推理、专用 GPU 集群和裸金属 GPU 部署整合到一个平台上,使团队可以先从托管推理开始,随着需求增长再逐步获得更深入的基础设施控制。

该平台面向推理、训练、微调和大规模 GPU 工作负载。源内容强调可预测性能、自动扩展和专用资源,而非共享环境,并针对特定 NVIDIA GPU 型号和容量选项公布了价格。

核心能力

无服务器推理

通过自动扩展至零、内置批处理、延迟感知调度,以及面向 LLM 和多模态模型的生产级 API 运行推理。

灵活的部署路径

在不更换平台的情况下,从基于 API 的推理迁移到专用 GPU 集群,并在不同部署模式下使用相同的基础设施底座。

专用 GPU 基础设施

在 GMI 运营的数据中心中使用专用 NVIDIA GPU,满足需要可预测性能和隔离资源的持续性工作负载。

裸金属控制

当基础设施控制比托管抽象更重要时,可部署具有完整 root 访问权限和自定义技术栈的裸金属服务器。

集群网络

使用支持 RDMA 的网络运行多节点 GPU 集群,满足需要在持续负载下保持稳定吞吐量的工作负载。

广泛的 NVIDIA 硬件覆盖

可在 NVIDIA H100、H200、Blackwell、GB200、GB300 和 B200 选项中选择按需、预留或预订容量。

常见用例

  • 生产模型服务

    先使用托管推理服务来运行 LLM 或多模态模型,随着流量增长并且需要更多控制或容量时,继续使用同一平台。

  • 模型训练与微调

    在专用 NVIDIA GPU 上运行长期或高利用率的训练和微调任务,获得可预测性能和隔离资源。

  • 分布式集群工作负载

    使用支持 RDMA 的多节点 GPU 集群来运行需要在规模化场景下保持稳定吞吐量的分布式工作负载。

  • 基础设施可控部署

    当你需要 root 访问权限、硬件级控制或特定基础设施配置时,部署裸金属服务器和自定义技术栈。

  • 容量规划与扩展

    选择按需或预留 GPU 容量,以匹配短期实验、弹性增长或更可预测的长期使用。

Pros and Cons

Pros

  • 在同一平台上同时支持无服务器推理和专用 GPU 基础设施。
  • 公布了多种 NVIDIA 型号的 GPU 价格,包括 H100、H200、B200、GB200 和 GB300。
  • 提供从容器服务到裸金属和托管多节点集群的多种部署选项。
  • 为推理工作负载描述了自动扩展、批处理和延迟感知调度。
  • 采用专用资源和隔离,而非共享 GPU 环境。

Cons

  • 源内容未提供详细的集成、API 或框架文档。
  • 某些较新的 GPU 选项标注为预订、库存有限或仅限联系销售。
  • 所提供页面未明确说明网络、存储和完整系统套件的价格明细。

FAQ

GMI Cloud 用于什么?

GMI Cloud 提供基于 NVIDIA 硬件的生产级 AI 基础设施,支持无服务器推理、专用 GPU 集群和裸金属 GPU 部署。

GMI Cloud 如何处理扩展?

源内容说明其默认采用无服务器推理,并可在工作负载增长或需要更多控制时扩展到专用 GPU 基础设施。

平台提供哪些 NVIDIA GPU?

定价页面列出了 NVIDIA H100、H200、Blackwell、GB200、GB300 和 B200 选项,其中一些 GPU 可立即使用,另一些则标注为预订或联系销售。

价格如何构成?

源内容显示提供专用资源、按需和预留容量选项,并且没有隐藏费用,但未给出网络或存储费用的完整明细。

Quick Facts

类别
AI 基础设施
主要用途
生产推理和 GPU 工作负载
平台
NVIDIA GPU 云
部署模式
无服务器推理、专用 GPU 集群、裸金属
定价模式
公开的 GPU 小时价格,加上预留和按需容量
域名
gmicloud.ai