无服务器推理
通过自动扩展至零、内置批处理、延迟感知调度,以及面向 LLM 和多模态模型的生产级 API 运行推理。
GMI Cloud 是面向生产推理、训练和微调的 AI 基础设施平台,基于 NVIDIA GPU,结合无服务器推理、专用集群与裸金属部署,满足可扩展 GPU 算力需求。
GMI Cloud 是一个 AI 原生推理云,专为运行在 NVIDIA 基础设施上的生产级 AI 工作负载而构建。它将无服务器推理、专用 GPU 集群和裸金属 GPU 部署整合到一个平台上,使团队可以先从托管推理开始,随着需求增长再逐步获得更深入的基础设施控制。
该平台面向推理、训练、微调和大规模 GPU 工作负载。源内容强调可预测性能、自动扩展和专用资源,而非共享环境,并针对特定 NVIDIA GPU 型号和容量选项公布了价格。
通过自动扩展至零、内置批处理、延迟感知调度,以及面向 LLM 和多模态模型的生产级 API 运行推理。
在不更换平台的情况下,从基于 API 的推理迁移到专用 GPU 集群,并在不同部署模式下使用相同的基础设施底座。
在 GMI 运营的数据中心中使用专用 NVIDIA GPU,满足需要可预测性能和隔离资源的持续性工作负载。
当基础设施控制比托管抽象更重要时,可部署具有完整 root 访问权限和自定义技术栈的裸金属服务器。
使用支持 RDMA 的网络运行多节点 GPU 集群,满足需要在持续负载下保持稳定吞吐量的工作负载。
可在 NVIDIA H100、H200、Blackwell、GB200、GB300 和 B200 选项中选择按需、预留或预订容量。
先使用托管推理服务来运行 LLM 或多模态模型,随着流量增长并且需要更多控制或容量时,继续使用同一平台。
在专用 NVIDIA GPU 上运行长期或高利用率的训练和微调任务,获得可预测性能和隔离资源。
使用支持 RDMA 的多节点 GPU 集群来运行需要在规模化场景下保持稳定吞吐量的分布式工作负载。
当你需要 root 访问权限、硬件级控制或特定基础设施配置时,部署裸金属服务器和自定义技术栈。
选择按需或预留 GPU 容量,以匹配短期实验、弹性增长或更可预测的长期使用。
GMI Cloud 提供基于 NVIDIA 硬件的生产级 AI 基础设施,支持无服务器推理、专用 GPU 集群和裸金属 GPU 部署。
源内容说明其默认采用无服务器推理,并可在工作负载增长或需要更多控制时扩展到专用 GPU 基础设施。
定价页面列出了 NVIDIA H100、H200、Blackwell、GB200、GB300 和 B200 选项,其中一些 GPU 可立即使用,另一些则标注为预订或联系销售。
源内容显示提供专用资源、按需和预留容量选项,并且没有隐藏费用,但未给出网络或存储费用的完整明细。