Inferless logo

Inferless

认领

Inferless 是一款无服务器 GPU 推理平台,可从 Hugging Face、Git、Docker 或 CLI 部署自定义机器学习模型。支持自动扩缩容、按秒计费及共享或独占 GPU 实例。

Inferless preview

用于模型部署的无服务器 GPU 推理

Inferless 是一个用于部署自定义机器学习模型的无服务器 GPU 推理平台。它旨在让模型在几分钟内从文件到端点,并面向需要 GPU 支持推理且不直接管理基础设施的生产工作负载。

该平台支持从 Hugging Face、Git、Docker 或 CLI 部署,并提供自动重新部署、自定义运行时、可写卷、监控、动态批处理和私有端点设置等运维控制。定价页面显示,NVIDIA T4、A10 和 A100 GPU 采用按秒计费,并提供共享和独占实例选项。

核心能力

多种部署路径

从 Hugging Face、Git、Docker 或 CLI 部署模型,然后使用自动重新部署来保持端点与代码变更同步。

无服务器 GPU 自动扩缩容

将模型端点从零扩展到数百个 GPU,并由自建负载均衡器根据需求调整容量。

自定义运行时支持

自定义容器环境,以包含模型在运行时所需的软件和依赖项。

可写卷

使用类似 NFS 的可写卷,并可同时连接多个副本,用于模型文件和其他共享数据。

动态批处理

启用服务端请求合并,以提高适合批处理工作负载的吞吐量。

监控和端点控制

查看调用和构建日志,并配置端点行为,例如缩容、超时、并发、测试和 webhook 设置。

常见用例

  • 生产环境模型服务

    在不直接管理 GPU 集群的情况下,为计算机视觉、NLP、推荐或科学计算模型部署基于 GPU 的推理。

  • 突发流量工作负载

    通过在请求增加或减少时将端点从零扩展到数百个 GPU,处理波动较大的工作负载。

  • 高吞吐量推理

    使用动态批处理来提高吞吐量,从而服务于受益于请求合并的模型。

  • 持续模型更新

    通过自动重新部署流程运行模型更新,让来自 Hugging Face、Git、Docker 或基于 CLI 的工作流的更改以更少的手动重新导入到达端点。

  • 注重成本与隔离的部署

    根据更低成本或更一致的资源分配与隔离需求,在共享或独占 GPU 实例之间进行选择。

Pros and Cons

Pros

  • 支持从多个来源部署,包括 Hugging Face、Git、Docker 和 CLI。
  • 提供从零到数百个 GPU 的无服务器扩缩容。
  • 提供自定义运行时、可写卷、动态批处理和私有端点设置等运维控制。
  • 采用按秒计费,无需前期成本。
  • 文档中说明了安全措施,包括隔离执行环境、独立日志流和加密模型存储。

Cons

  • 来源提到首次调用有 10–20 秒的冷启动时间。
  • 价格和性能会因机器类型以及选择共享或独占实例而异。
  • 根据定价 FAQ,该平台处于私有测试阶段,因此可能需要满足访问条件。

FAQ

我可以在 Inferless 上部署哪些类型的模型?

Inferless 适用于部署基于 GPU 的机器学习模型。源内容示例包括计算机视觉、NLP、推荐和科学计算工作负载,以及 Llama2 13B、Stable Diffusion ControlNet 和 Vicuna 7B 等模型。

如何将模型部署到平台上?

首页说明你可以从 Hugging Face、Git、Docker 或你的 CLI 部署。它还支持自动重新部署,因此模型更新可以在无需手动重新导入的情况下推送到端点。

计费是如何运作的?

Inferless 采用按秒计费。费用基于模型在健康状态下运行的时间以及你选择的机器类型,定价页面还说明没有前期费用。

我应该对延迟有什么预期?

定价页面说明首次调用可能会有 10–20 秒的冷启动,而后续调用取决于推理时间。这意味着延迟会因模型是否已预热而有所不同。

共享实例和独占实例有什么区别?

Inferless 说明共享实例会在用户之间分摊 GPU 资源,作为更低成本的选项;而独占实例则为单个用户保留完整 GPU,面向更一致的性能和数据隔离。

Quick Facts

类别
无服务器 GPU 推理
主要用户
开发者、小团队、初创公司和大型组织
部署输入
Hugging Face、Git、Docker、CLI
GPU 选项
NVIDIA T4、A10、A100
计费模式
按秒计费
网站
inferless.com