多种部署路径
从 Hugging Face、Git、Docker 或 CLI 部署模型,然后使用自动重新部署来保持端点与代码变更同步。
Inferless 是一款无服务器 GPU 推理平台,可从 Hugging Face、Git、Docker 或 CLI 部署自定义机器学习模型。支持自动扩缩容、按秒计费及共享或独占 GPU 实例。
Inferless 是一个用于部署自定义机器学习模型的无服务器 GPU 推理平台。它旨在让模型在几分钟内从文件到端点,并面向需要 GPU 支持推理且不直接管理基础设施的生产工作负载。
该平台支持从 Hugging Face、Git、Docker 或 CLI 部署,并提供自动重新部署、自定义运行时、可写卷、监控、动态批处理和私有端点设置等运维控制。定价页面显示,NVIDIA T4、A10 和 A100 GPU 采用按秒计费,并提供共享和独占实例选项。
从 Hugging Face、Git、Docker 或 CLI 部署模型,然后使用自动重新部署来保持端点与代码变更同步。
将模型端点从零扩展到数百个 GPU,并由自建负载均衡器根据需求调整容量。
自定义容器环境,以包含模型在运行时所需的软件和依赖项。
使用类似 NFS 的可写卷,并可同时连接多个副本,用于模型文件和其他共享数据。
启用服务端请求合并,以提高适合批处理工作负载的吞吐量。
查看调用和构建日志,并配置端点行为,例如缩容、超时、并发、测试和 webhook 设置。
在不直接管理 GPU 集群的情况下,为计算机视觉、NLP、推荐或科学计算模型部署基于 GPU 的推理。
通过在请求增加或减少时将端点从零扩展到数百个 GPU,处理波动较大的工作负载。
使用动态批处理来提高吞吐量,从而服务于受益于请求合并的模型。
通过自动重新部署流程运行模型更新,让来自 Hugging Face、Git、Docker 或基于 CLI 的工作流的更改以更少的手动重新导入到达端点。
根据更低成本或更一致的资源分配与隔离需求,在共享或独占 GPU 实例之间进行选择。
Inferless 适用于部署基于 GPU 的机器学习模型。源内容示例包括计算机视觉、NLP、推荐和科学计算工作负载,以及 Llama2 13B、Stable Diffusion ControlNet 和 Vicuna 7B 等模型。
首页说明你可以从 Hugging Face、Git、Docker 或你的 CLI 部署。它还支持自动重新部署,因此模型更新可以在无需手动重新导入的情况下推送到端点。
Inferless 采用按秒计费。费用基于模型在健康状态下运行的时间以及你选择的机器类型,定价页面还说明没有前期费用。
定价页面说明首次调用可能会有 10–20 秒的冷启动,而后续调用取决于推理时间。这意味着延迟会因模型是否已预热而有所不同。
Inferless 说明共享实例会在用户之间分摊 GPU 资源,作为更低成本的选项;而独占实例则为单个用户保留完整 GPU,面向更一致的性能和数据隔离。