多種部署途徑
從 Hugging Face、Git、Docker 或 CLI 部署模型,之後可使用自動重新部署,讓端點與程式碼變更保持同步。
Inferless 是一個無伺服器 GPU 推論平台,可從 Hugging Face、Git、Docker 或 CLI 部署自訂機器學習模型,支援自動擴縮、按秒計費與共享或專用 GPU 執行個體。
Inferless 是一個無伺服器 GPU 推論平台,用於部署自訂機器學習模型。它的設計目標是讓模型能在幾分鐘內從檔案部署到端點,並面向需要 GPU 支援推論、但不想直接管理基礎架構的生產工作負載。
該平台支援從 Hugging Face、Git、Docker 或 CLI 部署,並提供自動重新部署、自訂執行階段、可寫入磁碟區、監控、動態批次處理與私有端點設定等營運控制。定價頁面顯示可在 NVIDIA T4、A10 與 A100 GPU 上按秒計費,並提供共享與專用執行個體選項。
從 Hugging Face、Git、Docker 或 CLI 部署模型,之後可使用自動重新部署,讓端點與程式碼變更保持同步。
將模型端點從零擴展到數百個 GPU,並由內建負載平衡器根據需求調整容量。
自訂容器環境,以在執行時納入模型所需的軟體與依賴項。
使用類似 NFS 的可寫入磁碟區,並可同時連線至多個副本,用於模型檔案與其他共享資料。
啟用伺服器端請求合併,提升適合批次處理工作負載的吞吐量。
檢視呼叫與建置記錄,並設定端點行為,例如縮減、逾時、並行性、測試與 webhook 設定。
在不直接管理 GPU 叢集的情況下,為電腦視覺、NLP、推薦或科學運算模型部署具 GPU 支援的推論。
透過在請求增加或減少時將端點從零擴展到數百個 GPU,來處理流量大幅波動的工作負載。
對受益於請求合併的模型提供服務,使用動態批次處理來提升高負載下的吞吐量。
透過自動重新部署流程執行模型更新,讓 Hugging Face、Git、Docker 或基於 CLI 的工作流程中的變更能以較少人工重新匯入的方式送達端點。
依照較低成本或更一致的資源配置與隔離需求,在共享或專用 GPU 執行個體之間做選擇。
Inferless 專為部署以 GPU 為基礎的機器學習模型而設計。來源範例提到電腦視覺、NLP、推薦,以及科學運算工作負載,並包含如 Llama2 13B、Stable Diffusion ControlNet 和 Vicuna 7B 等模型。
首頁說明你可以從 Hugging Face、Git、Docker 或你的 CLI 進行部署。它也支援自動重新部署,因此模型更新可以在不需手動重新匯入的情況下推送到平台上。
Inferless 採用按秒計費。費用取決於你的模型在健康狀態下運行的時間以及你選擇的機器類型,且定價頁面說明沒有前期成本。
定價頁面表示首次呼叫可能會有 10–20 秒的冷啟動,而後續呼叫則取決於推論時間。也就是說,延遲會因模型是否已經預熱而有所不同。
Inferless 表示,共享執行個體會在多位使用者之間分攤 GPU 資源,屬於較低成本的選項;而專用執行個體則為單一使用者保留完整 GPU,並定位為提供更穩定的效能與資料隔離。