Fleet 管理
定義 fleet,以在 GPU 雲端、Kubernetes 與內部部署環境之間佈建與管理叢集。Fleet 可用來控制執行個體的佈建與重複使用方式。
dstack 是一個開源控制平面,用於在 GPU 雲端、Kubernetes 與內部部署叢集上佈建與編排 AI 工作負載,透過單一 YAML 與 CLI 工作流程管理開發、訓練與推論。
dstack 是一個用於異質 AI 運算的開源編排層。它作為統一的控制平面,負責在 GPU 雲端、Kubernetes 與內部部署叢集之間佈建 GPU 並執行工作負載。
此產品專為容器化 AI 工作負載設計,涵蓋開發、訓練與推論。使用者以 YAML 定義 fleet、dev environment、task、service 與 volume,然後透過 CLI 或 API 套用這些設定,而 dstack 則負責基礎設施佈建與工作負載排程。
定義 fleet,以在 GPU 雲端、Kubernetes 與內部部署環境之間佈建與管理叢集。Fleet 可用來控制執行個體的佈建與重複使用方式。
建立互動式開發環境,讓 agents 或 IDE 可以存取,使開發者能在接近目標運算資源的地方工作,而不需要手動設定基礎設施。
為訓練與批次作業排程單節點或分散式任務。文件也指出,任務可以執行 Web 應用程式。
將模型推論與其他面向 Web 的工作負載部署為服務,由 dstack 負責其周邊的編排。
管理網路磁碟區,以在工作負載與執行之間保留資料。
使用 CLI、UI 與 API 來管理工作負載,並透過儲存在儲存庫中的 YAML 設定檔進行設定。
在多個 GPU 雲端或混合基礎設施上佈建叢集,然後透過單一控制平面進行管理,而不是分別使用各家供應商的工具。
建立可重現的開發環境,開發者或 agent 可從 IDE 開啟,減少本機設定工作。
使用相同的設定模型,在單節點或多節點運算上執行訓練、批次作業與分散式實驗。
在既有運算資源之上部署推論端點或其他需要安全、可擴充執行環境的服務。
當您已經有現成基礎設施時,連接既有的 Kubernetes 叢集或可透過 SSH 存取的伺服器,讓 dstack 在其上編排工作負載。
您可以使用 `uv` 在本地安裝 dstack,或使用 `dstackai/dstack` Docker 映像進行部署。文件也提到,您可以註冊 dstack Sky,而不必自行代管伺服器。
dstack 的運作方式是:先在您的儲存庫中的 YAML 檔案裡定義設定,然後透過 `dstack apply` 或程式化 API 套用。它會在處理自動擴縮、埠轉發與 ingress 的同時,佈建基礎設施並排程工作負載。
可以。文件指出,您可以透過 Kubernetes backend 連接現有的 Kubernetes 叢集,並在其上執行開發環境、任務與服務。dstack 也支援用於內部部署伺服器的 SSH fleet。
來源頁面沒有顯示核心產品的公開定價表。不過頁面有提到 dstack Sky 和 dstack Enterprise 等代管選項,其中 Sky 描述為由 dstack 代管,Enterprise 則為自架,並提供 SSO、隔離網路部署與專屬支援。
dstack 是為異質 AI 運算上的開發、訓練與推論而打造。文件強調 fleet、dev environment、task、service 與 volume 是主要的設定類型。