基础设施控制与 GPU 编排
在本地、云端或混合环境中管理 GPU 集群,支持调度、配额管理、动态分数 GPU 和按使用量计费控制。
ClearML 是一体化 AI 基础设施平台,用于管理 GPU 集群、构建和训练 AI/ML 模型,并在托管、自托管和混合环境中部署 GenAI 工作负载。
ClearML 是围绕三层互联架构构建的 AI 基础设施平台:Infrastructure Control Plane、AI Development Center 和 GenAI App Engine。它们共同用于帮助团队管理计算资源、构建和训练 AI/ML 模型,并在企业环境中部署 GenAI 应用。
该平台专为既需要软件工作流控制又需要基础设施控制的组织而设计。源页面说明其支持 GPU 集群管理、实验跟踪、流水线、模型仓库、CI/CD 自动化、数据集版本管理和 LLM 部署,并提供托管、自托管、VPC、本地部署、隔离网络和混合等部署选项。
在本地、云端或混合环境中管理 GPU 集群,支持调度、配额管理、动态分数 GPU 和按使用量计费控制。
使用 AI Development Center 在共享工作台中管理实验、数据集、模型、制品、指标、报告和流水线。
跟踪代码、配置、日志、包以及未提交的更改,使模型运行更易复现,也更易于调试。
创建可复用的数据集版本,支持可搜索的元数据、预览、继承、差异化存储,以及 HTTP、S3、GCS、Azure 和 NAS 等灵活存储后端。
借助 App Engine 工具链部署并迭代 GenAI 工作负载,支持 LLM API、数据摄取、向量数据库创建和反馈收集。
通过托管、自托管、VPC、本地部署、隔离网络或混合部署路径,使平台适配不同的运营模式。
在团队之间配置和管理 GPU 容量,然后通过配额管理、调度和分数 GPU 控制分配工作。
跟踪实验、比较运行结果、管理数据集,并在迭代式 AI/ML 开发过程中组织好模型制品。
将训练任务排队,并让平台在本地、云端或 HPC 资源之间管理调度、容器化执行和可复现性。
部署自定义或微调后的 LLM,配置访问控制,并借助数据摄取和向量数据库工具支持模型迭代。
当团队需要在开发与生产之间实现更紧密的交接时,使用单一平台完成版本管理、报告和 CI/CD 自动化。
ClearML 的平台被呈现为三层系统:Infrastructure Control Plane、AI Development Center 和 GenAI App Engine。Development Center 是用于构建、训练和部署 AI/ML 模型的工作台,而其他层负责基础设施和 GenAI 部署。
定价页面说明 ClearML 可在托管服务器上使用、自托管,或作为托管服务使用;具体部署选项包括 VPC、本地部署、隔离网络或混合部署,取决于所选方案。
源材料显示,AI Development Center 支持实验管理、编排、仪表板、流水线、模型仓库、CI/CD 集成、数据集成、超参数优化和模型部署。定价功能矩阵还提到支持模型微调和向量数据库集成。
定价页面列出了 Community、Pro、Scale 和 Enterprise 选项。Community 显示为免费,Pro 是按用户计费的付费方案,而 Scale 和 Enterprise 采用定制报价。
可以。首页说明 ClearML 是一个统一的开源平台,定价页面还提到你也可以在 GitHub 上将自托管的 ClearML 作为 100% 开源软件运行。