Deepchecks logo

Deepchecks

认领

Deepchecks 是一个用于 LLM 评估、测试和监控的平台,帮助团队验证提示词、模型、RAG 流水线和智能体工作流。支持托管、私有及 AWS 托管部署,满足持续 AI 验证需求。

Deepchecks preview

LLM 评估与监控平台

Deepchecks 是一个用于 LLM 评估、测试和监控的平台。定价页将其描述为一种为 AI 应用运行持续 ML 验证的方式,而文档和 AWS 页面则聚焦于验证提示词、模型、检索设置以及多步骤智能体工作流。

它专为需要比较版本、管理评估集、自动化或引导标注,并在单个 AI 应用上监控生产行为的团队而设计。该平台既提供托管 SaaS 产品,也支持私有、自托管和 AWS 托管部署选项。

核心能力

版本比较

比较提示词、模型、RAG 设置、路由机制或其他流水线配置,查看变更如何影响 LLM 应用性能。

AI 辅助标注

使用 AI 辅助标注来简化人工审核,并结合可自定义的评分算法和可随数据调整的学习技术。

EvalSet 管理

为特定工作流生成、版本化、扩展和探索评估集,包括创建真实标签和测试集式基准评估。

灵活的评估属性

从基于 SLM 的质量、风险和政策指标,以及基于 LLM 的自定义指标、技术指标和用户反馈循环中进行选择。

使用情况监控

在使用情况仪表板中跟踪每月 DPU 消耗,并了解哪些工作负载正在驱动平台使用。

多语言与托管评估

支持多种语言的应用评估,并可使用内置的基于提示词的评估,无需提供自己的 LLM API 密钥。

常见工作流

  • 发布前 LLM 验证

    在更广泛发布前,通过比较提示词或模型变更,并将评估输出与真实标签对照,验证聊天机器人、助手或其他 LLM 应用。

  • 多应用生产监控

    使用计划限制、保留期和使用情况跟踪来保持团队一致,对多个生产 AI 应用执行持续评估和治理需求。

  • 多智能体工作流评估

    评估在复杂任务中逐步推进的多步骤智能体,团队需要检查工作流中的决策点、状态转换和失败。

  • RAG 质量评估

    通过构建评估集并衡量系统利用外部来源和结合上下文回答的效果,对检索增强生成设置进行基准评估。

  • 任务特定模型测试

    使用自定义指标和引导式标注工作流,审查摘要、生成文本、分类行为或自然语言转代码输出。

Pros and Cons

Pros

  • 覆盖从评估集创建到版本比较和生产监控的完整工作流。
  • 支持多种部署模式,包括托管、VPC、裸金属和 AWS 托管选项。
  • 内置面向质量、风险、政策、技术和反馈驱动检查的评估属性。
  • 提供 AI 辅助标注工具和可定制评分,以减少人工审核工作量。
  • 支持多种语言,并且基于提示词的评估不需要外部 API 密钥。

Cons

  • 公开定价页展示了方案结构和使用限制,但在所提供的页面文本中没有列出具体商业价格。
  • 部分部署和合规细节仅作了高层说明,因此有严格要求的买家仍需直接确认认证和架构细节。

FAQ

我应该选择哪个方案?

Deepchecks 面向用于验证和监控 LLM 应用及智能体工作流的团队。定价页说明,Basic 适合早期验证和单应用场景,Scale 适合多生产应用和多步骤智能体,Enterprise 适合具有高级安全性和控制需求的关键业务部署。

我之后可以更改方案吗?

对于 SaaS 部署,可在合同期内升级。付费方案也支持增加用户或 AI 应用,降级通常会在下一个续约周期生效。

用户许可证可以转让吗?

可以。席位可以通过工作区管理分配给组织内的其他用户。

Deepchecks 所说的 AI Application 是什么意思?

在 Deepchecks 中,AI Application 指的是你要评估和监控的一个独立、由 LLM 驱动的系统或工作流。定价页给出的示例包括面向客户的聊天机器人、内部 AI 助手、RAG 流水线和多智能体工作流。

Deepchecks 支持私有部署或自托管部署吗?

Deepchecks 支持在 AWS、GCP 或 Azure 上的 VPC 部署、裸金属部署,以及 AWS 托管选项。定价页还提到托管 SaaS 模式和私有托管选项。

Quick Facts

类别
LLM 评估、测试和监控
平台
托管 SaaS、私有托管、VPC、裸金属和 AWS 托管部署选项
主要用户
构建和运营 LLM 应用及 AI 智能体的团队
源域名
deepchecks.com
定价模式
分层方案,包含试用/演示/联系流程;SaaS 使用提供固定配额和附加容量
关键工作流
版本比较、标注、EvalSet 管理、属性和监控