Deepchecks logo

Deepchecks

Freemium
訪問

プロンプト、モデル、RAGパイプライン、エージェントを評価・テスト・監視するLLMプラットフォーム

Deepchecksとは?

Deepchecksは、LLMの評価、テスト、監視を行うプラットフォームです。価格ページでは、AIアプリケーション向けの継続的なML検証を実行する方法として説明されており、ドキュメントとAWSページでは、プロンプト、モデル、検索構成、複数ステップのエージェントワークフローの検証に重点が置かれています。

これは、バージョンの比較、評価セットの管理、アノテーションの自動化またはガイド、個々のAIアプリケーション全体にわたる本番環境の挙動の監視を必要とするチーム向けに構築されています。プラットフォームはホスト型SaaS製品として提供されるほか、プライベート、セルフホスト、AWS管理型の導入オプションもサポートしています。

Deepchecksでできること

バージョン比較

プロンプト、モデル、RAG構成、ルーティング機構、その他のパイプライン設定を比較し、変更がLLMアプリケーションのパフォーマンスにどう影響するかを確認できます。

AI支援アノテーション

AI支援アノテーションを使って手動レビューを効率化し、データに応じて適応するカスタマイズ可能なスコアリングアルゴリズムと学習技術を利用できます。

EvalSet管理

特定のワークフロー向けに評価セットを生成、バージョン管理、拡張、探索でき、グラウンドトゥルース作成やテストセット型のベンチマークも含まれます。

柔軟な評価プロパティ

SLM搭載の品質、リスク、ポリシー指標に加え、LLM搭載のカスタム指標、技術指標、ユーザーフィードバックループを選択できます。

使用状況の監視

使用状況ダッシュボードで月間DPU消費を追跡し、どのワークロードがプラットフォーム利用を促進しているかを把握できます。

多言語および管理型評価

複数言語でアプリケーションを評価し、独自のLLM APIキーを用意せずに、組み込みのプロンプトベース評価を利用できます。

利用シーン

“リリース前のLLM検証”

プロンプトやモデルの変更を比較し、評価結果をグラウンドトゥルースと照合することで、チャットボット、アシスタント、その他のLLMアプリケーションを広く公開する前に検証します。

“複数アプリの本番監視”

定期的な評価とガバナンスが必要な複数の本番AIアプリケーションを運用し、プランの上限、保持期間、使用状況の追跡を活用してチームの足並みをそろえます。

“マルチエージェントワークフローの評価”

複雑なタスクを進む複数ステップのエージェントを評価し、チームがワークフロー全体にわたる意思決定ポイント、遷移、失敗を確認できるようにします。

“RAG品質評価”

評価セットを構築し、システムが外部ソースをどの程度活用し、文脈に沿って回答できるかを測定することで、検索拡張生成のセットアップをベンチマークします。

“タスク固有モデルのテスト”

カスタム指標とガイド付きアノテーションワークフローを使用して、要約、生成テキスト、分類挙動、自然言語からコードへの出力をレビューします。

よくある質問

どのプランを選べばよいですか?

Deepchecksは、LLMアプリケーションとエージェントワークフローの検証と監視を行うチーム向けに位置づけられています。価格ページでは、Basicは初期段階の検証と単一アプリケーションのセットアップに適しており、Scaleは複数の本番アプリケーションと複数ステップのエージェントに適し、Enterpriseは高度なセキュリティと制御が必要なミッションクリティカルな導入に適していると説明されています。

後からプランを変更できますか?

SaaS導入では、契約期間中にアップグレードできます。有料プランでは追加ユーザーやAIアプリケーションの追加も可能で、ダウングレードは通常、次回更新時に反映されます。

ユーザーライセンスは譲渡できますか?

はい。座席はワークスペース管理を通じて、組織内の別のユーザーに再割り当てできます。

DeepchecksでいうAI Applicationとは何ですか?

AI Applicationとは、Deepchecksで評価・監視する個別のLLM駆動システムまたはワークフローを指します。価格ページの例としては、顧客向けチャットボット、社内AIアシスタント、RAGパイプライン、マルチエージェントワークフローが挙げられています。

Deepchecksはプライベートまたはセルフホスト型の導入をサポートしていますか?

Deepchecksは、AWS、GCP、またはAzure上のVPCデプロイ、ベアメタルデプロイ、AWS管理型オプションをサポートしています。価格ページには、ホスト型SaaSモデルとプライベートホスト型オプションも記載されています。

クイック情報

カテゴリー
LLMの評価、テスト、監視
プラットフォーム
ホスト型SaaS、プライベートホスト型、VPC、ベアメタル、AWS管理型の導入オプション
主なユーザー
LLMアプリケーションとAIエージェントを構築・運用するチーム
ソースドメイン
deepchecks.com
価格モデル
試用版/デモ/問い合わせの導線がある階層型プラン。SaaS利用向けの固定クォータと追加容量
主なワークフロー
バージョン比較、アノテーション、EvalSet管理、プロパティ、監視

Deepchecks のトラフィック分析

トラフィックデータは参考情報としてご利用ください。

ドメイン評価
64

Deepchecksの代替品

Ito logo

Ito

ito.ai

Ito はコードを理解するエージェントでプルリクエストを監査する自動 QA 製品です。手動テストスクリプトを保守せず、開発の速いチームがリグレッションや使いやすさの問題を発見できます。

Confident AI logo

Confident AI

confident-ai.com

Confident AI は、AI システムのテスト、監視、改善を支援する AI 品質プラットフォームです。

Openlayer logo

Openlayer

openlayer.com

ML・LLMシステムのテスト、監視、制御を支援するAIガバナンス・可観測性プラットフォーム

Braintrust logo

Braintrust

braintrust.dev

Braintrust は、本番環境の AI の挙動を追跡し、評価を実行して、ユーザーに影響が及ぶ前にリグレッションを検出できる AI オブザーバビリティプラットフォームです。トレース、データセット、スコアリング、ワークフローツールで AI 製品の開発・運用を支援します。

blop logo

blop

blopai.com

ブラウザテストを作成・実行・分類・修正するQAエージェント

Evlat logo

Evlat

evlat.kalaomer.com

Evlat is a quiet macOS status strip for monitoring Claude Code, Codex, and Antigravity sessions, plus long-running commands. It highlights sessions that need your response and shows activity from local or SSH-connected machines.