バージョン比較
プロンプト、モデル、RAG構成、ルーティング機構、その他のパイプライン設定を比較し、変更がLLMアプリケーションのパフォーマンスにどう影響するかを確認できます。
Deepchecksは、LLMの評価、テスト、監視を行うプラットフォームです。プロンプト、モデル、RAGパイプライン、エージェントワークフローの検証に対応し、ホスト型、プライベート、AWS管理型の導入が可能です。
Deepchecksは、LLMの評価、テスト、監視を行うプラットフォームです。価格ページでは、AIアプリケーション向けの継続的なML検証を実行する方法として説明されており、ドキュメントとAWSページでは、プロンプト、モデル、検索構成、複数ステップのエージェントワークフローの検証に重点が置かれています。
これは、バージョンの比較、評価セットの管理、アノテーションの自動化またはガイド、個々のAIアプリケーション全体にわたる本番環境の挙動の監視を必要とするチーム向けに構築されています。プラットフォームはホスト型SaaS製品として提供されるほか、プライベート、セルフホスト、AWS管理型の導入オプションもサポートしています。
プロンプト、モデル、RAG構成、ルーティング機構、その他のパイプライン設定を比較し、変更がLLMアプリケーションのパフォーマンスにどう影響するかを確認できます。
AI支援アノテーションを使って手動レビューを効率化し、データに応じて適応するカスタマイズ可能なスコアリングアルゴリズムと学習技術を利用できます。
特定のワークフロー向けに評価セットを生成、バージョン管理、拡張、探索でき、グラウンドトゥルース作成やテストセット型のベンチマークも含まれます。
SLM搭載の品質、リスク、ポリシー指標に加え、LLM搭載のカスタム指標、技術指標、ユーザーフィードバックループを選択できます。
使用状況ダッシュボードで月間DPU消費を追跡し、どのワークロードがプラットフォーム利用を促進しているかを把握できます。
複数言語でアプリケーションを評価し、独自のLLM APIキーを用意せずに、組み込みのプロンプトベース評価を利用できます。
プロンプトやモデルの変更を比較し、評価結果をグラウンドトゥルースと照合することで、チャットボット、アシスタント、その他のLLMアプリケーションを広く公開する前に検証します。
定期的な評価とガバナンスが必要な複数の本番AIアプリケーションを運用し、プランの上限、保持期間、使用状況の追跡を活用してチームの足並みをそろえます。
複雑なタスクを進む複数ステップのエージェントを評価し、チームがワークフロー全体にわたる意思決定ポイント、遷移、失敗を確認できるようにします。
評価セットを構築し、システムが外部ソースをどの程度活用し、文脈に沿って回答できるかを測定することで、検索拡張生成のセットアップをベンチマークします。
カスタム指標とガイド付きアノテーションワークフローを使用して、要約、生成テキスト、分類挙動、自然言語からコードへの出力をレビューします。
Deepchecksは、LLMアプリケーションとエージェントワークフローの検証と監視を行うチーム向けに位置づけられています。価格ページでは、Basicは初期段階の検証と単一アプリケーションのセットアップに適しており、Scaleは複数の本番アプリケーションと複数ステップのエージェントに適し、Enterpriseは高度なセキュリティと制御が必要なミッションクリティカルな導入に適していると説明されています。
SaaS導入では、契約期間中にアップグレードできます。有料プランでは追加ユーザーやAIアプリケーションの追加も可能で、ダウングレードは通常、次回更新時に反映されます。
はい。座席はワークスペース管理を通じて、組織内の別のユーザーに再割り当てできます。
AI Applicationとは、Deepchecksで評価・監視する個別のLLM駆動システムまたはワークフローを指します。価格ページの例としては、顧客向けチャットボット、社内AIアシスタント、RAGパイプライン、マルチエージェントワークフローが挙げられています。
Deepchecksは、AWS、GCP、またはAzure上のVPCデプロイ、ベアメタルデプロイ、AWS管理型オプションをサポートしています。価格ページには、ホスト型SaaSモデルとプライベートホスト型オプションも記載されています。