自動モデルテスト
ハルシネーション、完全性、関連性、有害性、バイアス、その他の出力品質を評価するために、100以上の組み込みテストとカスタマイズ可能なテストを実行できます。
Openlayerは、MLとLLMシステムのテスト、監視、制御を行うAIガバナンスと可観測性のプラットフォームです。リリース前の評価、本番挙動の追跡、ガバナンス業務を支援します。
Openlayerは、MLとLLMシステムの評価、監視、制御を行うAIガバナンスと可観測性のプラットフォームです。オフライン評価、本番トレーシング、ライブガードレール、自動化されたコンプライアンスワークフローを組み合わせ、チームがリリース前にシステムをテストし、本番環境で挙動を監視できるようにします。
このサイトでは、GenAIアプリ、エージェント、コパイロット、検索拡張生成、従来のMLモデルに取り組む開発者向けにOpenlayerを位置づけています。構造化テスト、リクエストトレース、データ品質チェック、NIST、ISO/IEC 42001、OWASP、EU AI Act などの標準との整合したコンプライアンスをサポートします。
ハルシネーション、完全性、関連性、有害性、バイアス、その他の出力品質を評価するために、100以上の組み込みテストとカスタマイズ可能なテストを実行できます。
プロンプト、モデルプロバイダー、システム変更を比較して、回帰を見つけ、時間の経過に伴う改善を追跡します。
LLM パイプラインとエージェントのワークフロー全体で、プロンプト、ツール呼び出し、中間ステップ、応答、レイテンシー、コストをトレースします。
ライブで安全性と性能のチェックを実行し、プロンプトインジェクション、データ漏えい、レイテンシーの急増、不適切なコンテンツなどの問題に対してアラートを設定できます。
SDK、API、CLI ワークフロー、GitHub Actions、Git ベースのプロセスを使用して、開発とデプロイの一部としてテストを起動します。
エンジニア、プロダクトマネージャー、研究者、その他の関係者が単一のワークスペースで共同レビューとフィードバックを行えるようにします。
テストスイート、比較、LLM-as-a-judge スコアリングを使って、出荷前にプロンプト、モデル出力、リリース候補を評価し、回帰を早期に検出します。
プロンプトインジェクション、有害な出力、データ漏えい、レイテンシー、コストの問題についてライブの GenAI システムを監視し、完全なリクエストトレースで失敗を調査します。
受信データに対して自動チェックを実行し、スキーマ変更、ドリフト、異常を検出して、不正なデータがモデルに届く前に防ぎます。
共有された評価結果、コメント、比較ワークフローを使って、エンジニア、PM、研究者、その他の関係者間でレビューを調整します。
NIST、ISO/IEC 42001、OWASP、EU AI Act などの標準をサポートするテストおよび監視ワークフローを使用して、AI システムをガバナンスおよびコンプライアンスのフレームワークに整合させます。
Openlayerは、LLM-as-a-judgeによるスコアリング、ルーブリックベースの評価、プロンプトテストのカバレッジ、バージョンやプロンプト間の比較など、LLMとMLモデルのための構造化テストをサポートしています。
ソースページでは、ワークフローや製品領域に応じて、OpenAI、Anthropic、Hugging Face、LangChain、OpenTelemetry、Snowflake、GitHub Actions、GitLab CI などへの対応が示されています。
Openlayerは、プロンプト、ツール呼び出し、レイテンシー、コスト、モデル応答、失敗モードを、複数ステップおよび検索ベースのワークフロー全体でトレースできます。
料金ページには、Basic のトライアルプランと Enterprise プランが掲載されています。Basic には月間20,000推論、CLI/SDK/API アクセス、コミュニティサポートが含まれ、Enterprise にはチームアクセス制御、オンプレミス展開、説明可能性、SAML SSO、ホワイトグローブのオンボーディングなどのオプションが追加されます。