Langfuse logo

Langfuse

Freemium
訪問

LLMアプリケーションとエージェントの追跡・評価・改善を行うオープンソースAIエンジニアリング基盤。

Langfuseとは?

Langfuseは、LLMアプリケーションとエージェントのトレース、評価、改善を行うためのオープンソースAIエンジニアリングプラットフォームです。可観測性、プロンプト管理、実験、人手による注釈を1つのワークフローに統合し、実際の利用データを使ってチームがプロトタイプから本番環境へ移行できるようにします。

このプラットフォームは、OpenTelemetry互換のトレース、ネイティブSDK、幅広い統合を中心に構築されており、単一のフレームワークに固定されることなくLLMおよび非LLMのアクティビティを収集できます。Langfuseはクラウドデプロイとセルフホスティングの両方をサポートしており、製品とコア機能はMITライセンスで提供されています。

Langfuseでできること

LLMとエージェントのトレース

LLM呼び出し、ツールの実行、検索ステップ、その他のアプリケーションロジックについて、階層化されたトレースを記録します。ユーザー、セッション、コスト、レイテンシー、またはカスタムメタデータでトレースを絞り込み、確認できます。

セッション、ユーザー、エージェントグラフ

マルチターンの会話をセッションとして追跡し、本番デバッグや利用状況分析のためにユーザー追跡を追加します。エージェントは、より複雑なワークフロー向けにグラフとして表現することもできます。

プロンプト管理ワークフロー

バージョン管理、ラベルによるデプロイ、ロールバック、プロンプトキャッシュ、プレイグラウンドでのテストを備え、アプリケーションコードとは別にプロンプトを管理します。プロンプト履歴と変更追跡により、プロンプトの進化を確認しやすくなります。

評価と人手レビュー

本番データまたは実験データに対して、LLM-as-a-judge、ヒューリスティック関数、または人手レビューを使って評価を実行します。データセット、実験、評価スコア、人手による注釈のサポートにより、時間経過に伴う変更を比較しやすくなります。

運用メトリクスとアラート

ダッシュボード、アラート、トレースに紐づくメトリクスを通じて、品質、コスト、レイテンシーを監視します。これにより、プロンプトやモデルの変更が本番の挙動に与える影響を把握しやすくなります。

オープンな統合とデプロイオプション

ネイティブSDK、OpenTelemetry、プロキシベースのロギング、API、エクスポート、100以上の統合を通じて接続できます。プラットフォームはセルフホスティングとデータの可搬性もサポートします。

利用シーン

“本番可観測性”

本番のLLMアプリケーションに計測を追加し、レイテンシー、コスト急増、予期しない出力のデバッグ時にトレース、セッション、ユーザー単位の挙動を確認します。

“プロンプトの反復”

プロンプトをバージョン管理された資産として扱い、ラベルでデプロイし、変更をロールバックし、更新前にプレイグラウンドでプロンプトのバリアントを比較します。

“評価ワークフロー”

データセットに対してオフラインまたはオンラインの評価を実行し、その後LLM-as-a-judge、ヒューリスティック、または人手レビューで実験を比較して品質の変化を評価します。

“Human-in-the-loopレビュー”

人手による注釈キューを作成し、トレースをレビューして、ゴールデンデータセットを構築したり、共同作業者とともにモデルの挙動を検証したりします。

“エンドツーエンドのLLM開発”

試作から本番システムまで同じプラットフォームを使い、計測、実験、反復を1つのワークフローにまとめます。

よくある質問

Langfuseはどのような課題を解決しますか?

Langfuseは、LLMとエージェントのワークフローをトレースし、プロンプトを管理し、出力を1つのシステムで評価したいチーム向けに作られています。トレース、プロンプト管理、評価、実験、人手による注釈をサポートします。

チームはどのようにLangfuseを統合しますか?

ソースでは、PythonとJavaScript向けのネイティブSDK、OpenTelemetry対応、100以上の統合、さらにLiteLLMのようなLLMゲートウェイを通じてトレースを収集するオプションが強調されています。製品は、単一のフレームワークを必須とせず、既存のスタックと連携するよう設計されています。

データ収集後にチームは何ができますか?

Langfuseでは、トレース、セッション、ユーザー追跡、プロンプトのバージョン管理、プロンプトのデプロイ、プレイグラウンドでのテスト、実験、評価スコア、データセット、人手レビューのワークフローを利用できます。ドキュメントでは、プロトタイプから本番環境までをつなぐ一貫したワークフローとして説明されています。

Langfuseはクラウドとセルフホストの両方のデプロイを提供しますか?

料金ページには、無料のHobbyプラン、有料のCloudプラン、セルフホストオプションが示されています。また、保持期間の延長、上限の拡大、SSO、SCIM、監査ログ、サポートオプションなどのエンタープライズ機能を備えたマネージドクラウドプランも記載されています。

Langfuseはどのようなチームに最適ですか?

この製品はLLMアプリケーションとエージェント向けに設計されています。ドキュメントでは、LLMおよび非LLM呼び出しのトレース、本番デバッグ、プロンプトの反復、品質、コスト、レイテンシーの監視が重視されています。

クイック情報

カテゴリ
AIエンジニアリングプラットフォーム
主な用途
LLMの可観測性、プロンプト管理、評価
デプロイ
クラウドまたはセルフホスト
ライセンス
コア製品機能はMIT
統合
100以上の統合とOpenTelemetryサポート
価格
無料のHobbyプランと有料のクラウドプラン、セルフホストオプション

Langfuse のトラフィック分析

トラフィックデータは参考情報としてご利用ください。

ドメイン評価
79

Langfuseの代替品

OpenController logo

OpenController

www.lyzr.ai

OpenController is Lyzr’s control plane for discovering, evaluating, governing, and monitoring AI agents, models, tools, data, and workflows across an enterprise AI estate. It is intended for teams managing agents across clouds, frameworks, runtimes, and environments.

Portkey logo

Portkey

portkey.ai

生成AIチーム向けの本番AIプラットフォーム。統合ゲートウェイ、可観測性、ガードレール、プロンプト管理を提供。

LangSmith logo

LangSmith

www.langchain.com

LangSmith is an observability and evaluation platform for AI agents and LLM applications. It helps development and production teams trace agent behavior, monitor quality and cost, investigate failures, and evaluate changes.

Galileo logo

Galileo

www.galileo.ai

Galileo is an AI observability and evaluation platform for testing, debugging, and governing LLM and agent systems across development and production. It helps teams turn evaluation results into production guardrails and monitor AI behavior at scale.

PromptLayer logo

PromptLayer

promptlayer.com

プロンプトとエージェントワークフローのバージョン管理・テスト・監視プラットフォーム

TensorZero logo

TensorZero

www.tensorzero.com

TensorZero is an open-source LLMOps platform for building and operating production-grade LLM applications. Its stated scope combines an LLM gateway with observability, evaluation, optimization, and experimentation tools.