LLM 和代理追踪
为 LLM 调用、工具调用、检索步骤和其他应用逻辑捕获层级化追踪。可按用户、会话、成本、延迟或自定义元数据筛选并检查追踪。
Langfuse 是一个开源 AI 工程平台,用于追踪、评估并改进 LLM 应用和代理。它将可观测性、提示管理、实验和人工标注整合到一个工作流中,让团队能够借助真实使用数据从原型走向生产。
该平台围绕兼容 OpenTelemetry 的追踪、原生 SDK 和广泛集成构建,使团队能够捕获 LLM 和非 LLM 活动,而不会被锁定在单一框架中。Langfuse 还支持云部署和自托管,其产品和核心功能采用 MIT 许可。
为 LLM 调用、工具调用、检索步骤和其他应用逻辑捕获层级化追踪。可按用户、会话、成本、延迟或自定义元数据筛选并检查追踪。
将多轮对话作为会话进行跟踪,并添加用户跟踪,以便进行生产调试和使用分析。代理还可以表示为图结构,以支持更复杂的工作流。
将提示与应用代码分离管理,支持版本控制、按标签部署、回滚、提示缓存和 playground 测试。提示历史和变更跟踪可帮助团队审查提示如何演进。
在生产数据或实验上使用 LLM-as-a-judge、启发式函数或人工审核运行评估。支持数据集、实验、评估分数和人工标注,有助于比较随时间变化的结果。
通过仪表板、告警和与追踪关联的指标监控质量、成本和延迟。这使得理解提示或模型变更对生产行为的影响更加容易。
通过原生 SDK、OpenTelemetry、基于代理的日志记录、API、导出以及 100 多个集成进行连接。该平台还支持自托管和数据可移植性。
为生产环境中的 LLM 应用添加埋点,以便在调试延迟、成本激增或意外输出时检查追踪、会话和用户级行为。
将提示作为带版本的资产进行管理,按标签部署,回滚更改,并在发布更新前在 playground 中比较提示变体。
在数据集上运行离线或在线评估,然后使用 LLM-as-a-judge、启发式方法或人工审核比较实验,以评估质量变化。
创建人工标注队列并审查追踪,以构建黄金数据集或与协作者一起验证模型行为。
在原型和生产系统中使用同一平台,将埋点、实验和迭代连接到一个工作流中。
Langfuse 面向希望在一个系统中追踪 LLM 和代理工作流、管理提示并评估输出的团队。它支持追踪、提示管理、评估、实验和人工标注。
源内容强调了适用于 Python 和 JavaScript 的原生 SDK、OpenTelemetry 支持、100 多个集成,以及通过像 LiteLLM 这样的 LLM 网关捕获追踪的选项。该产品旨在与现有技术栈协同工作,而不是要求使用单一框架。
Langfuse 支持追踪、会话、用户跟踪、提示版本管理、提示部署、playground 测试、实验、评估分数、数据集和人工审核工作流。文档将其描述为从原型到生产的连贯工作流。
定价页面显示有免费的 Hobby 方案、付费 Cloud 方案和自托管选项。它还列出了托管云方案,提供更长的数据保留时间、更高的限制,以及 SSO、SCIM、审计日志和支持选项等企业功能。
该产品面向 LLM 应用和代理。文档强调对 LLM 和非 LLM 调用的追踪、生产调试、提示迭代,以及质量、成本和延迟监控。
流量数据仅供参考。
www.lyzr.ai
OpenController is Lyzr’s control plane for discovering, evaluating, governing, and monitoring AI agents, models, tools, data, and workflows across an enterprise AI estate. It is intended for teams managing agents across clouds, frameworks, runtimes, and environments.
portkey.ai
面向生成式 AI 团队的生产级 AI 平台,提供统一网关、可观测性、防护机制和提示词管理。
www.langchain.com
LangSmith is an observability and evaluation platform for AI agents and LLM applications. It helps development and production teams trace agent behavior, monitor quality and cost, investigate failures, and evaluate changes.
www.galileo.ai
Galileo is an AI observability and evaluation platform for testing, debugging, and governing LLM and agent systems across development and production. It helps teams turn evaluation results into production guardrails and monitor AI behavior at scale.
promptlayer.com
用于提示词和智能体工作流版本管理、测试与监控的平台
www.tensorzero.com
TensorZero is an open-source LLMOps platform for building and operating production-grade LLM applications. Its stated scope combines an LLM gateway with observability, evaluation, optimization, and experimentation tools.