生产环境 trace 可观测性
查看每次 AI 调用的 prompts、responses、tool calls、latency、cost 和请求元数据。界面专为检查生产行为和从真实 traces 中发现问题而设计。
Braintrust 是一款 AI 可观测平台,用于追踪生产环境中的 AI 行为、运行评测并在问题影响用户前发现回归。适合构建和运维 AI 产品的团队,支持 traces、数据集、评分与工作流工具。
Braintrust 是一款面向希望追踪生产行为、评估模型质量并在问题到达用户之前发现回归的团队的 AI 可观测平台。该网站将其定位为一个用于理解生产环境中实际发生情况的系统,而不仅仅依赖离线测试。
该产品结合了 trace 检查、evals、自动化和工作流工具。团队可以为应用添加埋点,检查 prompts 和 tool calls,对比 models 和 prompts,从真实故障中构建数据集,并使用 Topics 等生产信号随着时间推移指导改进。
查看每次 AI 调用的 prompts、responses、tool calls、latency、cost 和请求元数据。界面专为检查生产行为和从真实 traces 中发现问题而设计。
针对数据集运行实验,并使用 LLM、代码或人工对输出进行评分。产品将 evals 定位为在发布前定义质量并并排比较 prompts 或 models 的方式。
使用 Topics 从真实流量中发现重复出现的模式,然后将这些模式转化为 evaluations 或 alerts。定价页和首页文案都将 Topics 描述为一种在生产日志中对特定领域问题进行分类和发现的方式。
将生产 traces 转换为用于回归测试的数据集,并创建人工审核工作流,而无需构建自定义前端代码。网站还重点介绍了数据集、playgrounds 和自定义标注界面。
使用 CLI、SDK 和 MCP server 来为应用添加埋点、查询日志、运行 evals,并从开发工具更新 prompts。文档强调了面向 coding-agent 工作流的可重复设置和脚本化操作。
随着团队规模增长,可自定义 trace 视图、图表、环境和访问控制。定价页在更高层级中列出了已保存的表格视图、自定义列、自定义图表、环境、RBAC、SSO、MFA 和数据保留控制。
为 AI 应用添加埋点,使每次调用都会将 traces 写入 Braintrust,然后在 Logs 视图中查看 prompts、outputs、tool calls、token 数、延迟和成本。
基于真实数据集构建 evals,并在发布变更前并排比较 prompts 和 models,使用 LLM、代码或人工审核者对输出进行评分。
使用 Topics 从生产日志中发现重复出现的模式,然后在出现新的回归时将这些模式转化为 evals、质量门禁或 alerts。
基于实际 traces 创建数据集和自定义审核流程,使团队能够针对边缘案例进行测试,并在与任务匹配的工作流中审核输出。
使用 CLI、SDK 或 MCP server 从工程工具和 agent 工作流中查询日志、运行 evals 并管理 prompts。
Braintrust 的设置方式是先安装 CLI,接着为应用添加埋点,然后在 Braintrust 界面中查看 traces。快速开始会展示一个安装 `bt` 并指导完成埋点的脚本,文档也说明可以通过 `bt` CLI 进行可重复的工作,例如运行 evals、查询日志和同步数据。
追踪快速开始说明,一旦应用完成埋点,每次 AI 调用都会记录 traces。在界面中,你可以查看完整的输入提示词和模型输出、token 数、延迟、成本、模型配置以及请求/响应元数据。
文档将 Braintrust 描述为一个用于捕获 traces、分析日志、添加人工反馈、构建数据集、通过实验测试更改,并在监控生产环境的同时发布的 platform。工作流围绕捕获 traces、发现模式、添加反馈、测试更改以及随后监控生产环境展开。
文档和定价页表明,它通过原生 SDK 支持 Python、TypeScript、Go、Ruby、C# 等语言,并与 AI 提供商、框架和开发者工具集成。集成页面还指出,它可通过 MCP 和 CLI 以不依赖框架的方式使用,并支持开发者工具工作流。
Braintrust 提供免费的 Starter 计划、付费的 Pro 计划以及定制的 Enterprise 定价。定价页还显示,基于使用量的费用与已处理的数据和分数相关,同时高阶套餐包含自定义图表、RBAC 以及更长的数据保留期等功能。