来自可观测性工具的 trace 摄取
可连接到 Langfuse、Braintrust、Datadog 或自定义 trace 来源,并按夜间节奏自动摄取对话数据。
Basalt 帮助团队基于真实用户交互优化 AI agent:分析 traces、识别失败模式,并生成经过验证的 PR。适合已使用可观测性数据监控 agent 行为的团队。
Basalt 是一款用于基于真实用户交互改进 AI agent 的产品。它连接到可观测性或 trace 来源,读取前一天的对话,并识别重复出现的失败模式,从而指出 agent 行为需要调整的地方。
当它发现问题时,Basalt 会生成一个有针对性的 pull request,用于修改提示词、工具定义或系统指令。在 PR 打开之前,建议的修复会先与黄金数据集进行验证,以检查现有行为是否出现回归。
可连接到 Langfuse、Braintrust、Datadog 或自定义 trace 来源,并按夜间节奏自动摄取对话数据。
使用 Claude 对对话进行聚类、检测失败模式,并识别哪些交互指向质量缺口。
基于检测到的问题生成聚焦的 PR,可更新提示词、工具定义或系统指令。
在打开 PR 之前,将每个生成的修复方案与黄金数据集运行比对,阻止引入回归的变更。
将产品定位为一个自动化审查循环,不依赖 LLM-as-a-judge 或人工标注。
根据前一天的用户行为,每天早晨发送一个高质量 PR,让工作流始终围绕最近的交互。
已经在可观测性工具中记录 traces 的团队可以连接这些来源,让 Basalt 通宵扫描对话中的重复错误。
当同样的误解或工具使用错误不断出现时,Basalt 可以生成一个聚焦的 PR,针对受影响的行为模式进行修复。
维护用于预期行为的黄金数据集的团队,可以使用 Basalt 的验证步骤检查 proposed fix 是否不会让已知良好案例回退。
希望在不手工编写每一处变更的情况下更新提示词或工具的组织,可以使用 Basalt 基于真实用户行为提出修改建议。
希望采用轻量级改进循环的团队,可以审查每天一个 PR,而不是手动筛选每一次交互。
Basalt 从已连接的可观测性来源摄取对话,夜间分析这些对话,并将重复出现的失败模式转化为有针对性的 PR。主页说明它可以生成提示词更新、工具定义变更或系统指令变更,并在打开 PR 之前先使用黄金数据集验证修复。
主页明确提到 Langfuse、Braintrust、Datadog 以及自定义 trace 源作为连接选项。它将 Basalt 定位为处理来自这些来源的 traces,而不是要求手动标注。
Basalt 的定位是基于真实用户对话改进 agent 行为。页面突出显示了系统提示词、工具定义和 few-shot 示例作为它在发现失败模式时可以修改的部分。
主页说明 Basalt 会在打开 PR 之前将修复方案与黄金数据集进行对比测试,并在出现回归时阻止 PR。它还表示主工作流中不使用 LLM 作为评判器,也不需要人工标注。
定价部分说明,你只需在合并 PR 时付费,前 3 个 PR 免费,且没有订阅或承诺。它还注明价格按每个仓库的已合并 PR 计费,并且对于每月合并 20+ 个 PR 的团队提供批量折扣。