来自可观测性工具的 trace 摄取
可连接到 Langfuse、Braintrust、Datadog 或自定义 trace 来源,并按夜间节奏自动摄取对话数据。
Basalt 是一款用于基于真实用户交互改进 AI agent 的产品。它连接到可观测性或 trace 来源,读取前一天的对话,并识别重复出现的失败模式,从而指出 agent 行为需要调整的地方。
当它发现问题时,Basalt 会生成一个有针对性的 pull request,用于修改提示词、工具定义或系统指令。在 PR 打开之前,建议的修复会先与黄金数据集进行验证,以检查现有行为是否出现回归。
可连接到 Langfuse、Braintrust、Datadog 或自定义 trace 来源,并按夜间节奏自动摄取对话数据。
使用 Claude 对对话进行聚类、检测失败模式,并识别哪些交互指向质量缺口。
基于检测到的问题生成聚焦的 PR,可更新提示词、工具定义或系统指令。
在打开 PR 之前,将每个生成的修复方案与黄金数据集运行比对,阻止引入回归的变更。
将产品定位为一个自动化审查循环,不依赖 LLM-as-a-judge 或人工标注。
根据前一天的用户行为,每天早晨发送一个高质量 PR,让工作流始终围绕最近的交互。
已经在可观测性工具中记录 traces 的团队可以连接这些来源,让 Basalt 通宵扫描对话中的重复错误。
当同样的误解或工具使用错误不断出现时,Basalt 可以生成一个聚焦的 PR,针对受影响的行为模式进行修复。
维护用于预期行为的黄金数据集的团队,可以使用 Basalt 的验证步骤检查 proposed fix 是否不会让已知良好案例回退。
希望在不手工编写每一处变更的情况下更新提示词或工具的组织,可以使用 Basalt 基于真实用户行为提出修改建议。
希望采用轻量级改进循环的团队,可以审查每天一个 PR,而不是手动筛选每一次交互。
Basalt 从已连接的可观测性来源摄取对话,夜间分析这些对话,并将重复出现的失败模式转化为有针对性的 PR。主页说明它可以生成提示词更新、工具定义变更或系统指令变更,并在打开 PR 之前先使用黄金数据集验证修复。
主页明确提到 Langfuse、Braintrust、Datadog 以及自定义 trace 源作为连接选项。它将 Basalt 定位为处理来自这些来源的 traces,而不是要求手动标注。
Basalt 的定位是基于真实用户对话改进 agent 行为。页面突出显示了系统提示词、工具定义和 few-shot 示例作为它在发现失败模式时可以修改的部分。
主页说明 Basalt 会在打开 PR 之前将修复方案与黄金数据集进行对比测试,并在出现回归时阻止 PR。它还表示主工作流中不使用 LLM 作为评判器,也不需要人工标注。
定价部分说明,你只需在合并 PR 时付费,前 3 个 PR 免费,且没有订阅或承诺。它还注明价格按每个仓库的已合并 PR 计费,并且对于每月合并 20+ 个 PR 的团队提供批量折扣。
blop 是一款 QA agent,可在仓库中将浏览器测试以代码形式编写并运行于 CI,聚合重复失败,还可发起 PR 修复失效测试,适合需要可审查、版本控制浏览器 QA 的团队。
Orca 是面向编码代理的 Agent 开发环境,支持在隔离的 git worktree 中并行运行多个 CLI agent,并提供桌面端与移动端协作流程。
Firebase Studio 是一款基于浏览器的全栈应用开发工作区,支持 Gemini 辅助编写代码、应用预览、云模拟器、导入仓库、原型开发、协作与从浏览器部署。
AI Magicx 是一体化 AI 工作区,集聊天、图片、视频、语音、音乐、邮件和开发任务于一处,帮助创作者、团队和开发者集中使用多种模型,无需在多个工具和订阅间切换。
Paper 是一款设计工具,连接画布、代码和 AI agent,让团队在一个工作流中完成创建、协作与交付。支持桌面应用、基于 MCP 的 agent 访问,以及真实内容和设计 token 工作流。
RLAMA 是一款本地 AI 平台,适用于在 macOS、Linux 和 Windows 上构建 RAG 系统与智能体。支持本地处理、交互式终端工作流和用于文档问答及多智能体自动化的 HTTP API。