追踪生产运行
将每次生产运行集中捕获在一个地方,包括消息、工具调用、重试和错误,让团队可以查看实际发生了什么,而不是只凭日志猜测。
Raindrop 是面向团队的 AI agent 监控与可观测性平台,可查看生产运行、发现故障并验证修复效果。集成 trace、信号、基于 Slack 的分流和实验,帮助开发者调试并验证 agent 行为。
Raindrop 是一个 AI agent 监控与可观测性平台,旨在帮助团队检查生产行为、发现故障,并验证修复是否真的解决了根本问题。它将 trace 捕获、信号跟踪、分流、告警和实验整合到一个围绕真实 agent 事件的工作流中。
该产品围绕调查与闭环处理设计:追踪一次运行、识别模式、向 Triage 请求根因分析、通知相应的 Slack 频道,然后在真实流量上运行实验以确认回归问题已消失。文档还展示了对 coding agent 的 MCP 支持,因此同样的问题上下文也可以被带入开发工作流。
将每次生产运行集中捕获在一个地方,包括消息、工具调用、重试和错误,让团队可以查看实际发生了什么,而不是只凭日志猜测。
从 trace 中检测问题并将真实故障推送到 Slack,包括幻觉、循环和损坏的工具,让静默问题迅速变得可见。
通过默认、自定义、分类器、关键词/正则和仪器化信号,为 agent 性能定义真实基准信号,然后在未来事件中跟踪这些信号并回填近期历史。
使用 Triage 结合语义和正则搜索、信号计数、trace 检查、图表和实验来调查问题,然后获得基于真实对话的回复。
通过组合模型、属性、工具、信号和日期范围,在真实流量上运行实验,以比较行为并检查某项变更是否修复了问题。
设置定时调查、每日摘要和基于自定义阈值的告警,让团队无需手动查看应用也能监控重复模式。
监控生产环境中的 agent,发现诸如幻觉、循环、损坏的工具或任务失败等静默故障,然后检查 trace 以准确查看运行在哪一步偏离。
让支持或工程团队在 Slack 中向 Raindrop 提问,将调查留在线程中,并利用返回的示例理解根因和用户影响。
从观察到的模式创建信号,用示例对其进行优化,并随时间跟踪事件,以便衡量重复出现的行为,而不是临时处理。
在真实流量上对模型、工具、提示词或通过功能开关控制的行为进行 A/B 测试,然后在进一步推广前验证回归问题是否消失。
使用 MCP 工作流将真实生产问题带入 coding agent,检查失败示例,进行有针对性的修复,并在打开 PR 前运行测试。
Raindrop 用于监控 AI agent 行为、发现故障,并帮助团队通过 trace、信号、Slack 和 Web 应用来调查问题。其文档还描述了面向 coding agent 的 MCP 工作流。
文档显示 Slack 是主要使用场景之一:你可以在频道中 @ 提及 Raindrop,在线程中继续调查,并在其中接收主动告警、每日摘要和定时的 Agent Briefs。
Raindrop 的 Triage Agent 可在三个地方使用:Slack、Web 应用,以及作为面向 Claude Code、Cursor 和 Codex 等 coding agent 的 MCP 集成。
根据所提供证据,定价页面返回了 404,因此没有可用的定价详情。来源只能确认产品网站和文档,而未公布套餐结构。
Raindrop 将实验文档化为一种使用模型、属性、工具、信号和日期范围组合对 agent 进行 A/B 测试的方法,然后确认修复是否真的生效。