來自 observability 工具的 trace 匯入
可連接 Langfuse、Braintrust、Datadog 或 custom trace source,並以每晚排程自動匯入對話資料。
Basalt 協助團隊透過分析 trace、找出失敗模式並產生已驗證的 pull request,從真實使用者互動持續優化 AI agents。適合已使用 observability 數據監控 agent 行為的團隊。
Basalt 是一款用於根據真實使用者互動改善 AI agents 的產品。它會連接到 observability 或 trace 來源,讀取前一天的對話,並找出反覆出現、指出 agent 行為需要調整的失敗模式。
當它發現問題時,Basalt 會產生一個有針對性的 pull request,可用來變更 prompt、tool definition 或 system instruction。在 PR 開啟之前,建議的修正會先用 golden dataset 驗證,以檢查既有行為是否出現 regressions。
可連接 Langfuse、Braintrust、Datadog 或 custom trace source,並以每晚排程自動匯入對話資料。
使用 Claude 將對話分群、偵測失敗模式,並找出哪些互動反映品質缺口。
根據偵測到的問題產生聚焦的 PR,可更新 prompt、tool definition 或 system instruction。
在 PR 開啟前,先用 golden dataset 對每個生成的修正進行驗證,以阻擋會引入 regressions 的變更。
將產品定位為自動化審查迴圈,不依賴 LLM-as-a-judge 或人工標註。
根據前一天的使用者行為,每天早上送出一個高品質 PR,讓流程維持與近期互動一致。
已在 observability 工具中記錄 traces 的團隊,可以連接這些來源,讓 Basalt 在夜間掃描對話中的重複錯誤。
當同一種誤解或工具使用錯誤持續出現時,Basalt 可以產生一個聚焦的 PR,針對受影響的行為模式。
維護 golden datasets 以對應預期行為的團隊,可以利用 Basalt 的驗證步驟,確認建議修正不會讓已知良好案例退化。
希望在不手動撰寫每個變更的情況下更新 prompt 或 tool 的組織,可以使用 Basalt 根據真實使用者行為提出修改建議。
想要輕量化改進循環的團隊,可以每天檢視一個 PR,而不是手動整理每一次互動。
Basalt 會從已連結的 observability 來源擷取對話、在夜間分析,並將重複出現的失敗模式轉換為具體的 PR。首頁說明它可以產生 prompt 更新、tool definition 變更或 system instruction 變更,然後在開啟 PR 前先用 golden dataset 驗證修正內容。
首頁明確列出 Langfuse、Braintrust、Datadog,以及 custom trace source 作為可連接選項。Basalt 的設計是使用這些來源的 traces,而不是依賴人工標註。
Basalt 的定位是根據真實使用者對話來改善 agent 行為。頁面強調它可以在找到失敗模式時變更 system prompts、tool definitions 和 few-shot examples。
首頁說明 Basalt 會在 PR 開啟前先將修正內容與 golden dataset 比對,若出現 regressions 就會阻擋 PR。它也表示主要工作流程不使用 LLM-as-a-judge,也不依賴人工標註。
定價區塊說明,你只會在合併 PR 時付費,前 3 個 PR 免費,且沒有訂閱或承諾。它也註明價格是以每個 repository 的每個合併 PR 計算,對於每月合併 20+ 個 PR 的團隊提供量大折扣。