自我託管的 agent 推理
SIE 可從您雲端中的單一叢集提供模型服務,讓 agent 工作流程可以呼叫推理、解析、reranking、抽取與 guardrails,而無需將 prompts 或文件傳送到第三方主機。
Superlinked SIE 是一款開源推理層,適用於 agent 應用,可在自有雲端執行模型,協助團隊將 prompts 與文件留在內部,同時以單一叢集提供 embeddings、reranking、抽取、OCR 等工作流程。
Superlinked 的 SIE 是一款適用於 agent 應用的開源推理層。它的設計是從您自有雲端中的叢集執行 agent 呼叫的模型,而不是將這些請求路由到獨立的外部 API。
此產品以端到端的開放模型為重點,支援 embeddings、reranking、OCR、抽取、guardrails 與 agent loop 執行。網站將其定位為適合希望將 prompts 與文件保留在自家基礎架構內,同時以單一部署服務多種模型任務的團隊。
SIE 可從您雲端中的單一叢集提供模型服務,讓 agent 工作流程可以呼叫推理、解析、reranking、抽取與 guardrails,而無需將 prompts 或文件傳送到第三方主機。
部署文件同時說明了簡單的 Docker 伺服器與適用於正式環境擴展的 Kubernetes 叢集,包含 gateway、config service、NATS JetStream 與 GPU worker pods。
整合文件支援框架適配器、原生 SDK 與 OpenAI 相容端點,因此團隊可以連接既有的 RAG 程式碼,或逐步遷移。
文件展示了 dense、sparse 與 multivector embeddings 的輸出類型,另外還有用於 entities、relations、classifications 與 object detection 的 reranking 和抽取。
部署指南列出首次請求時載入模型、持久化快取、指定模型啟動,以及帶有鏡像快照的 air-gapped 安裝,以供離線環境使用。
使用 SIE 為需要 dense、sparse 或 multivector embeddings,以及 reranking 的檢索流程提供支援,並整合到既有的 LangChain、LlamaIndex、Haystack、Qdrant、Weaviate、Chroma、LanceDB、DSPy 或 CrewAI 堆疊中。
當您想要建立具有結構化輸出、抽取,以及對批次處理、時間與模型選擇有細緻控制的自訂 agent 流程時,可使用原生 SDK。
當您的 agent 需要先處理 PDF、掃描檔、Office 檔案或其他文件,再將結構化資料交給後續步驟時,可使用 OCR、document-to-markdown、抽取與 guardrail 能力。
本機開發或低流量服務可使用 Docker 路徑;當您需要自動擴縮、高可用性或在雲端 GPU 節點池上 scale-to-zero 時,則可移轉到 Kubernetes。
SIE 可作為單一 Docker 伺服器或 Kubernetes 叢集執行。部署指南指出,Docker 是單一伺服器或低流量服務的最簡單路徑,而 Kubernetes 則適用於水平擴展、自動擴縮至零以及高可用性。
整合指南展示了三種路徑:常見 RAG 堆疊的框架適配器、可完整使用所有功能的原生 SDK,以及對已經呼叫 OpenAI embeddings 端點的既有程式碼可用的 OpenAI 相容性。
可以。部署文件說明 SIE 可在 CPU 上執行,用於開發與低流量工作負載;但對於大規模的正式推理,特別是批次編碼,強烈建議使用 GPU。
首頁與文件顯示 SIE 支援 AWS、GCP、Azure 與 air-gapped 環境。部署指南也描述了在 AWS EKS、GCP GKE 和 Azure AKS 上的 Kubernetes 叢集設定。
在提供的 URL 上無法存取定價頁面,且會回傳 404,因此來源無法確認目前的方案或定價結構。