自托管 agent 推理
SIE 从你云中的单个集群提供模型服务,因此 agent 工作流可以调用推理、解析、reranking、提取和 guardrails,而无需将提示词或文档发送到第三方主机。
Superlinked SIE 是面向 agent 应用的开源推理层,支持在自有云中运行模型。帮助团队保留提示词和文档在内网,并通过一个集群提供 embeddings、reranking、提取、OCR 等 agent 工作流。
Superlinked 的 SIE 是面向 agent 应用的开源推理层。它旨在从你自有云中的集群运行你的 agent 调用的模型,而不是将这些请求路由到独立的外部 API。
该产品端到端聚焦开源模型,支持 embeddings、reranking、OCR、extraction、guardrails 和 agent 循环执行。网站将其定位为希望将提示词和文档保留在自有基础设施内、同时通过一次部署服务多种模型任务的团队。
SIE 从你云中的单个集群提供模型服务,因此 agent 工作流可以调用推理、解析、reranking、提取和 guardrails,而无需将提示词或文档发送到第三方主机。
部署文档说明了两种部署模式:一个简单的 Docker 服务器,以及一个面向生产扩展的 Kubernetes 集群,包含 gateway、config service、NATS JetStream 和 GPU worker pods。
集成文档支持框架适配器、原生 SDK 和 OpenAI 兼容端点,因此团队可以连接现有的 RAG 代码或逐步迁移。
文档展示了 dense、sparse 和 multivector embeddings 的输出类型,以及用于实体、关系、分类和对象检测的 reranking 与 extraction。
部署指南列出了首个请求时加载模型、持久化缓存、指定模型启动,以及带镜像快照的 air-gapped 安装,适用于离线环境。
使用 SIE 为检索流水线提供支持,这类流水线需要 dense、sparse 或 multivector embeddings,以及 reranking,并可接入现有的 LangChain、LlamaIndex、Haystack、Qdrant、Weaviate、Chroma、LanceDB、DSPy 或 CrewAI 技术栈。
当你需要带结构化输出、extraction 以及对批处理、时序和模型选择进行细粒度控制的自定义 agent 流水线时,可使用原生 SDK。
当你的 agent 需要先处理 PDF、扫描件、Office 文件或其他文档,再将结构化数据交给下游步骤时,可使用 OCR、document-to-markdown、extraction 和 guardrail 功能。
本地开发或低流量服务可使用 Docker 路径;当你需要自动扩缩、高可用性或在云 GPU 节点池上 scale-to-zero 时,可迁移到 Kubernetes。
SIE 可以作为单个 Docker 服务器运行,也可以作为 Kubernetes 集群运行。部署指南说明,Docker 是单台服务器或低流量服务的最简单路径,而 Kubernetes 适用于横向扩展、自动扩缩到零和高可用性。
集成指南展示了三种路径:用于常见 RAG 技术栈的框架适配器、用于完整功能访问的原生 SDK,以及适用于已调用 OpenAI embeddings 端点的现有代码的 OpenAI 兼容性。
可以。部署文档说明,SIE 可以在 CPU 上运行,用于开发和低流量工作负载;不过,生产环境下的大规模推理强烈建议使用 GPU,尤其是在批量编码时。
首页和文档表明,SIE 支持 AWS、GCP、Azure 和 air-gapped 环境。部署指南还描述了在 AWS EKS、GCP GKE 和 Azure AKS 上的 Kubernetes 集群设置。
在所提供的 URL 上,定价页面不可用并返回 404,因此来源未确认当前方案或定价结构。