无服务器推理
通过无服务器 API 提供顶级开源模型服务,无需管理基础设施或部署开销。Wafer 将其定位为一种按量付费、可快速访问开源模型的方式。
Wafer 是一个面向企业的 LLM 平台,专注于通过两种路径提供开源模型服务:用于即时 API 访问的无服务器推理,以及用于需要隔离和自定义调优的工作负载的专属端点。首页将其描述为“面向企业最快的开源 LLM”,并将其定位为无需管理自有基础设施即可运行开源模型的方式。
公开网站强调速度、可预测的服务能力以及与现有 AI 工具链的兼容性。Wafer 表示,其 Serverless 端点遵循 OpenAI Chat Completions schema,支持流式输出、工具调用和 JSON 模式,并且只需更换 base URL 和 API key 即可与现有客户端一起使用。对于要求更高或更敏感的部署,Wafer 提供专属推理端点,支持按工作负载优化、SLA 保障的正常运行时间,以及可用于合规场景的零数据保留。
通过无服务器 API 提供顶级开源模型服务,无需管理基础设施或部署开销。Wafer 将其定位为一种按量付费、可快速访问开源模型的方式。
为需要隔离、可预测正常运行时间以及针对特定硬件配置优化性能的自定义模型和关键任务工作负载使用专属端点。
Wafer 表示其无服务器 API 遵循 OpenAI Chat Completions schema,因此现有的 OpenAI SDK、LangChain、LiteLLM、Claude Code 和 Cline 风格客户端只需更改 base URL 和 API key 即可连接。
该平台在 Serverless 模型上支持流式输出、工具调用和 JSON 模式,因此适用于 Agent 工作流和结构化输出。
首页上的模型卡显示了单独的输入、输出和缓存费率,Wafer 解释说重复的提示前缀会自动按缓存费率计费。
Wafer 发布基准结果,并表示会在每个加速器系列上对模型进行剖析,将专家分片以适配缓存层级,并根据模型的 KV cache 占用调优连续批处理。
希望快速添加开源模型推理的团队可以使用 Wafer 的 Serverless 端点,而无需自行运营服务栈。网站将其描述为一种按量付费、没有基础设施或部署开销的选择。
对于语音 Agent 或其他实时交互类产品,当延迟和稳定的 TTFT 比原始吞吐量更重要时,可以使用专属端点。Neon Health 案例研究展示了它在对话式医疗工作流中的适配性。
处理 PHI 或其他敏感数据的组织可以使用带有流量隔离和零数据保留选项的专属端点。Neon 案例研究还提到该部署支持 BAA 和仅限美国的数据驻留。
已经使用 OpenAI 风格工具链的团队可以通过极少的客户端改动连接 Wafer。网站明确提到了与 OpenAI SDK、LangChain、LiteLLM、Claude Code 以及类似 Cline 的 Agent 的兼容性。
运行代码、推理或混合 Agent 工作负载的开发者可以在当前的 Serverless 模型中进行选择,并对重复的提示前缀使用缓存感知计费。
Wafer 的 Serverless 端点遵循 OpenAI Chat Completions schema,因此现有客户端只需更换 base URL 和 API key 即可连接。网站表示在所有 Serverless 模型上都支持流式输出、工具调用和 JSON 模式。
Wafer 表示,专属端点会将流量与共享推理池隔离,并且可为受合规约束的工作负载配置零数据保留。网站还声明 Wafer 签署 DPA,并提供 SLA 保障的正常运行时间。
首页说明 Wafer 的 Serverless 产品提供按量付费的开源模型推理,而专属端点用于自定义模型服务和敏感工作负载。定价页面当前返回 404,因此公开网站并未在该处展示当前的套餐表。
网站当前在 Serverless 中列出了 GLM-5.1、Kimi-K2.6 和 Qwen 3.5 397B-A17B,并表示还有更多模型正在上线中。首页上的模型卡还在输入和输出费率之外展示了缓存定价。
是的。Wafer 针对 Neon Health 的专属端点案例研究表明,该团队将 GLM-5.1 迁移到 Wafer 的专属端点,并使用基于 TTFT 的 SLA 来支持语音 Agent 的延迟要求。