無伺服器推論
透過無伺服器 API 服務頂尖開放模型,無需管理基礎設施或部署額外負擔。Wafer 將其定位為可快速存取開放模型的按量付費路徑。
Wafer 是企業級 LLM 平台,提供無伺服器與專屬端點的開放模型推論,支援 OpenAI 相容工作負載、低延遲服務、快取感知計費與敏感或高效能場景的專屬端點。
Wafer 是一個企業級 LLM 平台,聚焦於透過兩種路徑提供開放模型服務:無伺服器推論可立即存取 API,而專屬端點則適用於需要隔離與自訂調校的工作負載。首頁將其描述為「適用於企業的最快開放原始碼 LLM」,並將其定位為一種可在不自行管理基礎設施的情況下執行開放模型的方式。
公開網站強調速度、可預測的服務表現,以及與既有 AI 工具的相容性。Wafer 表示其 Serverless 端點遵循 OpenAI Chat Completions 架構,支援串流、工具使用與 JSON 模式,並可透過更換 base URL 與 API key 來配合既有客戶端使用。對於更高需求或更敏感的部署,Wafer 提供具備工作負載特定最佳化、由 SLA 支援的正常運作時間,以及可用於受合規要求約束場景的零資料保留的專屬推論端點。
透過無伺服器 API 服務頂尖開放模型,無需管理基礎設施或部署額外負擔。Wafer 將其定位為可快速存取開放模型的按量付費路徑。
為自訂模型與任務關鍵型工作負載使用專屬端點,這些工作負載需要隔離、可預測的正常運作時間,以及針對特定硬體配置調校的效能。
Wafer 表示其無伺服器 API 遵循 OpenAI Chat Completions 架構,讓既有的 OpenAI SDK、LangChain、LiteLLM、Claude Code 與 Cline 風格客戶端只需更改 base URL 與 API key 即可連接。
此平台在 Serverless 模型上支援串流、工具使用與 JSON 模式,因此適合代理工作流程與結構化輸出。
首頁上的模型卡會公開 input、output 與 cache 的 পৃথ rates,Wafer 也說明重複的提示前綴會自動以 cache 費率計費。
Wafer 公布基準測試結果,並表示會在每個加速器家族上為模型進行剖析、將專家分片以符合快取階層,並針對模型的 KV-cache 佔用調校持續批次處理。
想要快速加入開放模型推論的團隊,可以使用 Wafer 的無伺服器端點,而不必自行營運服務堆疊。網站將其描述為一種按量付費方案,沒有基礎設施或部署額外負擔。
具備語音代理或其他即時互動的產品,可在延遲與穩定 TTFT 比原始吞吐量更重要時使用專屬端點。Neon Health 的案例研究顯示,這適合用於對話式醫療工作流程。
處理 PHI 或其他敏感資料的組織,可使用具流量隔離與零資料保留選項的專屬端點。Neon 案例研究也提到此部署支援 BAA 與僅限美國的資料駐留。
已使用 OpenAI 風格工具鏈的團隊,可透過最少的客戶端修改將 Wafer 接上。網站明確提到與 OpenAI SDK、LangChain、LiteLLM、Claude Code 及類似 Cline 的代理相容。
執行程式設計、推理或混合型代理工作負載的開發者,可從目前的 Serverless 模型中選擇,並針對重複提示前綴使用快取感知計費。
Wafer 的 Serverless 端點遵循 OpenAI Chat Completions 架構,因此既有客戶端只需更換 base URL 與 API key 即可連接。網站表示在所有 Serverless 模型上都支援串流、工具使用與 JSON 模式。
Wafer 表示專屬端點可將流量與共享推論池隔離,並可為受合規要求約束的工作負載配置零資料保留。網站也指出 Wafer 會簽署 DPA,並提供由 SLA 支援的正常運作時間。
首頁表示 Wafer 的 Serverless 服務提供按量付費的開放模型推論,而專屬端點則用於自訂模型服務與敏感工作負載。定價頁面目前回傳 404,因此公開網站在該處未顯示現行方案表。
網站目前在 Serverless 上列出 GLM-5.1、Kimi-K2.6 與 Qwen 3.5 397B-A17B,並表示更多模型正在陸續推出。首頁上的模型卡也會在 input 與 output 費率之外顯示 cache 定價。
是。Wafer 為 Neon Health 的專屬端點案例研究指出,團隊將 GLM-5.1 移至 Wafer 的專屬端點,並使用以 TTFT 為基礎的 SLA 來支援語音代理的延遲需求。