Wafer logo

Wafer

認領

Wafer 是企業級 LLM 平台,提供無伺服器與專屬端點的開放模型推論,支援 OpenAI 相容工作負載、低延遲服務、快取感知計費與敏感或高效能場景的專屬端點。

Wafer preview

概覽

Wafer 是一個企業級 LLM 平台,聚焦於透過兩種路徑提供開放模型服務:無伺服器推論可立即存取 API,而專屬端點則適用於需要隔離與自訂調校的工作負載。首頁將其描述為「適用於企業的最快開放原始碼 LLM」,並將其定位為一種可在不自行管理基礎設施的情況下執行開放模型的方式。

公開網站強調速度、可預測的服務表現,以及與既有 AI 工具的相容性。Wafer 表示其 Serverless 端點遵循 OpenAI Chat Completions 架構,支援串流、工具使用與 JSON 模式,並可透過更換 base URL 與 API key 來配合既有客戶端使用。對於更高需求或更敏感的部署,Wafer 提供具備工作負載特定最佳化、由 SLA 支援的正常運作時間,以及可用於受合規要求約束場景的零資料保留的專屬推論端點。

核心能力

無伺服器推論

透過無伺服器 API 服務頂尖開放模型,無需管理基礎設施或部署額外負擔。Wafer 將其定位為可快速存取開放模型的按量付費路徑。

專屬推論端點

為自訂模型與任務關鍵型工作負載使用專屬端點,這些工作負載需要隔離、可預測的正常運作時間,以及針對特定硬體配置調校的效能。

OpenAI 相容 API

Wafer 表示其無伺服器 API 遵循 OpenAI Chat Completions 架構,讓既有的 OpenAI SDK、LangChain、LiteLLM、Claude Code 與 Cline 風格客戶端只需更改 base URL 與 API key 即可連接。

適合代理流程的回應模式

此平台在 Serverless 模型上支援串流、工具使用與 JSON 模式,因此適合代理工作流程與結構化輸出。

快取感知計費

首頁上的模型卡會公開 input、output 與 cache 的 পৃথ rates,Wafer 也說明重複的提示前綴會自動以 cache 費率計費。

針對工作負載的最佳化

Wafer 公布基準測試結果,並表示會在每個加速器家族上為模型進行剖析、將專家分片以符合快取階層,並針對模型的 KV-cache 佔用調校持續批次處理。

實際使用案例

  • 產品團隊的快速整合

    想要快速加入開放模型推論的團隊,可以使用 Wafer 的無伺服器端點,而不必自行營運服務堆疊。網站將其描述為一種按量付費方案,沒有基礎設施或部署額外負擔。

  • 低延遲對話系統

    具備語音代理或其他即時互動的產品,可在延遲與穩定 TTFT 比原始吞吐量更重要時使用專屬端點。Neon Health 的案例研究顯示,這適合用於對話式醫療工作流程。

  • 受合規要求約束的企業工作負載

    處理 PHI 或其他敏感資料的組織,可使用具流量隔離與零資料保留選項的專屬端點。Neon 案例研究也提到此部署支援 BAA 與僅限美國的資料駐留。

  • OpenAI 相容的代理堆疊

    已使用 OpenAI 風格工具鏈的團隊,可透過最少的客戶端修改將 Wafer 接上。網站明確提到與 OpenAI SDK、LangChain、LiteLLM、Claude Code 及類似 Cline 的代理相容。

  • 高快取比重的推理與程式設計工作

    執行程式設計、推理或混合型代理工作負載的開發者,可從目前的 Serverless 模型中選擇,並針對重複提示前綴使用快取感知計費。

Pros and Cons

Pros

  • 同時提供無伺服器存取與專屬端點,讓團隊可在快速整合與自訂部署之間做選擇。
  • 採用與 OpenAI 相容的 Chat Completions 架構,降低切換既有客戶端所需的工作量。
  • 在 Serverless 模型上支援串流、工具使用與 JSON 模式。
  • 公開模型層級的 input、output 與 cache 定價,並說明自動 cache 命中的計費方式。
  • 為敏感工作負載提供專屬路徑,具備流量隔離、由 SLA 支援的正常運作時間與零資料保留選項。

Cons

  • 定價頁面目前回傳 404,因此公開網站在該處未提供直接的方案總覽。
  • 首頁目前只列出少數 Serverless 模型,並表示更多模型正在陸續推出。
  • 部分最強的說法屬於特定基準測試結果,因此讀者應以自身工作負載型態加以評估。

FAQ

Wafer 可以與既有的 OpenAI 基礎客戶端搭配使用嗎?

Wafer 的 Serverless 端點遵循 OpenAI Chat Completions 架構,因此既有客戶端只需更換 base URL 與 API key 即可連接。網站表示在所有 Serverless 模型上都支援串流、工具使用與 JSON 模式。

Wafer 為敏感或受監管的工作負載提供什麼?

Wafer 表示專屬端點可將流量與共享推論池隔離,並可為受合規要求約束的工作負載配置零資料保留。網站也指出 Wafer 會簽署 DPA,並提供由 SLA 支援的正常運作時間。

是否有公開列出價格?

首頁表示 Wafer 的 Serverless 服務提供按量付費的開放模型推論,而專屬端點則用於自訂模型服務與敏感工作負載。定價頁面目前回傳 404,因此公開網站在該處未顯示現行方案表。

Wafer 提供哪些模型?

網站目前在 Serverless 上列出 GLM-5.1、Kimi-K2.6 與 Qwen 3.5 397B-A17B,並表示更多模型正在陸續推出。首頁上的模型卡也會在 input 與 output 費率之外顯示 cache 定價。

哪些工作負載會使用專屬端點?

是。Wafer 為 Neon Health 的專屬端點案例研究指出,團隊將 GLM-5.1 移至 Wafer 的專屬端點,並使用以 TTFT 為基礎的 SLA 來支援語音代理的延遲需求。

Quick Facts

類別
企業級 LLM 平台
主要重點
供企業使用的開放模型推論
部署模式
無伺服器與專屬端點
API 相容性
OpenAI Chat Completions 架構
網站
wafer.ai
定價頁狀態
目前 /pricing 路徑回傳 404