Waferは、サーバーレスと専用のオープンモデル推論に対応した企業向けLLMプラットフォームです。OpenAI互換のワークロードを低遅延で提供し、キャッシュ考慮型課金と機密・高性能向け専用エンドポイントを備えます。

Wafer preview

概要

Waferは、オープンモデルを2つの方法で提供することに重点を置いた企業向けLLMプラットフォームです。1つは、すぐにAPIアクセスできるサーバーレス推論、もう1つは、分離やカスタム調整が必要なワークロード向けの専用エンドポイントです。ホームページでは「企業向けの最速のオープンソースLLM」と説明され、自前のインフラを管理せずにオープンモデルを実行する方法として紹介されています。

公開サイトでは、速度、予測しやすい提供、既存のAIツールとの互換性が強調されています。Waferによると、ServerlessエンドポイントはOpenAI Chat Completionsのスキーマに準拠し、ストリーミング、ツール利用、JSONモードをサポートし、ベースURLとAPIキーを差し替えるだけで既存のクライアントから利用できます。さらに要求の高い、または機密性の高い導入向けに、Waferはワークロードごとに最適化された専用推論エンドポイント、SLAに裏付けられた稼働率、コンプライアンス要件のある用途向けのゼロデータ保持を提供しています。

主な機能

サーバーレス推論

インフラやデプロイの手間を管理せずに、サーバーレスAPIを通じて主要なオープンモデルを提供できます。Waferは、これはオープンモデルへ素早くアクセスするための従量課金の手段だと位置付けています。

専用推論エンドポイント

分離性、予測しやすい稼働率、特定のハードウェア構成に合わせた性能調整が必要なカスタムモデルやミッションクリティカルなワークロードに、専用エンドポイントを利用できます。

OpenAI互換API

Waferによると、Serverless APIはOpenAI Chat Completionsのスキーマに準拠しており、OpenAI SDK、LangChain、LiteLLM、Claude Code、Cline系のクライアントは、ベースURLとAPIキーを変更するだけで接続できます。

エージェント向けレスポンスモード

このプラットフォームは、Serverlessモデル全体でストリーミング、ツール利用、JSONモードをサポートしており、エージェントワークフローや構造化出力に適しています。

キャッシュ考慮型課金

ホームページのモデルカードでは入力、出力、キャッシュの各レートが個別に表示されており、Waferは繰り返し出現するプロンプトの先頭部分には自動的にキャッシュレートが適用されると説明しています。

ワークロード別の最適化

Waferはベンチマーク結果を公開し、各アクセラレータファミリーでモデルをプロファイリングし、エキスパートをシャーディングしてキャッシュ階層に収め、継続バッチ処理をモデルのKVキャッシュ使用量に合わせて調整していると述べています。

実用的なユースケース

  • プロダクトチーム向けの迅速な統合

    オープンモデル推論をすばやく追加したいチームは、自社で提供基盤を運用する代わりに、Waferのサーバーレスエンドポイントを利用できます。サイトでは、これはインフラやデプロイの手間がない従量課金オプションとして説明されています。

  • 低遅延の会話システム

    音声エージェントやその他のリアルタイム対話を持つプロダクトは、レイテンシーと安定したTTFTが総スループットより重要な場合に専用エンドポイントを利用できます。Neon Healthの事例は、この適合性が会話型ヘルスケアワークフローに当てはまることを示しています。

  • コンプライアンス要件のある企業向けワークロード

    PHIやその他の機微データを扱う組織は、トラフィック分離とゼロデータ保持オプションを備えた専用エンドポイントを利用できます。Neonの事例では、この導入にBAA対応と米国限定のデータ居住も記載されています。

  • OpenAI互換のエージェントスタック

    すでにOpenAIスタイルのツールを使っているチームは、最小限のクライアント変更でWaferに接続できます。サイトでは、OpenAI SDK、LangChain、LiteLLM、Claude Code、Cline風のエージェントとの互換性が明記されています。

  • キャッシュ中心の推論・コーディングジョブ

    コーディング、推論、または複合エージェントのワークロードを実行する開発者は、現在のServerlessモデルから選択し、繰り返し出現するプロンプトの先頭部分に対してキャッシュ考慮型課金を利用できます。

Pros and Cons

Pros

  • サーバーレスアクセスと専用エンドポイントの両方を提供しており、チームは迅速な統合とカスタムデプロイのどちらかを選べます。
  • OpenAI互換のChat Completionsスキーマを採用しているため、既存クライアントの切り替えに必要な手間を抑えられます。
  • Serverlessモデルでストリーミング、ツール利用、JSONモードをサポートしています。
  • モデルごとの入力・出力・キャッシュ価格を公開し、自動キャッシュヒットの課金方法を説明しています。
  • トラフィック分離、SLAに裏付けられた稼働率、ゼロデータ保持オプションを備えた、機微なワークロード向けの専用経路を提供しています。

Cons

  • 価格ページが現在404を返すため、公開サイトではそこに分かりやすいプラン概要がありません。
  • ホームページで現在一覧表示されているServerlessモデルは少数で、今後順次追加されるとされています。
  • 最も強い主張の一部はベンチマーク固有であるため、読者は自分のワークロード特性に照らして評価する必要があります。

FAQ

Waferは既存のOpenAIベースのクライアントで使えますか?

WaferのServerlessエンドポイントはOpenAI Chat Completionsスキーマに準拠しているため、既存のクライアントはベースURLとAPIキーを差し替えるだけで接続できます。サイトでは、Serverlessモデル全体でストリーミング、ツール利用、JSONモードがサポートされていると説明されています。

Waferは機微または規制対象のワークロードに対して何を提供していますか?

Waferによると、専用エンドポイントは共有推論プールからトラフィックを分離し、コンプライアンス要件のあるワークロード向けにゼロデータ保持で構成できます。サイトでは、WaferがDPAに署名し、SLAに裏付けられた稼働率を提供すると記載しています。

価格は公開されていますか?

ホームページでは、WaferのServerless提供はオープンモデル推論を従量課金で利用できるとされており、専用エンドポイントはカスタムモデル提供と機微なワークロード向けです。価格ページは現在404を返しているため、公開サイト上では現在のプラン表は表示されていません。

Waferではどのモデルが利用できますか?

サイトでは現在、ServerlessでGLM-5.1、Kimi-K2.6、Qwen 3.5 397B-A17Bが掲載されており、さらにモデルが順次追加されるとしています。ホームページのモデルカードには、入力・出力レートに加えてキャッシュ価格も表示されています。

どのようなワークロードが専用エンドポイントを使いますか?

はい。Neon Health向けのWafer専用エンドポイント事例では、チームがGLM-5.1を専用のWaferエンドポイントへ移行し、音声エージェントのレイテンシー要件を支えるためにTTFTベースのSLAを使用したと説明しています。

Quick Facts

カテゴリ
企業向けLLMプラットフォーム
主な用途
企業向けのオープンモデル推論
提供形態
サーバーレスと専用エンドポイント
API互換性
OpenAI Chat Completionsスキーマ
ウェブサイト
wafer.ai
価格ページの状況
現在の /pricing ルートは404を返します