サーバーレス推論
インフラやデプロイの手間を管理せずに、サーバーレスAPIを通じて主要なオープンモデルを提供できます。Waferは、これはオープンモデルへ素早くアクセスするための従量課金の手段だと位置付けています。
Waferは、サーバーレスと専用のオープンモデル推論に対応した企業向けLLMプラットフォームです。OpenAI互換のワークロードを低遅延で提供し、キャッシュ考慮型課金と機密・高性能向け専用エンドポイントを備えます。
Waferは、オープンモデルを2つの方法で提供することに重点を置いた企業向けLLMプラットフォームです。1つは、すぐにAPIアクセスできるサーバーレス推論、もう1つは、分離やカスタム調整が必要なワークロード向けの専用エンドポイントです。ホームページでは「企業向けの最速のオープンソースLLM」と説明され、自前のインフラを管理せずにオープンモデルを実行する方法として紹介されています。
公開サイトでは、速度、予測しやすい提供、既存のAIツールとの互換性が強調されています。Waferによると、ServerlessエンドポイントはOpenAI Chat Completionsのスキーマに準拠し、ストリーミング、ツール利用、JSONモードをサポートし、ベースURLとAPIキーを差し替えるだけで既存のクライアントから利用できます。さらに要求の高い、または機密性の高い導入向けに、Waferはワークロードごとに最適化された専用推論エンドポイント、SLAに裏付けられた稼働率、コンプライアンス要件のある用途向けのゼロデータ保持を提供しています。
インフラやデプロイの手間を管理せずに、サーバーレスAPIを通じて主要なオープンモデルを提供できます。Waferは、これはオープンモデルへ素早くアクセスするための従量課金の手段だと位置付けています。
分離性、予測しやすい稼働率、特定のハードウェア構成に合わせた性能調整が必要なカスタムモデルやミッションクリティカルなワークロードに、専用エンドポイントを利用できます。
Waferによると、Serverless APIはOpenAI Chat Completionsのスキーマに準拠しており、OpenAI SDK、LangChain、LiteLLM、Claude Code、Cline系のクライアントは、ベースURLとAPIキーを変更するだけで接続できます。
このプラットフォームは、Serverlessモデル全体でストリーミング、ツール利用、JSONモードをサポートしており、エージェントワークフローや構造化出力に適しています。
ホームページのモデルカードでは入力、出力、キャッシュの各レートが個別に表示されており、Waferは繰り返し出現するプロンプトの先頭部分には自動的にキャッシュレートが適用されると説明しています。
Waferはベンチマーク結果を公開し、各アクセラレータファミリーでモデルをプロファイリングし、エキスパートをシャーディングしてキャッシュ階層に収め、継続バッチ処理をモデルのKVキャッシュ使用量に合わせて調整していると述べています。
オープンモデル推論をすばやく追加したいチームは、自社で提供基盤を運用する代わりに、Waferのサーバーレスエンドポイントを利用できます。サイトでは、これはインフラやデプロイの手間がない従量課金オプションとして説明されています。
音声エージェントやその他のリアルタイム対話を持つプロダクトは、レイテンシーと安定したTTFTが総スループットより重要な場合に専用エンドポイントを利用できます。Neon Healthの事例は、この適合性が会話型ヘルスケアワークフローに当てはまることを示しています。
PHIやその他の機微データを扱う組織は、トラフィック分離とゼロデータ保持オプションを備えた専用エンドポイントを利用できます。Neonの事例では、この導入にBAA対応と米国限定のデータ居住も記載されています。
すでにOpenAIスタイルのツールを使っているチームは、最小限のクライアント変更でWaferに接続できます。サイトでは、OpenAI SDK、LangChain、LiteLLM、Claude Code、Cline風のエージェントとの互換性が明記されています。
コーディング、推論、または複合エージェントのワークロードを実行する開発者は、現在のServerlessモデルから選択し、繰り返し出現するプロンプトの先頭部分に対してキャッシュ考慮型課金を利用できます。
WaferのServerlessエンドポイントはOpenAI Chat Completionsスキーマに準拠しているため、既存のクライアントはベースURLとAPIキーを差し替えるだけで接続できます。サイトでは、Serverlessモデル全体でストリーミング、ツール利用、JSONモードがサポートされていると説明されています。
Waferによると、専用エンドポイントは共有推論プールからトラフィックを分離し、コンプライアンス要件のあるワークロード向けにゼロデータ保持で構成できます。サイトでは、WaferがDPAに署名し、SLAに裏付けられた稼働率を提供すると記載しています。
ホームページでは、WaferのServerless提供はオープンモデル推論を従量課金で利用できるとされており、専用エンドポイントはカスタムモデル提供と機微なワークロード向けです。価格ページは現在404を返しているため、公開サイト上では現在のプラン表は表示されていません。
サイトでは現在、ServerlessでGLM-5.1、Kimi-K2.6、Qwen 3.5 397B-A17Bが掲載されており、さらにモデルが順次追加されるとしています。ホームページのモデルカードには、入力・出力レートに加えてキャッシュ価格も表示されています。
はい。Neon Health向けのWafer専用エンドポイント事例では、チームがGLM-5.1を専用のWaferエンドポイントへ移行し、音声エージェントのレイテンシー要件を支えるためにTTFTベースのSLAを使用したと説明しています。