Inferless logo

Inferless

認証する

Inferlessは、Hugging Face、Git、Docker、CLIからカスタム機械学習モデルをデプロイできるサーバーレスGPU推論プラットフォーム。自動スケーリング、秒単位課金、共有/専有GPUに対応。

Inferless preview

モデルデプロイのためのサーバーレスGPU推論

Inferlessは、カスタム機械学習モデルをデプロイするためのサーバーレスGPU推論プラットフォームです。ファイルからエンドポイントまで数分でモデルを移行できるように設計されており、インフラを直接管理せずにGPU対応の推論を必要とする本番ワークロード向けに位置づけられています。

このプラットフォームは、Hugging Face、Git、Docker、CLIからのデプロイをサポートし、自動再デプロイ、カスタムランタイム、書き込み可能ボリューム、監視、動的バッチ処理、プライベートエンドポイント設定などの運用制御を追加します。料金ページでは、NVIDIA T4、A10、A100 GPUに対して秒単位課金が示されており、共有インスタンスと専有インスタンスの両方が利用できます。

主な機能

複数のデプロイ方法

Hugging Face、Git、Docker、CLIからモデルをデプロイし、その後は自動再デプロイを使ってコード変更とエンドポイントを同期できます。

サーバーレスGPUオートスケーリング

モデルエンドポイントをゼロから数百台のGPUまでスケールでき、需要に応じて容量を調整する自社製ロードバランサーを備えています。

カスタムランタイム対応

実行時にモデルが必要とするソフトウェアや依存関係を含めるように、コンテナ環境をカスタマイズできます。

書き込み可能ボリューム

モデルファイルやその他の共有データ向けに、複数レプリカから同時接続できるNFS風の書き込み可能ボリュームを利用できます。

動的バッチ処理

バッチ処理の恩恵を受けるワークロード向けに、サーバー側でリクエストをまとめてスループットを向上できます。

監視とエンドポイント制御

呼び出しログとビルドログを確認し、スケールダウン、タイムアウト、同時実行数、テスト、Webhook設定などのエンドポイント動作を構成できます。

一般的なユースケース

  • 本番環境でのモデル提供

    GPUクラスターを直接管理せずに、コンピュータビジョン、NLP、推薦、または科学計算モデル向けのGPU対応推論をデプロイします。

  • 急増するトラフィックのワークロード

    リクエストの増減に応じてエンドポイントをゼロから数百台のGPUまでスケールし、変動の大きいワークロードを処理します。

  • 高スループット推論

    リクエストのまとめ処理の恩恵を受けるモデルを、動的バッチ処理を使って負荷時のスループット向上のために提供します。

  • 継続的なモデル更新

    Hugging Face、Git、Docker、またはCLIベースのワークフローでの変更が、手動の再インポートを減らしつつエンドポイントに反映されるように、自動再デプロイのフローでモデル更新を実行します。

  • コストと分離を考慮したデプロイ

    より低コストを優先するか、より一貫したリソース割り当てと分離を優先するかに応じて、共有または専有GPUインスタンスを選択します。

Pros and Cons

Pros

  • Hugging Face、Git、Docker、CLIを含む複数のソースからのデプロイに対応しています。
  • ゼロから数百台のGPUまでサーバーレスでスケールできます。
  • カスタムランタイム、書き込み可能ボリューム、動的バッチ処理、プライベートエンドポイント設定などの運用制御を提供します。
  • 初期費用なしの秒単位課金を採用しています。
  • 分離された実行環境、個別のログストリーム、暗号化されたモデル保存を含むセキュリティ対策が記載されています。

Cons

  • ソースでは、初回呼び出しに10〜20秒のコールドスタートがあると記載されています。
  • 料金とパフォーマンスは、マシンタイプや共有インスタンス/専有インスタンスの選択によって異なります。
  • 料金FAQによると、このプラットフォームはプライベートベータ版のため、アクセス条件が適用される場合があります。

FAQ

Inferlessではどのような種類のモデルをデプロイできますか?

InferlessはGPUベースの機械学習モデルをデプロイするために設計されています。ソースの例には、コンピュータビジョン、NLP、推薦、科学計算のワークロードに加え、Llama2 13B、Stable Diffusion ControlNet、Vicuna 7B などのモデルが挙げられています。

どのようにしてモデルをプラットフォームに載せますか?

ホームページによると、Hugging Face、Git、Docker、またはCLIからデプロイできます。また、自動再デプロイにも対応しているため、手動で再インポートせずにモデル更新を反映できます。

課金はどのように行われますか?

Inferlessは秒単位課金を採用しています。料金は、モデルが正常な状態で実行されている時間と選択したマシンタイプに基づいて算出され、料金ページでは初期費用は不要とされています。

レイテンシーはどの程度ですか?

料金ページによると、初回呼び出しでは10〜20秒のコールドスタートが発生する場合があり、その後の呼び出しは推論時間に依存します。つまり、モデルがすでにウォームかどうかによってレイテンシーは変動します。

共有インスタンスと専有インスタンスの違いは何ですか?

Inferlessでは、共有インスタンスはGPUリソースを複数ユーザーで分割して低コストを実現し、専有インスタンスは1人のユーザーにGPU全体を確保して、より一貫した性能とデータ分離を提供するとしています。

Quick Facts

カテゴリ
サーバーレスGPU推論
主なユーザー
開発者、小規模チーム、スタートアップ、より大きな組織
デプロイ入力
Hugging Face、Git、Docker、CLI
GPUオプション
NVIDIA T4、A10、A100
課金モデル
秒単位課金
ウェブサイト
inferless.com