モデル提供のための推論
Modalでは、LLM、音声、画像生成、埋め込み、カスタムモデル向けの推論ワークロードを実行できます。リクエスト間はscale-to-zeroで動作し、トークンストリーミング、WebRTC、WebSocketに対応しています。
Modalは、CPU・GPU・データ集約型ワークロードを自分のコードで実行できるサーバーレスAIインフラプラットフォーム。推論、学習、バッチ処理、サンドボックスに対応。
Modalは、自分のコードからCPU、GPU、データ集約型ワークロードを実行する必要がある開発者向けのサーバーレスAIインフラプラットフォームです。このサイトでは、AIおよびデータチーム向けのインフラとして位置づけられ、推論、学習、バッチ処理、サンドボックスをサポートしています。
この製品はコードファーストのワークフローを中心に設計されています。Modal SDKを使うと、ロジック、ストレージ、ハードウェアを1か所で定義し、それをサブ秒起動のオートスケーリングコンピュート上で実行できます。可観測性も統合されており、料金は使用量ベースのため、アイドル容量ではなく実際のコンピュート時間に対して支払います。
Modalでは、LLM、音声、画像生成、埋め込み、カスタムモデル向けの推論ワークロードを実行できます。リクエスト間はscale-to-zeroで動作し、トークンストリーミング、WebRTC、WebSocketに対応しています。
学習ワークフローは単一GPUから始められ、マルチノード実行へ拡張できます。ファインチューニング、強化学習、並列ハイパーパラメータ探索をサポートします。
サンドボックスは、信頼できないコード、コーディングエージェント、RLロールアウトを実行するための分離された環境を提供し、高速スケジューリング、GPUまたはCPU容量、カスタムイメージと依存関係のサポートを備えています。
このプラットフォームにはSDKとコード定義のプリミティブがあり、チームはPythonでロジック、ストレージ、ハードウェア、デプロイをまとめて指定できます。
Modalは、ログ、メトリクス、readiness probe、ヘルスチェック、そして運用デバッグのためのfunctions、sandboxes、containersの可視化を提供します。
料金ページと製品ページでは、クラウドやリージョンをまたぐオートスケーリングが説明されており、有料プランではリージョン選択が可能です。また、大規模なGPUフリートまで拡張できるインフラが示されています。
リクエスト間でscale-to-zero動作を行うLLM、音声モデル、画像生成パイプライン、埋め込み、またはカスタム推論エンジンを提供します。
別個の学習インフラを管理せずに、ファインチューニング、強化学習、マルチノード学習ジョブを実行します。
コーディングエージェント、信頼できないコードの実行、強い分離が必要なその他の短命ワークロード向けに、分離された環境を立ち上げます。
数千のワーカーを同時に実行する必要がある場合もある、バッチ処理、データセット生成、並列評価ジョブを処理します。
料金とプラン構成を使って、Starterセットアップ、Teamワークスペース、またはセキュリティとサポート機能を備えたEnterprise構成を選択します。
Modalは、自分のコードからCPU、GPU、データ集約型のワークロードを実行するためのサーバーレスAIインフラプラットフォームです。このサイトでは、推論、学習、バッチ処理、サンドボックス向けのプラットフォームとして紹介されています。
料金ページには、Starter、Team、Enterpriseの3つの主要プランが表示されています。Starterは月額0ドル+コンピュート料金から、Teamは月額250ドル+コンピュート料金から、Enterpriseは個別見積もりです。
ソースでは、ModalはPythonのまま使い、SDKを使ってロジック、ハードウェア、ストレージ、デプロイをコードで定義すると説明されています。また、ワークフローの一部としてfunctions、sandboxes、containersが強調されています。
Modalは、推論、学習ジョブ、バッチ処理、または分離されたサンドボックス環境を大規模に実行する必要があるAIチームやデータチーム向けに設計されています。
料金ページには、スケジュール済み関数とWeb関数に制限のあるStarterプラン、リージョン選択、3つのワークスペース席が含まれており、TeamとEnterpriseではより多くの容量と機能が追加されます。ソースには、すべての制限を網羅した公開リストはありません。