Serverless推論
インフラを管理せずにオンデマンドでオープンソースモデルを実行でき、ホームページではserverless利用の最速の方法として位置付けられています。
Together AIは、推論、ファインチューニング、GPUクラスター、サンドボックス、マネージドストレージを備えたAIクラウドプラットフォームです。serverlessと専有型の導入に対応し、多くのワークロードは公開料金、上位ハードウェアは要問い合わせです。
Together AIは、モデルワークロードの構築、デプロイ、最適化のためのAIクラウドプラットフォームです。ホームページでは、推論、ファインチューニング、GPUクラスターのためのフルスタックAIプラットフォームとして説明されており、サンドボックス計算、マネージドストレージ、モデル整形向けの追加製品も提供されています。
このプラットフォームは、いくつかのデプロイおよびワークフロー層で構成されています。オンデマンド利用向けのserverless推論、シングルテナント性能向けの専有型推論、生成メディアワークロード向けの専有コンテナ推論、GPUアクセス向けのアクセラレーテッドコンピュート、開発向けのサンドボックス環境、本番向けモデル適応のためのファインチューニングです。料金ページでは、多くのserverlessモデルとインフラ製品の公開料金が示されている一方、より大きな専有型ハードウェアの一部は営業への問い合わせが必要です。
インフラを管理せずにオンデマンドでオープンソースモデルを実行でき、ホームページではserverless利用の最速の方法として位置付けられています。
保証されたパフォーマンス、カスタムモデル対応、トラフィック急増時の自動スケーリングを備えた専有型インフラ上にモデルを展開できます。
H100、H200、B200のハードウェアについて、オンデマンドと予約の料金オプションが表示されており、より大きな計算ジョブ向けに時間単位のGPU容量または予約クラスターを利用できます。
API経由でコードを安全に実行し、開発ワークフロー向けにVMサンドボックスを作成、休止、再開できます。
対応モデルファミリーに対して、教師ありファインチューニングと直接選好最適化を用い、オープンソースモデルを本番向けに学習できます。
AIワークロード向けに設計されたマネージドオブジェクトストレージと並列ファイルシステムにデータを保存でき、ホームページではゼロ転送料金が明記されています。
チームは、素早い実験のためにserverless推論から始め、その後、より安定したパフォーマンスや高い制御が必要になった段階で専有型エンドポイントへ移行できます。
専有型インフラを必要とする組織は、保証されたパフォーマンスと自動スケーリングを備えた専有型ハードウェア上に、カスタムモデルやオープンモデルを展開できます。
開発者は、教師ありファインチューニングまたは直接選好最適化を使って、対応するオープンソースモデルをドメイン固有の動作に合わせて調整できます。
大規模なジョブに取り組むAIチームは、トレーニング、評価、その他の計算負荷の高い作業のために、時間単位または予約済みのGPU容量を借りることができます。
アプリケーション開発者は、サンドボックスとマネージドストレージを使って開発環境を立ち上げ、コードを安全に実行し、データを計算リソースの近くに保てます。
Together AIは、AIワークロードの実行と調整のためのクラウドプラットフォームです。サイトでは、serverless推論、専有型推論、専有コンテナ推論、GPUクラスター、サンドボックス環境、マネージドストレージ、ファインチューニングを紹介しています。
料金ページでは、serverless推論、専有型推論、GPUクラスター、サンドボックス計算、マネージドストレージ、ファインチューニングが示されています。ホームページでは、バッチ推論、専有モデル推論、専有コンテナ推論も強調されています。
サイトでは、`https://api.together.xyz/v1/chat/completions` などのモデルページでOpenAI互換のAPIパターンが示されており、cURL、Python、TypeScriptのサンプル呼び出しが掲載されています。
多くのserverlessモデル、GPUクラスター、サンドボックス計算、ストレージ、ファインチューニングについて料金が公開されています。いくつかの大きなGPUオプションなどの専有型ハードウェアは、要問い合わせ価格として掲載されています。
ソースには、SDKやフレームワークの完全な互換性一覧はありません。ただし、コード例、クイックスタートガイド、ドキュメント、プレイグラウンドへのアクセス、モデルページへのリンクは表示されています。