ストリーミング音声合成
低遅延の会話用途向けに設計された、同社のストリーミング TTS モデル Sonic-3.5 を使って、リアルタイム音声を生成します。遅延のあるバッチレンダリングではなく、低遅延の会話利用を想定しています。
Cartesiaは、リアルタイムのテキスト読み上げ、音声認識、ボイスエージェント向けのvoice AIプラットフォーム。低遅延で柔軟な導入に対応し、ライブ会話システムの構築に最適です。
Cartesia は、リアルタイムの音声生成、文字起こし、ボイスエージェントに重点を置いた voice AI プラットフォームです。主な製品は、テキスト読み上げ用の Sonic、音声認識用の Ink、ボイスエージェント構築用の Line です。
同社はこれらのモデルを、AI エージェント、カスタマーサポート、営業、採用、その他の会話型ワークフローを含む、レイテンシが重要なライブで同期的なやり取り向けに位置づけています。サイトでは、同じスタックをクラウド、オンプレミス、VPC、またはデバイス上にデプロイできるとも説明しています。
低遅延の会話用途向けに設計された、同社のストリーミング TTS モデル Sonic-3.5 を使って、リアルタイム音声を生成します。遅延のあるバッチレンダリングではなく、低遅延の会話利用を想定しています。
名前や業界用語など、正確な発音が必要な項目に対して、音声の作成・クローン、多言語への音声ローカライズ、カスタム発音辞書の利用ができます。
対話型音声システムやライブ会話フロー向けに Sonic と並んで位置づけられている音声認識モデル Ink-2 を使って、音声を文字起こしします。
ツール、ガードレール、カスタマイズ可能な LLM、ライブ動作と通話分析をテストするための組み込み評価を備えた Line を使って、ボイスエージェントを構築します。
低遅延、データ所在地、制御要件に合わせて、同じモデルとエージェントをクラウド、オンプレミス、VPC、オンデバイス環境にわたって展開できます。
API アクセスと SDK、開発者向けツールを併用し、コピペのサンプルから反復的な開発ループを通じて本番システムへ移行できます。
タイミングと間合いがやり取りに影響するライブ会話で、Sonic を使って自然な応答音声を生成します。
実行可能なアクション、ツール利用、デプロイ前の組み込み評価を備えたボイスエージェントを Line で構築します。
Sonic のローカライズ機能とボイスクローン機能を使って、言語や市場をまたいでも一貫したブランド音声を維持します。
通話フロー、ライブサポートのワークフロー、または高速な音声認識を必要とするその他のシステム向けに、Ink で音声入力を文字起こしします。
データ所在地や制御が重要な場合に、クラウド、オンプレミス、VPC、オンデバイス設定で実行するために、プラットフォームの導入オプションを活用します。
はい。料金ページには Free、Pro、Startup、Scale、Enterprise の各オプションが表示されており、Enterprise には営業への問い合わせフローがあります。また、使用量ベースのクレジットとエージェント分数も提示されているため、利用拡大に合わせて小さく始めて段階的に移行できます。
Cartesia のサイトでは、テキスト読み上げ用の Sonic、音声認識用の Ink、ボイスエージェント用の Line が紹介されています。ホームページと agents ページでは、これらが API と開発者向けツール経由で提供され、Line は本番向けボイスエージェントの構築とデプロイを目的としていると示されています。
サイトでは、Cartesia がクラウドデプロイ、リージョン別 API エンドポイント、オンプレミスまたは VPC デプロイ、そしてオンデバイスデプロイをサポートしていると説明されています。また、同じモデルとエージェントをこれらの環境全体で実行できるとも記載されています。
料金ページによると、各プランには無制限のワークスペース席とボイススロットが含まれ、使用量はクレジットとエージェント分数で計測されます。サイトでは、ボイスエージェント向けの組み込み評価とエージェント分析にも言及しています。
ソース資料には、公開されたセットアップウィザードや完全な統合一覧は含まれていません。API アクセス、SDK、開発者ツールは示されていますが、対応言語やサードパーティ統合の完全なカタログはありません。