統合された音声APIプラットフォーム
Deepgramは、1つの製品面から音声認識、音声合成、音声エージェント、音声インテリジェンスの各APIを提供しており、チームは別々のベンダーやサービスをつなぎ合わせることなく音声ワークフローを構築できます。
Deepgramは、音声認識、音声合成、音声エージェント、音声インテリジェンスAPIを備えた企業向けVoice AIプラットフォーム。クラウドや自社運用でリアルタイム音声ワークフローに対応。
Deepgramは、音声認識、音声合成、音声エージェント、音声インテリジェンスAPIを備えた企業向けVoice AIプラットフォームです。ホームページではリアルタイムの音声体験を構築するための単一の場所として紹介され、価格ページでは開発者、成長中のチーム、企業向け購入者に対する従量課金プランが示されています。
その中核的な価値は、音声製品の提供に必要なコンポーネント数を減らすことにあります。個別の音声、オーケストレーション、音声合成システムを接続する代わりに、Deepgramはクラウドおよび自社運用のデプロイにまたがる文字起こし、応答生成、会話型エージェント向けの統合スタックとしてAPIを位置づけています。
Deepgramは、1つの製品面から音声認識、音声合成、音声エージェント、音声インテリジェンスの各APIを提供しており、チームは別々のベンダーやサービスをつなぎ合わせることなく音声ワークフローを構築できます。
価格ページとホームページのどちらも、会話型音声エージェントや低遅延の音声認識を含むリアルタイム配信のユースケースを強調しています。
STT製品にはNova-3やFluxなどのモデル विकल्पが含まれており、ソース資料では多言語音声認識と自動言語検出に対応しています。
音声認識の追加機能には、マスキング、キーワードプロンプト、スマートフォーマット、話者分離が含まれており、コンプライアンス、専門用語、読みやすさ、複数話者の音声に合わせて文字起こしを調整できます。
音声合成は自然な音声を生成するための独立したAPIとして提供されており、価格ページには文字数ベースの料金でAura-1とAura-2のモデルが掲載されています。
このプラットフォームはクラウドAPIまたは自社運用の形でデプロイでき、ホームページではビルダー、パートナー、企業チーム向けとして位置づけられています。
文字起こし、音声合成、オーケストレーションを1つの流れで必要とするライブ音声アシスタントを構築できます。特に、遅延とターンテイキングが重要な場合に適しています。
話者分離、スマートフォーマット、キーワードプロンプトなどのオプションを使って、顧客通話、インタビュー、会議を文字起こしできます。専門用語にも対応しやすくなります。
音声合成APIを使って、アシスタント、IVRのような体験、その他の会話型アプリケーション向けに音声応答を生成できます。
1つのストリーミング接続で10言語とネイティブなコードスイッチングをサポートすると説明されているFlux Multilingualを使い、多言語の音声体験に対応できます。
音声データの上に音声インテリジェンスを追加し、会話音声やテキストから要約の抽出、トピック検出、感情分析を行えます。
Deepgramは、音声認識、音声合成、音声エージェント、音声インテリジェンスの各APIを提供しています。価格ページでは、これらのAPIごとに個別の従量課金プランが示されており、公開プランには無料の初回クレジットがあり、企業向けには営業への問い合わせ導線があります。
ソース資料では、リアルタイムおよびバッチの音声APIに加え、クラウドおよび自社運用のデプロイオプションが示されています。ホームページでは、ビルダー、プラットフォームおよびパートナー、カスタムワークフローを持つ企業向けの導線も分かれています。
Flux Multilingualは、リアルタイム音声エージェント向けの単一の会話型音声モデルとして紹介されています。10言語に対応し、1つのストリーミング接続で言語検出、コードスイッチング、ターン検出、割り込み処理を扱うよう設計されています。
ホームページでは、Deepgramを音声認識、音声合成、音声エージェントのワークフロー向けの1つのAPI面として提示しており、価格ページではそれらの製品が従量課金の階層に分かれています。ソースには、これらのページ上でのセットアップ手順やSDKの詳細は記載されていません。