高速ストリーミング合成
ホームページとドキュメントでは、`/stream` エンドポイントで約 300ms で音声を利用できる高速ストリーミング経路が示されています。
Unreal Speech は、迅速な音声生成、タイムスタンプ対応、複数のAPIワークフローを求める開発者向けの text-to-speech API。Kokoro TTS の無料ブラウザデモも利用できます。
Unreal Speech は、低レイテンシで柔軟な出力オプションを使い、書かれたテキストを音声に変換したい開発者向けに構築された text-to-speech API です。サイトでは、ストリーミング合成、タイムスタンプ対応、すぐに試せるブラウザベースのデモを備えた本番対応サービスとして位置づけられています。
製品サイトでは、用途に応じた複数の利用方法が示されています。高速な `/stream` エンドポイント、MP3 とタイムスタンプ URL を返せる `/speech` エンドポイント、長文向けの非同期 `/synthesisTasks` フロー、そしてワードレベルのタイムスタンプと音声をまとめてストリーミングできる WebSocket エンドポイントです。スタジオページには、Kokoro TTS を基盤にした無料のオンラインデモが追加されており、8 言語にわたる 48 の音声を使ってブラウザ上で生成とダウンロードができます。
ホームページとドキュメントでは、`/stream` エンドポイントで約 300ms で音声を利用できる高速ストリーミング経路が示されています。
API は同期、非同期、WebSocket ベースのストリーミングなど複数の出力パターンをサポートしており、テキスト量やレイテンシ要件に合ったワークフローを選べます。
サイトでは、ワード単位または文単位のタイムスタンプが説明されており、リアルタイムのタイミングデータ向けに `/streamWithTimestamps` の WebSocket フローも案内されています。
スタジオデモでは 8 言語にわたる 48 の音声が提示されており、試用できる音声と言語の選択肢が幅広く用意されています。
料金ページによると、このサービスは最大 10 時間の音声を生成でき、文字数に応じて拡張するプランを提供しており、無料プランと高ボリューム向けの有料プランが含まれます。
ブラウザスタジオでは、テキスト入力、音声生成、録音のダウンロードをブラウザ内で直接行えるため、すばやく評価できます。
音声出力をすばやく開始したい場合は、低レイテンシの `/stream` エンドポイントを使用します。たとえば、インタラクティブなアプリ応答やリアルタイムのナレーションプレビューに適しています。
短いクリップや長めの文章のために生成済み音声ファイルが必要な場合は、`/speech` または `/synthesisTasks` を使用します。同期パスを超える長文コンテンツも含まれます。
アプリでハイライト、字幕同期、テキストとずれないナレーション再生が必要な場合は、ワード単位または文単位のタイムスタンプを使用します。
API を統合する前に、ブラウザで音声を試し、言語オプションを比較し、サンプル録音をダウンロードするためにスタジオデモを使用します。
利用量に合わせて文字数を調整するために料金プランを使い、無料プランから始めて、需要の増加に応じてより大きな利用量向けプランへ移行します。
はい。料金ページには無料プランと有料プランが記載されており、サイトにはブラウザ上でテキスト読み上げ生成を試せるライブスタジオデモもあります。
ホームページに表示されているドキュメントには `/stream`、`/speech`、`/synthesisTasks`、`/streamWithTimestamps` が含まれています。サイトでは、`/stream` は同期型で高速、`/speech` は MP3 とタイムスタンプ URL を返し、`/synthesisTasks` は長文向けの非同期処理、`/streamWithTimestamps` は音声とワードレベルのタイミングをストリーミングすると説明しています。
サイトでは、`TimestampType` を `word` または `sentence` に設定してタイムスタンプを取得できると説明しており、音声とタイムスタンプを同時にストリーミングする WebSocket フローにも触れています。
スタジオページによると、Kokoro TTS Studio は 8 言語で 48 の音声に対応しており、アメリカ英語とイギリス英語、フランス語、ヒンディー語、スペイン語、日本語、中国語、イタリア語、ポルトガル語が含まれます。
サイトでは、商用利用は API ドキュメントを通じて Unreal Speech を利用する形で案内しており、スタジオページのブラウザデモは、モデルを試したり音声をダウンロードしたりできる無料のオンライン text-to-speech 体験として説明されています。