Unreal Speech logo

Unreal Speech

認証する

Unreal Speech は、迅速な音声生成、タイムスタンプ対応、複数のAPIワークフローを求める開発者向けの text-to-speech API。Kokoro TTS の無料ブラウザデモも利用できます。

Unreal Speech preview

Unreal Speech とは

Unreal Speech は、低レイテンシで柔軟な出力オプションを使い、書かれたテキストを音声に変換したい開発者向けに構築された text-to-speech API です。サイトでは、ストリーミング合成、タイムスタンプ対応、すぐに試せるブラウザベースのデモを備えた本番対応サービスとして位置づけられています。

製品サイトでは、用途に応じた複数の利用方法が示されています。高速な `/stream` エンドポイント、MP3 とタイムスタンプ URL を返せる `/speech` エンドポイント、長文向けの非同期 `/synthesisTasks` フロー、そしてワードレベルのタイムスタンプと音声をまとめてストリーミングできる WebSocket エンドポイントです。スタジオページには、Kokoro TTS を基盤にした無料のオンラインデモが追加されており、8 言語にわたる 48 の音声を使ってブラウザ上で生成とダウンロードができます。

主な機能

高速ストリーミング合成

ホームページとドキュメントでは、`/stream` エンドポイントで約 300ms で音声を利用できる高速ストリーミング経路が示されています。

複数の API ワークフロー

API は同期、非同期、WebSocket ベースのストリーミングなど複数の出力パターンをサポートしており、テキスト量やレイテンシ要件に合ったワークフローを選べます。

タイムスタンプ生成

サイトでは、ワード単位または文単位のタイムスタンプが説明されており、リアルタイムのタイミングデータ向けに `/streamWithTimestamps` の WebSocket フローも案内されています。

音声と言語の選択

スタジオデモでは 8 言語にわたる 48 の音声が提示されており、試用できる音声と言語の選択肢が幅広く用意されています。

長文対応とスケール可能な利用

料金ページによると、このサービスは最大 10 時間の音声を生成でき、文字数に応じて拡張するプランを提供しており、無料プランと高ボリューム向けの有料プランが含まれます。

ライブブラウザデモ

ブラウザスタジオでは、テキスト入力、音声生成、録音のダウンロードをブラウザ内で直接行えるため、すばやく評価できます。

Unreal Speech の一般的な使い方

  • 高速なインタラクティブ再生

    音声出力をすばやく開始したい場合は、低レイテンシの `/stream` エンドポイントを使用します。たとえば、インタラクティブなアプリ応答やリアルタイムのナレーションプレビューに適しています。

  • バッチ音声生成

    短いクリップや長めの文章のために生成済み音声ファイルが必要な場合は、`/speech` または `/synthesisTasks` を使用します。同期パスを超える長文コンテンツも含まれます。

  • タイミング付きテキストハイライト

    アプリでハイライト、字幕同期、テキストとずれないナレーション再生が必要な場合は、ワード単位または文単位のタイムスタンプを使用します。

  • 音声評価とプロトタイピング

    API を統合する前に、ブラウザで音声を試し、言語オプションを比較し、サンプル録音をダウンロードするためにスタジオデモを使用します。

  • 利用の段階的な拡張

    利用量に合わせて文字数を調整するために料金プランを使い、無料プランから始めて、需要の増加に応じてより大きな利用量向けプランへ移行します。

Pros and Cons

Pros

  • `/stream` エンドポイントで約 300ms で音声が利用できる高速ストリーミング経路を提供します。
  • 同期および非同期の API フローを通じて、短文生成と長文生成の両方をサポートします。
  • ワード単位・文単位のタイムスタンプオプションに加え、音声とタイミングデータを同時に配信できる WebSocket ストリームも備えています。
  • サイトを離れずに音声を試したり、ダウンロード可能な音声を生成したりできる無料のブラウザデモを提供しています。
  • 無料プランから始まり、より大きな利用量向けのプランへ拡張できる料金体系を示しています。

Cons

  • サイトには、ドキュメントのスニペットで示されている Python の例以外の SDK 対応など、完全な統合リストがありません。
  • 一部の機能の詳細は提供ページ上では部分的にしか文書化されていないため、適合性や実装工数は API ドキュメントを直接確認する必要がある場合があります。
  • ブラウザスタジオはデモ環境であり、サイトは商用ユースケースをデモではなく API ドキュメントへ案内しています。

FAQ

Unreal Speech を無料で試す方法はありますか?

はい。料金ページには無料プランと有料プランが記載されており、サイトにはブラウザ上でテキスト読み上げ生成を試せるライブスタジオデモもあります。

どの API ワークフローをサポートしていますか?

ホームページに表示されているドキュメントには `/stream`、`/speech`、`/synthesisTasks`、`/streamWithTimestamps` が含まれています。サイトでは、`/stream` は同期型で高速、`/speech` は MP3 とタイムスタンプ URL を返し、`/synthesisTasks` は長文向けの非同期処理、`/streamWithTimestamps` は音声とワードレベルのタイミングをストリーミングすると説明しています。

音声にタイムスタンプを付けられますか?

サイトでは、`TimestampType` を `word` または `sentence` に設定してタイムスタンプを取得できると説明しており、音声とタイムスタンプを同時にストリーミングする WebSocket フローにも触れています。

利用できる音声と言語はいくつありますか?

スタジオページによると、Kokoro TTS Studio は 8 言語で 48 の音声に対応しており、アメリカ英語とイギリス英語、フランス語、ヒンディー語、スペイン語、日本語、中国語、イタリア語、ポルトガル語が含まれます。

ブラウザデモは API 製品と同じものですか?

サイトでは、商用利用は API ドキュメントを通じて Unreal Speech を利用する形で案内しており、スタジオページのブラウザデモは、モデルを試したり音声をダウンロードしたりできる無料のオンライン text-to-speech 体験として説明されています。

Quick Facts

カテゴリ
Text-to-speech API
ソースドメイン
unrealspeech.com
主な利用者
開発者
デモ
Kokoro TTS のブラウザベーススタジオ
音声と言語
8 言語にわたる 48 の音声
料金
無料プラン+有料プラン