SpeechGen logo

SpeechGen

認証する

SpeechGenは、ブラウザ上でテキストやアップロード文書から音声を生成し、ダウンロードできるAI音声合成ツールです。150以上の言語、5,000以上の音声、MP3・WAV・FLACに対応。

SpeechGen preview

概要

SpeechGenは、ブラウザ上でダウンロード可能なナレーションを作成するためのオンライン音声読み上げ・AI音声生成ツールです。貼り付けたテキストとアップロードした文書に対応し、豊富な音声と言語のライブラリを備え、MP3、WAV、FLACなどの形式で音声を書き出せます。

この製品は、手動のナレーション作業と自動生成の両方を想定して提供されています。ユーザーは速度、ピッチ、音量、間、スタイルを調整でき、BGMや複数話者の追加も可能です。また、プログラムによる合成のためのAPIにもアクセスできます。

機能

ブラウザベースのテキスト読み上げ

ブラウザ内でテキストから直接音声を生成し、結果を音声ファイルとしてダウンロードできます。ホームページでは、短いクリップから書籍長のナレーションまで対応すると案内されています。

大規模な多言語音声ライブラリ

150言語にわたる5,000以上の音声から選択でき、音声品質の階層や音声特性で絞り込めます。サイトでは音声サンプルも提供されており、生成前に विकल्पを確認できます。

テキストとファイルの入力オプション

DOCX、PDF、SRTファイルをアップロードするか、エディタにプレーンテキストを貼り付けられます。FAQでは、非常に長い入力にも対応できるとされており、長文の原稿や文書に便利です。

音声調整とSSML風コントロール

対応している音声では、読み上げ速度、ピッチ、音量、間の長さ、感情的なスタイルを調整できます。エディタとAPIの両方で、より正確な音声出力のためにこれらの設定を利用できます。

マルチスピーカーと音声編集ツール

BGMを追加し、1つのファイルで複数の話者を使い、チャプターやカットマーカーでコンテンツを個別の音声出力に分割できます。これらのツールは、より構造化されたナレーションのワークフローを支援します。

自動生成のためのAPI

APIを使って、インスタントテキスト、長文テキスト、字幕同期出力向けのエンドポイントで音声をプログラム的に合成できます。ドキュメントにはcURL、PHP、Python、JavaScriptの例が掲載されています。

ユースケース

  • マーケティングと動画のナレーション

    原稿、ランディングページのコピー、製品説明を、修正のたびに声優を手配せずにダウンロード可能なナレーションへ変換できます。

  • eラーニングと研修

    長文コンテンツやアップロードしたファイルを含むテキスト文書から、レッスン音声、研修モジュール、ナレーション付きの教材を生成できます。

  • ビジネス電話とIVR

    電話システムや受付フロー向けに、案内文、アナウンス、または多言語の通話対応音声を作成できます。

  • 音声ガイドとツアー

    音声、間、任意のBGMを使って、展示案内、ツアー、ガイド付き音声体験を構築できます。

  • 開発者向けワークフローと自動化

    APIエンドポイントを使用して、短文、長文、または字幕ベースの合成でアプリケーション、チャットボット、コンテンツパイプライン内の音声作成を自動化できます。

Pros and Cons

Pros

  • 5,000以上の音声と150以上の言語に対応した大規模な音声カタログ。
  • 貼り付けたテキストやアップロードしたDOCX、PDF、SRTファイルを含む複数の入力方法。
  • MP3、WAV、FLAC、OGG、Opusを含む一般的な音声形式へ直接書き出し可能。
  • 速度、ピッチ、音量、間の長さ、BGM、複数話者を調整できるコントロール。
  • インスタント、長文、字幕同期の合成に対応したAPIサポート。

Cons

  • 提供されたソースでは料金の詳細が不完全なため、正確なプラン料金と制限は利用可能な情報からは明確ではありません。
  • APIには有料アカウントが必要なため、無料生成だけを求めるユーザーにとってはプログラム利用が制限される場合があります。
  • 一部のスタイルや役割のコントロールは対応している音声でのみ利用可能なため、すべての設定がすべての音声に適用できるわけではありません。

FAQ

SpeechGenで音声を作成するにはどうすればよいですか?

SpeechGenは、貼り付けたテキストやアップロードしたファイルから、ブラウザ上で音声を生成します。ソースではプレーンテキスト、DOCX、PDF、SRTの入力に対応しているとされていますが、最適な手順はコンテンツの種類によって異なります。

SpeechGenは何言語・何音声に対応していますか?

サイトでは、150以上の言語と5,000以上の音声に対応していると案内されています。まず言語を選び、その後で音声を選択して音声を生成します。

どの音声形式をダウンロードできますか?

Webアプリでは、MP3、WAV、FLAC、OGG、Opus、M4A、およびいくつかのWAVバリアントに書き出せます。APIドキュメントでも、出力形式としてMP3、WAV、FLAC、OGG、Opusが挙げられています。

SpeechGenはサブスクリプションが必要ですか?

料金ページではサブスクリプション不要の従量課金モデルが示されており、ホームページではアカウント不要で1,000文字まで無料で始められると案内されています。正確なプラン料金と制限は、提供されたソースには記載されていません。

SpeechGenをAPI経由で利用できますか?

はい。APIドキュメントによると、APIアクセスには有料アカウントが必要で、リクエストにはトークン認証とメール認証を使用します。

Quick Facts

カテゴリ
AIテキスト読み上げ
プラットフォーム
Webアプリ
主な用途
音声生成とナレーション
入力タイプ
テキスト、DOCX、PDF、SRT
出力形式
MP3、WAV、FLAC、OGG、Opus、M4A、およびWAVバリアント
API
利用可能;有料アカウントが必要