快速串流合成
首頁與文件顯示一條快速的文字轉語音串流路徑,`/stream` 端點的音訊大約可在 300ms 內 उपलब्ध。
Unreal Speech 是專為開發者打造的文字轉語音 API,支援快速語音生成、時間戳記與多種 API 工作流程,並提供免費瀏覽器示範,可試用 Kokoro TTS 聲音並下載音訊。
Unreal Speech 是專為開發者打造的文字轉語音 API,適合需要以低延遲與彈性輸出選項將書面文字轉成口語音訊的人。網站將其定位為可直接用於正式環境的服務,具備串流合成、時間戳記支援,以及可快速測試的瀏覽器示範。
產品網站展示了多種使用平台的方式:快速的 `/stream` 端點、可回傳 MP3 與時間戳記 URL 的 `/speech` 端點、適用於較長文字的非同步 `/synthesisTasks` 流程,以及可同時串流音訊與字級時間戳記的 WebSocket 端點。工作室頁面另外提供一個以 Kokoro TTS 為基礎的免費線上示範,支援 48 種聲音與 8 種語言,可直接在瀏覽器中生成與下載。
首頁與文件顯示一條快速的文字轉語音串流路徑,`/stream` 端點的音訊大約可在 300ms 內 उपलब्ध。
API 支援多種輸出模式:同步、非同步與基於 WebSocket 的串流,因此團隊可依文字長度與延遲需求選擇合適的工作流程。
網站文件說明字級或句子級時間戳記,包括可即時提供時間資料的 `/streamWithTimestamps` WebSocket 流程。
工作室示範提供 48 種聲音與 8 種語言,讓使用者能測試多樣的聲音與語言選項。
定價頁表示服務最多可生成 10 小時音訊,並提供依字元量擴展的方案,包括免費方案與更高用量的付費方案。
瀏覽器工作室可讓訪客直接在瀏覽器中輸入文字、生成語音並下載錄音,方便快速評估。
當你希望口語輸出能快速開始時,使用低延遲的 `/stream` 端點,例如互動式應用回應或即時旁白預覽。
當你需要較短片段或較長段落的音訊檔案時,使用 `/speech` 或 `/synthesisTasks`,包括超過同步流程限制的長篇內容。
當應用需要文字高亮、字幕同步或與文字保持一致的旁白播放時,使用字級或句子級時間戳記。
使用工作室示範在瀏覽器中測試聲音、比較語言選項,並在整合 API 前下載範例錄音。
使用定價方案將字元用量對應到實際使用模式,從免費方案開始,隨著需求成長再升級到更高用量方案。
是。定價頁列出免費方案與付費方案,網站也提供可在瀏覽器中測試文字轉語音生成的即時示範。
首頁顯示的文件包含 `/stream`、`/speech`、`/synthesisTasks` 和 `/streamWithTimestamps`。網站說明 `/stream` 為同步且快速,`/speech` 會回傳 MP3 與時間戳記 URL,`/synthesisTasks` 適用於較長文字的非同步處理,而 `/streamWithTimestamps` 會串流音訊並提供字級時間資訊。
網站說明可將 `TimestampType` 設為 `word` 或 `sentence` 來請求時間戳記,並且也提到一種可同時串流音訊與時間戳記的 WebSocket 流程。
工作室頁面說 Kokoro TTS Studio 支援 48 種聲音與 8 種語言,包括美式與英式英語、法語、印地語、西班牙語、日語、中文、義大利語與葡萄牙語。
網站將 Unreal Speech 的商業用途定位為透過其 API 文件進行,而工作室頁面則將瀏覽器示範描述為可免費在線體驗文字轉語音並下載音訊。