快速流式合成
首页和文档展示了一个快速的文本转语音流式路径,`/stream` 端点的音频大约可在 300ms 内可用。
Unreal Speech 是面向开发者的文本转语音 API,支持快速语音生成、时间戳和多种 API 流程;另提供免费浏览器演示,可试用 Kokoro TTS 声音并下载音频。
Unreal Speech 是面向开发者的文本转语音 API,旨在将书面文本转换为口语音频,并提供低延迟和灵活的输出选项。网站将其定位为可投入生产的服务,支持流式合成、时间戳功能以及用于快速测试的浏览器演示。
产品网站展示了多种使用平台的方式:快速的 `/stream` 端点、可返回 MP3 和时间戳 URL 的 `/speech` 端点、用于较长文本的异步 `/synthesisTasks` 流程,以及一个可在流式传输音频的同时提供单词级时间戳的 WebSocket 端点。工作室页面还增加了一个基于 Kokoro TTS 的免费在线演示,提供 8 种语言共 48 个声音,可在浏览器中生成并下载音频。
首页和文档展示了一个快速的文本转语音流式路径,`/stream` 端点的音频大约可在 300ms 内可用。
该 API 支持多种输出模式:同步、异步以及基于 WebSocket 的流式传输,因此团队可以按文本长度和延迟需求选择合适的工作流。
网站记录了单词级或句子级时间戳,包括用于实时计时数据的 `/streamWithTimestamps` WebSocket 流程。
工作室演示提供 8 种语言的 48 个声音,为用户提供了广泛的声音和语言选项供测试。
定价页面说明该服务最多可生成 10 小时音频,并提供按字符量扩展的方案,包括免费套餐和更高用量的付费方案。
浏览器工作室允许访客直接在浏览器中输入文本、生成语音并下载录音,便于快速评估。
当你希望语音输出尽快开始时,可使用低延迟的 `/stream` 端点,例如交互式应用响应或实时旁白预览。
当你需要为较短片段或较长段落生成音频文件时,可使用 `/speech` 或 `/synthesisTasks`,包括超过同步路径限制的长文本内容。
当你的应用需要高亮显示、字幕同步或与文本保持对齐的旁白播放时,可使用单词级或句子级时间戳。
使用工作室演示在浏览器中测试声音、比较语言选项,并在集成 API 之前下载示例录音。
使用定价套餐将字符量与使用模式匹配,从免费套餐开始,并在需求增长时升级到更高用量的方案。
是。定价页面列出了免费套餐和付费方案,网站还提供了可在浏览器中测试文本转语音生成的在线演示。
首页展示的文档包含 `/stream`、`/speech`、`/synthesisTasks` 和 `/streamWithTimestamps`。网站说明 `/stream` 是同步且快速的,`/speech` 返回 MP3 和时间戳 URL,`/synthesisTasks` 用于较长文本的异步处理,而 `/streamWithTimestamps` 会在流式传输音频的同时提供单词级时间信息。
网站说明可以将 `TimestampType` 设置为 `word` 或 `sentence` 来请求时间戳,同时也提到有一种通过 WebSocket 同时流式传输音频和时间戳的流程。
工作室页面说明 Kokoro TTS Studio 支持 8 种语言的 48 个声音,包括美式英语、英式英语、法语、印地语、西班牙语、日语、中文、意大利语和葡萄牙语。
网站将 Unreal Speech 的商业用途定位为通过其 API 文档进行,而工作室页面则将浏览器演示描述为一个可免费在线体验文本转语音、试用模型并下载音频的方式。