预录音频转录
为录制的音频和视频提供预录语音转文字服务,定价按提交的音频时长计费。
AssemblyAI 是面向开发者的语音 AI 基础设施平台,提供语音转文字、实时转录、语音代理、转录理解、内容护栏和 LLM Gateway,适用于录音与直播音频工作流。

AssemblyAI 是面向开发者的语音 AI 基础设施平台,帮助构建可转录、理解并对语音采取行动的产品。其 API 覆盖录音转录、实时转录、语音代理、转录增强、内容护栏,以及在语音工作流中访问大型语言模型。
该网站将该产品呈现为一组生产级 API,而不是单一应用。定价和文档围绕特定工作流进行组织,例如预录音频、流式会话、语音代理,以及说话人分离、医疗模式和脱敏等附加功能。
为录制的音频和视频提供预录语音转文字服务,定价按提交的音频时长计费。
支持通话、字幕、语音代理和坐席辅助等场景的实时转录,计费依据 WebSocket 会话保持打开的时长。
在单个 WebSocket 中结合 STT、LLM 推理、TTS、轮次检测、中断处理和工具调用,用于语音到语音的代理工作流。
增加结构化转录功能,例如说话人识别、翻译、自定义格式化、实体检测、情感分析、主题检测和摘要。
为转录和音频工作流提供 PII 脱敏、脏话过滤和内容审核等护栏。
提供支持按 token 计费和提示词缓存的 LLM Gateway,适用于 Anthropic、OpenAI 和 Google 模型。
使用预录 API 将录制的访谈、会议、播客或其他音频/视频文件转换为转录文本,并在需要时叠加说话人识别、翻译或脱敏。
使用实时 API 为通话体验、字幕、语音代理或坐席辅助工作流转录实时对话,计费随会话时长而定。
通过 Voice Agent API,将语音识别、语言模型推理、轮次处理、中断处理和 TTS 组合到单个 WebSocket 中,从而构建语音到语音代理。
借助实体检测、情感分析、主题检测、摘要和自定义格式化等功能,从转录文本中提取结构化洞察。
在语音和转录管道中应用脏话过滤、PII 音频脱敏、PII 文本脱敏和内容审核等护栏。
AssemblyAI 提供预录语音转文字、实时转录、Voice Agent API、Speech Understanding、Guardrails 和 LLM Gateway 等 API。该网站将其定位为面向构建可转录、理解并对语音采取行动的产品的开发者。
首页将该平台描述为面向需要生产级 API、可扩展语音基础设施以及适用于音频和语音应用的开发者友好型工作流的开发者和团队。
定价页面说明,预录转录按提交的音频小时数计费,流式传输按会话时长计费,Voice Agent API 按每小时 4.50 美元计费,或每分钟 0.075 美元。
有。定价页面说明可获得 50 美元免费额度,无需信用卡,并指出免费套餐和按量付费账户在并发方面有所不同。
定价页面说明,欧盟区域与美国同价,可通过 `api.eu.assemblyai.com` 和 `streaming.eu.assemblyai.com` 访问,以实现符合 GDPR 的数据驻留且不收取溢价。