AssemblyAI

AssemblyAI

面向构建者的 Voice AI 基础设施AssemblyAI 将语音模型、API 与基础设施整合在一起,支持开发者在不同技术栈中构建语音产品。平台覆盖预录音语音转文字、实时语音转文字、语音理解、语音代理、Guardrails 与 LLM Gateway。

AssemblyAI 页面快照
99
支持的语言数量
200万小时/天
每天处理的音频时长
平台能力

从语音转写到智能交互的完整 API

根据音频处理、语音理解和智能代理等不同需求,AssemblyAI 提供可组合的模型与 API,支持从原型开发到生产部署。

预录音语音转文字

将预录音转换为可清理和定制的文字稿,支持 99 种语言,并提供自然语言提示能力。

实时语音转文字

以实时流式方式生成文字稿,帮助语音代理快速响应用户并减少误听。

语音理解

通过单次 API 调用提取说话人身份、情感、章节和摘要等信息,超越基础转写。

语音代理 API

构建具备回合检测与打断处理能力的生产级语音代理,减少实时交互开发复杂度。

Guardrails 与安全

在音频和文字稿处理过程中进行个人信息脱敏与内容审核,降低敏感数据进入日志或 LLM 的风险。

LLM Gateway

通过统一端点连接 GPT、Claude、Gemini 与社区模型,并提供内置回退机制。

最新动态

Universal-3.5 Pro 已发布

AssemblyAI 发布 Universal-3.5 Pro 旗舰语音转文字模型,面向真实场景中的音频处理,并支持实时与预录音音频。

Universal-3.5 Pro

新的旗舰语音转文字模型能够处理真实环境中的音频,并可用于实时和预录音场景。

开发资源

文档、API 参考与实践指南

开发者可以通过官方文档、API Reference 和 Cookbooks 了解集成方式、接口用法与构建步骤,并查看 Playground、Changelog 和服务状态。

AssemblyAI

从这里开始使用AssemblyAI。