Skip to main content
StepAudio 3 TTS 生成贴近真人的自然语音,在音色、语调、节奏和气口停顿上高度还原真实口语表现。技术报告

模型信息

核心能力

  • 真人级的说话表现:模型在音色基底、语调层次、节奏律动与气口停顿上高度贴合人类原生口语范式,彻底挣脱机器朗读的生硬桎梏与固化韵律模板。模型还原的不只是字面内容,更是人在说话时的最真实状态——笑声、咂嘴、迟疑、结巴、重复与改口等真人级口语表现,还能根据语义脉络自主推演情绪与语气的微妙变化。听到的始终是“一个人在说话”,而不是“一段被合成的语音”。
  • 超低时延流式生成:依托流式生成架构,一边生成一边输出,无需等待整句合成完成即可开始播放,可无缝对接实时对话业务链路,极大压缩交互等待窗口。
适合实时对话、语音助手和高表现力内容生成。

API 端点

非流式合成

POST /v1/audio/speech

流式合成

WebSocket /v1/realtime/audio

相关资源

语音大模型总览

返回 Audio 3 系列模型总览。

完整定价详情

查看语音、文本、图像等全部模型的计费规则。

音色列表

查看官方提供的音色及参数说明。

Demo 与体验中心

在线快速体验 StepAudio 3 TTS 的完整能力。