模型信息
核心能力
- 真人级的说话表现:模型在音色基底、语调层次、节奏律动与气口停顿上高度贴合人类原生口语范式,彻底挣脱机器朗读的生硬桎梏与固化韵律模板。模型还原的不只是字面内容,更是人在说话时的最真实状态——笑声、咂嘴、迟疑、结巴、重复与改口等真人级口语表现,还能根据语义脉络自主推演情绪与语气的微妙变化。听到的始终是“一个人在说话”,而不是“一段被合成的语音”。
- 超低时延流式生成:依托流式生成架构,一边生成一边输出,无需等待整句合成完成即可开始播放,可无缝对接实时对话业务链路,极大压缩交互等待窗口。
API 端点
非流式合成
POST /v1/audio/speech流式合成
WebSocket /v1/realtime/audio相关资源
语音大模型总览
返回 Audio 3 系列模型总览。
完整定价详情
查看语音、文本、图像等全部模型的计费规则。
音色列表
查看官方提供的音色及参数说明。
Demo 与体验中心
在线快速体验 StepAudio 3 TTS 的完整能力。