模型信息
stepaudio-3-gen-preview 为限免期间使用的模型名称,限免到期后该预览版本将下线,并新增正式付费版本。核心能力
- 精细化声音设计与控制:支持通过自然语言控制多角色台词、音色风格、说话方式、语气情绪、方言口音,以及笑声、喘息、停顿等拟人化副语言特征。可在一条指令中描述多个角色及其互动关系,由模型完成对白组织和声音衔接,使生成结果更具连贯性和表现力。
- 全要素生成与时序编排:除人声外,同样支持音效、环境音、背景音乐与歌声的生成,并可通过规范化的自然语言指定各声音元素的出现位置与先后顺序,完成协同生成与片段衔接,满足完整音频作品的制作需要。
应用场景
- 专业内容生产:面向影视、游戏、动画、广播剧和有声书等专业场景,可灵活设计不同角色的音色与表达风格,快速完成角色配音与多角色对白;并可一并生成所需的环境音、音效与背景音乐,减少传统制作流程中的多工种协作与后期处理成本,提升内容生产效率。
- 短视频与自媒体:面向个人创作者的短视频配音场景,无需专业软件或音频制作经验,仅需一段规范化的自然语言描述,即可生成与视频内容匹配、风格可控的配音;并可按需补充背景音乐与音效,简化配音、选曲与混音等环节。
API 端点
音频生成 API
POST /v1/audio/generate相关资源
语音大模型总览
返回 Audio 3 系列模型总览。
完整定价详情
查看语音、文本、图像等全部模型的计费规则。
音频生成 API
查看音频生成请求参数与接口说明。
Demo 与体验中心
在线快速体验 StepAudio 3 Gen 的音频生成能力。