服务地址
POST https://api.stepfun.com/v1/audio/generate
请求头
Content-Typestringrequired
固定为application/json。Authorizationstringrequired
认证令牌,格式为Bearer $STEP_API_KEY。
请求参数
-
modelstringrequired
模型名称,当前支持stepaudio-3-gen-preview。 -
taskstringrequired
任务类型,当前仅支持text_to_audio:通过自然语言描述设计音色,生成人声、音效、背景音乐等多种声音要素。使用该任务时,scripts或instruction至少必填其一,roles选填。 -
rolesarrayoptional
生成时使用的角色与音色描述,所有name和description合计最多 500 个字符。 -
scriptsarrayoptional
要生成的台词、音效或背景音乐描述,合计最多 1000 个字符。台词通过speaker指定说话人,并可用()描述说话的语气、风格、情绪等;音效和背景音乐描述用[]包裹,可不传speaker。 -
instructionstringoptional
全局自然语言指导,用于设定环境、BGM 和情绪基调,最多 500 个字符。 -
response_formatstringoptional
返回音频格式,支持wav、mp3、flac、opus和pcm。 -
speednumberoptional
语速,范围为 0.5~2。 -
volumenumberoptional
音量,范围为 0.1~2.0。 -
sample_rateintegeroptional
采样率,支持 8000、16000、22050、24000 和 48000。 -
pronunciation_mapobjectoptional
发音替换规则。 -
text_normalizationstringoptional
文本归一化策略,支持standard和enhanced。 -
stream_formatstringoptional
返回模式,默认为audio:audio直接返回生成的音频,sse通过 Server-Sent Events 持续返回 Base64 编码的音频分片。 -
return_urlbooleanoptional
是否返回音频 URL。
使用官方音色或复刻音色合成的参考音色任务(
reference_to_audio)暂未开放,后续支持后会在本页补充。请求示例
音频生成
限制与兼容性
instruction和roles字段最多 500 字符,scripts字段最多 1000 字符。stepaudio-3-gen-preview不支持voice、voice_label、timestamp参数。- 超出长度限制或传入不支持的参数时,接口返回 HTTP 400。