Skip to main content
基于文本描述统一生成人声、音效、环境音和背景音乐等多种声音要素。

服务地址

POST https://api.stepfun.com/v1/audio/generate

请求头

  • Content-Type string required
    固定为 application/json
  • Authorization string required
    认证令牌,格式为 Bearer $STEP_API_KEY

请求参数

  • model string required
    模型名称,当前支持 stepaudio-3-gen-preview
  • task string required
    任务类型,当前仅支持 text_to_audio:通过自然语言描述设计音色,生成人声、音效、背景音乐等多种声音要素。使用该任务时,scriptsinstruction 至少必填其一,roles 选填。
  • roles array optional
    生成时使用的角色与音色描述,所有 namedescription 合计最多 500 个字符。
  • scripts array optional
    要生成的台词、音效或背景音乐描述,合计最多 1000 个字符。台词通过 speaker 指定说话人,并可用 () 描述说话的语气、风格、情绪等;音效和背景音乐描述用 [] 包裹,可不传 speaker
  • instruction string optional
    全局自然语言指导,用于设定环境、BGM 和情绪基调,最多 500 个字符。
  • response_format string optional
    返回音频格式,支持 wavmp3flacopuspcm
  • speed number optional
    语速,范围为 0.5~2。
  • volume number optional
    音量,范围为 0.1~2.0。
  • sample_rate integer optional
    采样率,支持 8000、16000、22050、24000 和 48000。
  • pronunciation_map object optional
    发音替换规则。
  • text_normalization string optional
    文本归一化策略,支持 standardenhanced
  • stream_format string optional
    返回模式,默认为 audioaudio 直接返回生成的音频,sse 通过 Server-Sent Events 持续返回 Base64 编码的音频分片。
  • return_url boolean optional
    是否返回音频 URL。
使用官方音色或复刻音色合成的参考音色任务(reference_to_audio)暂未开放,后续支持后会在本页补充。

请求示例

音频生成

限制与兼容性

  • instructionroles 字段最多 500 字符,scripts 字段最多 1000 字符。
  • stepaudio-3-gen-preview 不支持 voicevoice_labeltimestamp 参数。
  • 超出长度限制或传入不支持的参数时,接口返回 HTTP 400。