Skip to main content

模型概览

阶跃语音系列模型覆盖实时语音互动、综合音频生成、文本转语音和自动语音识别,提供从文字到音频、从语音到文字以及端到端语音对话的完整能力,适用于配音、语音助手、智能硬件、Voice Agent、音乐创作、实时字幕和会议记录等场景。

模型列表

StepAudio 3 Realtime

  • 真人自然交互:接话自然、节奏松弛、表达有温度,实时互动更接近真人交流。
  • 听懂话,也听懂话外之音:理解语气、情绪、副语言线索和环境声音。
  • 真正的全双工对话:支持自然打断、附和识别和话权协调,不抢话也不装聋。
  • 自适应推理:简单问题快速回应,复杂问题边想边说,在响应速度和回答质量之间动态平衡。
  • 从会聊天到能办事:Voice Agent 可调用工具或执行后端任务,任务完成后自然回到对话。

StepAudio 3 Realtime

查看模型 ID、API 端点、能力说明和计费状态。

StepAudio 3 TTS

  • 真人级说话表现:在音色、语调、节奏和气口停顿上贴近自然口语,可呈现笑声、迟疑、结巴、重复和改口等真实表达。
  • 超低时延流式生成:支持边生成边输出,适合实时对话和语音助手。
  • 高表现力控制:支持从整体语境到局部表达的细致控制,适合有声内容、配音和情绪化播报。

StepAudio 3 TTS

查看 TTS 能力和 API 端点。

StepAudio 3 Gen

  • 综合音频内容创作:用自然语言描述角色设定、音色风格和情绪表达,即可生成富有表现力、可精细控制的人声,并统一编排音效、环境音、背景音乐与歌声。
  • 精细化声音设计与控制:支持通过自然语言控制多角色台词、音色风格、说话方式、语气情绪、方言口音,以及笑声、喘息、停顿等副语言特征,可在一条指令中描述多个角色及其互动关系。
  • 全要素生成与时序编排:可指定人声、音效、环境音和背景音乐的出现位置与先后顺序,完成协同生成与片段衔接。
  • 专业内容生产:适用于影视、游戏、动画、广播剧和有声书等场景,快速完成角色配音、多角色对白及配套的环境音、音效和背景音乐。
  • 短视频与自媒体:无需专业音频制作经验,一段规范化的自然语言描述即可生成风格可控的配音,并按需补充背景音乐和音效。

StepAudio 3 Gen

查看 Gen 能力和 API 端点。

StepAudio 3 Music

  • 歌词成歌:根据歌词和自然语言风格描述,生成包含人声、旋律、编曲和混音的完整歌曲。
  • 纯音乐生成:根据场景、情绪、节奏和乐器描述生成无演唱人声的音乐。
  • 歌曲翻唱与风格切换:参考歌曲旋律,重新控制风格、人声、编曲和情绪。
  • 干声智能配乐:分析清唱人声的旋律、速度、节拍和情绪,生成匹配的和声、节奏与器乐编配。
  • 自然语言音乐控制:可组合描述曲风、人声、乐器、情绪、调式和制作质感,降低音乐创作门槛。

StepAudio 3 Music

查看音乐生成能力、任务类型和 API 端点。

StepAudio 3 ASR

  • 语境理解:以大语言模型为语义底座,结合音频、上下文和领域知识,提升专业术语、人名和同音词识别。
  • 跨语言、跨场景提升:覆盖中文、英文、方言、中英混说、长音频和垂类领域。
  • 复杂声音处理:支持悄悄话、极快语速、含糊连读、环境噪声、歌唱和背景音乐。
  • 低误识别:无语音测试准确率达到 99%,减少环境声、背景音乐和静音片段的误转写。
  • 评测亮点:内部上下文推理错误率 0.57%,较 StepAudio 2.5 ASR 降低 64.2%;AISHELL-6 悄悄话 CER 为 3.97%。

StepAudio 3 ASR

查看 ASR 系列能力、当前模型和识别 API。
关于 StepAudio 2.5 系列的对话模型,我们提供了两种不同的方式调用最新的语音对话模型,分别对应 StepAudio 2.5 Realtime 和 StepAudio 2.5 Chat:
  • StepAudio 2.5 Realtime,支持实时语音对话的 Realtime 交互形式,使用 websocket 协议,支持语音请求、语音回复,便于直接使用我们封装好的一整套实时对话能力使用。
  • StepAudio 2.5 Chat,支持按轮次对话的 Chat Comletion 交互形式,支持单次提交语音请求、流式文本输出回复内容,便于基于接口和模型能力进行接入和开发。

StepAudio 2.5 Realtime

真正具备“活人感”的实时语音大模型。全维度打造专属人设,连每一次呼吸和轻笑都不掉戏。
  1. 情绪价值:不再是冰冷的 AI,而是有脾气、有态度、懂接梗的鲜活搭子,为你带来最自然、好玩的陪伴体验。
  2. 对话双商领跑:实现对话智商与情商的双重跃升。不仅能深度理解复杂语意、机智抛梗,更具备行业顶级副语言感知力——瞬间读懂你语气中的迟疑与轻笑,极速输出契合度拉满的高情商反馈。
  3. 副语言感知:不仅能深度理解复杂语意、机智抛梗,更具备行业顶级副语言感知力——瞬间读懂你语气中的迟疑与轻笑,极速输出契合度拉满的高情商反馈。
  4. 千万人设完全自定义:真正实现“全维灵魂捏脸”,彻底打破预设模板束缚。支持细颗粒度定义性格特征、专属口癖与情绪边界,随心打造千万种独一无二的专属搭子。
  5. 贴合语境神级表现力:在声音表现层面,StepAudio 2.5 Realtime 全面继承了业内顶尖的 StepAudio 2.5 TTS 能力,理解与生成的深度融合,结合强化学习训练,实现了“Global 全局场景定调”与“句内细节雕琢”的双重能力。能够精准洞察对话氛围,极细颗粒度地拿捏语速、重音与潜台词;发声时自然融入轻笑、叹息等真实细节,让每一次开口都与当下的交流场景完美契合。
情感陪伴、日常交流、百科问答、任务助手等日常实时沟通交互对话全场景。

StepAudio 2.5 Chat

真正具备“活人感”的对话大模型。全维度打造专属人设,连每一次呼吸和轻笑都不掉戏。
  1. 情绪价值:不再是冰冷的 AI,而是有脾气、有态度、懂接梗的鲜活搭子,为你带来最自然、好玩的陪伴体验。
  2. 对话双商领跑:实现对话智商与情商的双重跃升。不仅能深度理解复杂语意、机智抛梗,更具备行业顶级副语言感知力——瞬间读懂你语气中的迟疑与轻笑,极速输出契合度拉满的高情商反馈。
  3. 副语言感知:不仅能深度理解复杂语意、机智抛梗,更具备行业顶级副语言感知力——瞬间读懂你语气中的迟疑与轻笑,极速输出契合度拉满的高情商反馈。
  4. 千万人设完全自定义:真正实现“全维灵魂捏脸”,彻底打破预设模板束缚。支持细颗粒度定义性格特征、专属口癖与情绪边界,随心打造千万种独一无二的专属搭子。

StepAudio 2.5 TTS

Contextual TTS,真正具有声音表演能力的语音合成模型。首次将语境理解能力引入语音生成全流程,让 AI 不是念文本,而是演文本。支持通过自然语言描述实现全局语境定调与句中细腻控制,生成具有呼吸感、轻重主次、情绪弧线的真人级表达。
  1. 双档语境控制,人人都是配音导演
    • 通过 Global Context(全局语境)+ Inline Context(文中语境)双档控制,既能为整段内容定调氛围和人物关系,也能逐句精控每个字词如何演绎。
    • 告别传统标签匹配,用自然语言描述你想要的声音表达。情绪、风格、场景、说话状态,模型都能理解并精准执行。
    • 支持「克制的悲伤,不哭腔,轻轻发颤」「试探着撒娇,不是很黏,带一点嘴硬」这类复杂、混合、有层次的表达意图,实现更开放、更连续、也更贴近真实语境的情绪控制。
  2. Zero-shot Clone 全音色可控,百变音色随心复刻
    • 只需 3s 参考音频即可进行音色复刻,且完整继承全局 / 文中语境控制能力,不受固定音库和预设角色的限制。
  3. 字字有戏,句句真实,开口没有 AI 味
    • 在停顿、重音、节奏、语气转折等韵律维度上全面提升,合成语音有呼吸感、有轻重主次、有情绪起伏。
    • 底层人声品质升级,输出的声音更通透、更具拟人感,没有传统语音合成常见的“塑料感”和“AI 味”。
有声书、短剧配音、广告旁白、情感叙事、内容二创等多种对语音表现力有高要求的场景。

StepAudio 2.5 ASR

阶跃新一代语音识别模型,4B 参数 + Multi-Token Prediction(MTP)架构。在保持 SOTA 转写精度的同时单步并行预测多个 Token,大幅削减串行等待——5 分钟音频可在 1 秒内完成转写。提供一次性提交(SSE,模型字符串 stepaudio-2.5-asr)与实时双向流式(WebSocket,模型字符串 stepaudio-2.5-asr-stream)两种接入方式。
  1. 极速推理,吞吐与时延双线突破
    • 引入 MTP 技术单步并行预测多个 Token,吞吐量较传统 ASR 提升 400%,时延降低 60%。
    • 引擎侧 RTF ≈ 0.0053,转写 1 小时音频约需 19 秒,5 分钟音频 1 秒内出完整结果。
  2. SOTA 转写精度,多场景全面刷新基线
    • 基于 4B 参数深度优化,在新闻、会议、强噪声等多场景下,中英文错误率全面刷新行业基线。
    • 支持 ITN 文本规范化,转写结果可直接用于业务系统。
  3. 进阶识别能力
    • 双向流式(stepaudio-2.5-asr-stream)支持累计全量文本、可纠错尾词与字级时间戳,适合实时对话、语音助手、会议字幕。
    • 音频文件识别支持分句与字 / 词级时间戳、双声道分轨,以及说话人识别(区分同一段音频中的不同说话人)。
  4. 极致性价比,Step Plan 直接可用
    • 一次性提交(SSE)API 定价 0.15 元 / 小时,仅为上代 step-asr 系列的 1/10;双向流式 1.2 元 / 小时。
    • Step Plan 订阅用户可直接调用,无需额外开通。
Voice Agent、大规模批量转写、实时字幕 / 直播、会议记录、语音输入等对识别速度与准确率均有要求的场景。

Step Audio 2

  • 定位:全方位感官理解与端到端自然交互
  • 能力标签:音色复刻、Tool Call、网络搜索
  • 体验入口:体验中心
  • 在语言方面能够理解中文普通话、中文方言、英语、日语。支持语音复刻(通过上传音色片段实现自定义音色)。在能力方面能够理解环境声音事件、人类副语言和语音中的情绪、根据声音推测用户年龄、理解音乐,能够控制不同的语速、语调和情感进行表达,具备原生的 Tool Call 和 网络搜索 能力。

Step Audio 2 Mini

  • 定位:轻盈、极速而又不失深度
  • 能力标签:Tool Call、网络搜索
  • 接入方式:仅支持 API 接入
  • step-audio-2 模型相似,原生的 Tool Call 和网络搜索能力,效果得分在指令遵循、数理和推理任务上略低于 step-audio-2。模型推理速度更快,需要的资源更少。

StepAudio 2 ASR Pro

32B 参数的 ASR Pro 模型。

Step Audio R1.5

  • 定位:深度声音理解与推理(Step Audio R1.1 升级版)
  • 能力标签:边说边想、深度推理、自然交互
  • 体验入口:体验中心
  • 在 Step Audio R1.1 的基础上升级,进一步强化声音细节分析与逻辑推理能力,能听懂语气背后的深意,大幅提高对声音和情绪的理解。
  • 引入基于人类反馈的强化学习(RLHF),在保持推理能力的同时,提升长程语音对话的自然度与情感连贯性。
  • 推理和说话并发进行,在保证高质量回复的同时实现更快响应。
原 Step Audio R1.1 已升级为 Step Audio R1.5,并结束限时免费,按文本 token 计费。计费标准请见定价与限速

Step-1o Audio

  • 定位:稳定型,久经考验
  • 能力标签:Tool Call
  • 接入方式:仅支持 API 接入
  • 第一代 端到端语音模型。技术成熟稳定,在汽车场景下大规模部署,久经考验,支持多种预置音色风格,支持工具调用。适用于构建基础的语音交互、内容生成等常规业务场景。
应用案例
  • 情感陪伴场景:在用户分享人生重要时刻时,如相亲成功经历,模型能够表达恰当的祝贺,提出深入问题,并展现真实的情感共鸣。
  • 安全驾驶辅助:识别驾驶者疲劳状态下的语音特征,给予针对性的安全建议,同时通过情感支持缓解疲劳感。
  • 方言交互能力:精准模拟地方方言特性,如四川话的音调起伏和特色词汇运用,提供本地化的语音交互体验。
  • 如何与男朋友撒娇:以自然可爱且略带俏皮的语气,示范与亲密关系间的撒娇互动,增强关系亲密度。
  • 亲子关系支持:针对家长首次送孩子入学等敏感场景,理解并安抚焦虑情绪,同时提供实用的适应性建议。

Step TTS 2

step-tts-mini 的升级版:极简高效设计摒弃传统 speaker/emotion 嵌入模块,通过纯 NTP 实现端到端语音生成,大幅降低系统复杂度。支持 step-tts-mini 全部音色、情绪、风格、语种,并在其基础上,进一步强化情绪与风格的可控度情绪表现力音色复刻效果
  1. 11 种情绪 17种风格 3种语言精准可控,情绪饱满,韵律自然,表现力强
    • 内置 11 种情绪 与 17 种风格 控制,覆盖从温柔甜美到严肃豪爽的多样化表达。语气、韵律与停连更贴近真人情绪起伏。
    • 完美适配需要情绪张力的配音与对话。
    • 支持粤语、四川话、日语。
  2. 10s 音频,精准复刻,0成本支持全部情绪风格控制
    • 仅需约 10 秒参考音频,即可精准复刻音色,并零成本激活全部情绪与风格控制;
    • 适合需要用复刻后的音色 + 多情绪播报的场景,如短视频配音、情感陪聊、营销播报等。
  3. 音色复刻支持口音精准还原
    • 领先的 LLM-based 架构,相较同类产品,可提供对说话人口音细节更精准的复刻效果。
    • 直播带货 场景提供更加真实、自然的语音交互体验,有效提升观众沉浸感和信任度。让虚拟主播或智能话术如同真人般亲切生动,显著降低用户听觉疲劳,助力转化率提升。

Step TTS Mini

强大的文本转语音模型,以高情绪表现力和风格可控性为亮点。
  1. 11 种情绪、7种风格、3种语言可控:内置 9 种情绪 与 13 种风格 控制;支持粤语、四川话、日语。
  2. 10s 音频,精准复刻,0成本支持全部情绪风格控制:仅需约 10 秒参考音频,即可精准复刻音色,并零成本激活全部情绪与风格控制。复刻相似度业界领先。

Step ASR

阶跃自动语音识别模型,支持实时与离线识别,具备高准确率与低延迟。 特点:
  • 支持中英文及多种方言;
  • 可应用于语音转写、会议记录、客服质检、语音搜索等场景。

Step ASR 1.1

阶跃自动语音识别模型,适用于音频文件识别场景。 特点:
  • 可应用于语音转写、会议记录、客服质检、语音搜索等场景。

Step ASR 1.1 Stream

阶跃自动语音识别模型,适用于流式语音识别场景。 特点:
  • 适用于实时语音输入与流式文本返回场景。

使用限制

  1. 单次请求支持的最大字符数:tts 模型单次最多支持输入 1000 个字符。
  2. 输出格式:支持 wav、mp3、flac、opus,默认为 mp3 格式。
  3. StepAudio 3 Gen 输入限制instructionroles 字段最多 500 字符,scripts 字段最多 1000 字符;超出限制时接口返回 HTTP 400。
  4. StepAudio 3 Gen 返回方式:当前支持 HTTP audio / sse 返回,不支持 WebSocket 双向流式。

模型快速入门

音频合成开发指南

了解语音生成、音色复刻和语音识别等能力的接入方式。