Skip to main content
stepaudio-2.5-asr 是 4B 参数的语音识别模型。引入 Multi-Token Prediction(MTP)技术实现单步并行预测多个 Token,在保持 SOTA 转写精度的同时大幅削减串行等待周期——5 分钟音频可在 1 秒内完成转写。

在线体验

访问官方 Demo 页面,快速感受模型效果。

API 快速开始

查看最小可运行的 curl 调用示例。

Step Plan 接入

Step Plan 订阅用户可直接使用。

关键信息

模型架构

4B MTP

引擎侧 RTF

≈ 0.0053
转写 1 小时音频约需 19 秒

API 定价

0.15 元 / 小时

核心能力

⚡ 极速推理

引入 MTP(Multi-Token Prediction)技术,单步并行预测多个 Token,吞吐量较传统 ASR 提升 400%,时延降低 60%,5 分钟音频 1 秒内出完整转写结果。

🎯 SOTA 转写精度

基于 4B 参数深度优化,在新闻、会议、强噪声等多场景下,中英文错误率全面刷新行业基线。

适用场景

Voice Agent、大规模转写服务、实时字幕 / 直播。

API 端点

StepAudio 2.5 ASR 提供四种接入方式:音频转写(同步)、音频文件异步识别、一次性提交的 SSE(均使用模型字符串 stepaudio-2.5-asr)与实时双向流式的 WebSocket(模型字符串 stepaudio-2.5-asr-stream)。

语音识别(流式返回文本)

POST /v1/audio/asr/sse
一次性提交音频,SSE 流式返回识别文本。

流式语音识别(双向流式)

WSS /v1/realtime/asr/stream
WebSocket 实时双向流式,适合对话与会议字幕场景。

音频文件识别

POST /v1/audio/asr/file/submit
提交音频文件异步识别,支持说话人识别与声道分轨。

音频转写

POST /v1/audio/transcriptions
上传音频文件,同步返回完整文本,最简接入方式。

定价

stepaudio-2.5-asr 仅为上代 step-asr 系列的 1/10。Step Plan 用户可直接使用。查看完整定价详情 →

快速上手

服务端会逐步发送 transcript.text.delta 事件并以 transcript.text.done 结束。

相关资源

Demo Page

产品 Demo 页面。

Model Card

模型卡,查看架构与评测细节。

语音识别(流式返回文本)API

查看完整参数、响应事件、错误处理。

Step Plan 接入

Step Plan 订阅下的 ASR 调用路径。