stepaudio-2.5-asr 是 4B 参数的语音识别模型。引入 Multi-Token Prediction(MTP)技术实现单步并行预测多个 Token,在保持 SOTA 转写精度的同时大幅削减串行等待周期——5 分钟音频可在 1 秒内完成转写。
在线体验
访问官方 Demo 页面,快速感受模型效果。
API 快速开始
查看最小可运行的 curl 调用示例。
Step Plan 接入
Step Plan 订阅用户可直接使用。
关键信息
模型架构
4B MTP
引擎侧 RTF
≈ 0.0053
转写 1 小时音频约需 19 秒
转写 1 小时音频约需 19 秒
API 定价
0.15 元 / 小时
核心能力
⚡ 极速推理
引入 MTP(Multi-Token Prediction)技术,单步并行预测多个 Token,吞吐量较传统 ASR 提升 400%,时延降低 60%,5 分钟音频 1 秒内出完整转写结果。
🎯 SOTA 转写精度
基于 4B 参数深度优化,在新闻、会议、强噪声等多场景下,中英文错误率全面刷新行业基线。
适用场景
Voice Agent、大规模转写服务、实时字幕 / 直播。API 端点
StepAudio 2.5 ASR 提供四种接入方式:音频转写(同步)、音频文件异步识别、一次性提交的 SSE(均使用模型字符串stepaudio-2.5-asr)与实时双向流式的 WebSocket(模型字符串 stepaudio-2.5-asr-stream)。
语音识别(流式返回文本)
POST /v1/audio/asr/sse一次性提交音频,SSE 流式返回识别文本。
流式语音识别(双向流式)
WSS /v1/realtime/asr/streamWebSocket 实时双向流式,适合对话与会议字幕场景。
音频文件识别
POST /v1/audio/asr/file/submit提交音频文件异步识别,支持说话人识别与声道分轨。
音频转写
POST /v1/audio/transcriptions上传音频文件,同步返回完整文本,最简接入方式。
定价
stepaudio-2.5-asr 仅为上代 step-asr 系列的 1/10。Step Plan 用户可直接使用。查看完整定价详情 →
快速上手
transcript.text.delta 事件并以 transcript.text.done 结束。
相关资源
Demo Page
产品 Demo 页面。
Model Card
模型卡,查看架构与评测细节。
语音识别(流式返回文本)API
查看完整参数、响应事件、错误处理。
Step Plan 接入
Step Plan 订阅下的 ASR 调用路径。