- 全部模型
- 推理
- 视觉
- 语音
全部模型
全部公开模型
Step 5 Preview
新一代旗舰基模
最大上下文
1M
面向真实任务的新一代旗舰基模,重点覆盖编程与专业知识工作,原生支持文本、图片与视频输入,可结合工具与文档持续推进多步骤任务。API 模型 ID:step-5-preview。
开始使用
Step 3.7 Flash
多模态推理旗舰
最大上下文
256K
阶跃星辰旗舰多模态推理模型。在 step-3.5-flash 的高速推理与工具调用能力基础上,新增原生多模态输入能力,可直接理解图片和视频内容,无需借助视觉 MCP 或额外模型。支持三档推理强度(low/medium/high),是智能体、代码与多模态场景的快且可依赖的模型。
相关入口
Step 3.5 Flash
旗舰推理
最大上下文
256K
旗舰级推理模型,专为智能体构建而生。推理深度比肩顶尖闭源模型,同时具备极速响应与稳定可靠的工具调用能力。在通用推理能力基础之上,更擅长复杂项目规划与长程任务执行。
相关入口
Step 3.5 Flash 2603
Agent 优化
最大上下文
256K
基于 step-3.5-flash 针对高频 Agent 场景优化,在保留旗舰推理与工具调用能力的同时,进一步提升 Token 效率与推理速度,并支持切换低推理模式以降低消耗。对 Coding 与 Agent 框架兼容性也做了专项优化。
相关入口
Step-1o Turbo Vision
图像 / 视频理解
最大上下文
32K
典型应用场景有社媒发帖文案创作、AI 问答助手、图片与视频理解等。单次请求限制输入最多60张图片,总大小控制在20M 以内,输入视频为小于128MB 的 MP4文件。
相关入口
Step Image Edit 2
文生图 / 编辑一体化
提示词上限
512 字符
轻量级图像生成编辑模型,单模型同时支持文生图与图像编辑任务。6B 以下参数规模实现同量级性能标杆,可跨量级对标 12B-20B 级开源大模型;单次编辑 1-2 秒,适合实时交互修图。输入图片最大支持 4096x4096 分辨率。
相关入口
Step 2X Large
文生图
提示词上限
512 / 1024 字符
该模型生成图片质感真实,中英文文字生成能力强。输入文本最大长度:文生图 512 字符,图生图 1024 字符;输入图片需在10Mb 以内,像素不大于2048x2048,格式为 png 或 jpeg。单次可请求生成1张图像。
相关入口
StepAudio 3 Realtime
像真人一样聊,也能边想边做
交互模态
语音 ↔ 语音
面向实时互动的全双工语音旗舰。融合实时音频理解、自然打断、话权协调、自适应推理、边想边说与 Voice Agent 工具调用,简单问题快速回应,复杂任务边思考边表达,适合智能座舱、智能终端、客服和情感陪伴等场景。
相关入口
StepAudio 2.5 Chat
活人感对话大模型
输出模态
仅文本
真正具备”活人感”的对话大模型,仅文本返回。能深度理解复杂语意、机智抛梗,具备行业顶级副语言感知力——读懂语气中的迟疑与轻笑,输出高情商反馈。支持千万人设完全自定义,细颗粒度定义性格特征、专属口癖与情绪边界。
相关入口
StepAudio 3 TTS
真人级的说话表现
模型在音色基底、语调层次、节奏律动与气口停顿上高度贴合人类原生口语范式,能够呈现笑声、咂嘴、迟疑、结巴、重复和改口等真人级口语表现,并根据语义脉络自然表达情绪与语气变化。
相关入口
Step TTS Mini
高表现力 TTS
单次输入上限
1000 字符
支持中、英、日语、粤语、四川话,提供19种官方音色,兼具出色的音色复刻能力,支持中、英、日语复刻。适合客服外呼、情感陪伴、智能助手语音交互等对发音真人感要求高的场景。
相关入口
StepAudio 2.5 ASR
新一代流式 ASR 旗舰
模型规模
4B MTP
阶跃新一代流式语音识别模型,基于 4B MTP 架构,在识别准确率与响应延迟之间取得良好平衡。支持中英文识别与 ITN 文本规范化,适合实时字幕、语音输入、会议记录等对识别速度与准确率均有要求的场景。
相关入口
StepAudio 2 ASR Pro
32B ASR Pro
模型规模
32B
32B 参数的 ASR Pro 模型。
相关入口
Step ASR
实时 / 离线识别
单文件上限
100 MB
具有强大的中英文语音识别能力的 ASR 模型,能够自动区分语音和噪音,支持中英文混合语音识别和多种重口音普通话识别。可广泛应用于语音输入、语音控制、会议记录等场景。
相关入口
Step-1o Audio
稳定型
单次互动时长
30 分钟
提供超低延迟的双向交互语音对话体验,支持中文、英语、重口音普通话输入,支持中、英、日语、粤语和四川话输出。单次互动时长最长30分钟,可处理音频时长最长70分钟。已在智能座舱、智能终端、社交娱乐、情感陪伴、智能客服、金融调解等行业领域落地。
相关入口

