Skip to main content

模型概览

阶跃星辰提供两种语音对话方案,适用于不同的场景需求。StepAudio 3 Realtime 是当前面向实时互动场景的旗舰模型,重点提升全双工对话、边想边说和 Voice Agent 能力。查看更多 demo 以下模型可分别通过 Chat APIRealtime API 接入。

模型列表

StepAudio 3 Realtime

  • 定位:面向实时互动的全双工语音模型
  • 能力标签:真人自然交互、全双工对话、自适应推理、边想边说、Voice Agent
  • 体验入口:体验中心
  • StepAudio 3 Realtime 将实时音频理解、话轮管理、推理和工具调用整合到同一段对话中。模型不仅识别用户说了什么,还能理解语气、情绪、副语言线索与环境声音。
  • 支持自然打断、附和识别和话权协调:用户与模型可以同时说话,模型会在真正被打断时及时停下,在自然停顿或随口附和时保持对话连贯。
  • 面对简单问题可以快速回应;面对复杂任务,可以自适应进入更深入的思考,并通过边想边说降低等待感。
  • Voice Agent 可以在意图明确后调用工具或执行后端任务,任务运行期间对话仍可继续,结果返回后自然接入交流。
stepaudio-3-realtime-preview 为限免期间使用的模型名称,限免到期后该预览版本将下线,并新增正式付费版本。计费与限速策略以定价与限速页面为准。

StepAudio 3 Chat

  • 定位:面向 Chat Completions API 的语音理解与对话模型
  • 能力标签:语音输入、文本对话、上下文理解、工具调用
  • 通过 Chat API 接入,适合按轮次提交语音或文本并获取文本回复的场景。
  • 与 StepAudio 3 Realtime 共享 Audio 3 系列的声音理解与推理能力;如需语音流式输出和全双工交互,请使用 Realtime API。
stepaudio-3-chat-preview 为限免期间使用的模型名称,限免到期后该预览版本将下线,并新增正式付费版本。计费与限速策略以定价与限速页面为准。

业务场景应用

Realtime API 凭借实时交互与情感理解能力,已在多个行业领域实现成功落地:
  • 智能座舱:为车载系统提供自然语音交互界面,支持驾驶过程中的信息查询、闲聊对话和安全提醒
  • 智能终端:为各类 IOT 智能硬件设备提供实时语音交互能力,提升用户与设备间的交互体验
  • 社交娱乐:帮助社交平台和娱乐应用构建情感陪伴 Agent
  • 智能客服:实现高度拟人化的客户服务体验,提升服务效率和客户满意度
  • 金融调解:在金融纠纷处理过程中提供中立、专业的沟通辅助
通过集成 Realtime API,开发者可以快速构建具备人类般自然交流能力的应用,为用户带来真正沉浸式的语音交互体验。

模型快速入门

实时双向语音开发

了解 Realtime API 的事件模型、会话管理和语音交互流程。

语音对话开发

通过 Chat Completion 接口接入语音输入输出与音频流式能力。

Realtime API 事件文档

查看 Realtime API 的请求格式、事件字段和接口说明。

Realtime API Demo

参考官方前端演示项目,快速搭建实时语音对话控制台。