Skip to main content
本指南将帮助你快速上手 step-3.7-flash 的核心能力——原生多模态输入。你将学会如何让模型同时理解图片和文字、视频和文字。
所有示例都使用 Chat Completion API,模型原生支持多模态,无需额外配置视觉模型。

前置准备

1. 获取 API Key

访问 开放平台 获取 API 密钥。

2. 安装依赖

图片理解

step-3.7-flash 可以直接理解图片内容,无需额外的视觉模型。

最小示例

copy

使用 Base64 图片

如果你的图片是本地文件,可以转换为 Base64 编码:

使用 Files API 处理图片(推荐)

对于重复使用的图片,上传到阶跃文件存储可以加速访问:
白板转计划、票据转表格、截图生成代码等 prompt 模板见 场景示例

视频理解

step-3.7-flash 原生支持视频理解,无需额外模型。
视频建议:128 MB 以内、5 分钟以内的 MP4 格式。

最小示例

copy
录屏问题诊断、操作时间线整理等 prompt 模板见 场景示例

控制推理强度

step-3.7-flash 支持三档推理强度,可根据任务复杂度选择合适档位。Chat Completion API 使用 reasoning_effort;Messages API 使用 output_config.effort
copy

常用字段速查

image_url 字段

video_url 字段

常见问题

Q: 视频上传失败怎么办?

A: 确保视频满足以下条件:
  • 格式:MP4、QuickTime(.mov)或 Matroska(.mkv
  • 大小:128 MB 以内
  • 时长:5 分钟以内
如果视频超出限制,可以使用 ffmpeg 切割:

Q: 图片/视频返回速度慢?

A: 使用 Files API 上传文件到阶跃存储,使用 stepfile:// 格式可以加速访问。图片任务可先把图片缩放/压缩到合适尺寸(step-3.7-flash 的图片 token 随分辨率变化,更小的图更快、更省);视频任务建议控制文件大小和时长。

Q: 如何批量处理多张图片?

A: 在 content 数组中添加多个 image_url

Q: 支持哪些图片格式?

A: 支持 JPG/JPEG、PNG、GIF、WebP 格式。

Q: 支持哪些视频格式?

A: 支持 MP4、QuickTime(.mov)、Matroska(.mkv)格式。

下一步

场景示例

查看白板转计划、图表转数据、票据转表格等可复用任务模板。

图片理解最佳实践

深入了解图片理解的参数设置、detail 模式和性能优化。

视频理解最佳实践

深入了解视频理解的文件限制、价格预估和 ffmpeg 使用。

推理模型开发指南

了解推理模型在复杂任务、工具调用和长上下文中的推荐用法。