step-3.7-flash 的核心能力——原生多模态输入。你将学会如何让模型同时理解图片和文字、视频和文字。
所有示例都使用 Chat Completion API,模型原生支持多模态,无需额外配置视觉模型。
前置准备
1. 获取 API Key
访问 开放平台 获取 API 密钥。2. 安装依赖
图片理解
step-3.7-flash 可以直接理解图片内容,无需额外的视觉模型。
最小示例
- Python
- curl
copy
使用 Base64 图片
如果你的图片是本地文件,可以转换为 Base64 编码:使用 Files API 处理图片(推荐)
对于重复使用的图片,上传到阶跃文件存储可以加速访问:视频理解
step-3.7-flash 原生支持视频理解,无需额外模型。
视频建议:128 MB 以内、5 分钟以内的 MP4 格式。
最小示例
- Python
- curl
copy
控制推理强度
step-3.7-flash 支持三档推理强度,可根据任务复杂度选择合适档位。Chat Completion API 使用 reasoning_effort;Messages API 使用 output_config.effort。
- Chat Completion API
- Messages API
- Python
copy
常用字段速查
image_url 字段
video_url 字段
常见问题
Q: 视频上传失败怎么办?
A: 确保视频满足以下条件:- 格式:MP4、QuickTime(
.mov)或 Matroska(.mkv) - 大小:128 MB 以内
- 时长:5 分钟以内
Q: 图片/视频返回速度慢?
A: 使用 Files API 上传文件到阶跃存储,使用stepfile:// 格式可以加速访问。图片任务可先把图片缩放/压缩到合适尺寸(step-3.7-flash 的图片 token 随分辨率变化,更小的图更快、更省);视频任务建议控制文件大小和时长。
Q: 如何批量处理多张图片?
A: 在content 数组中添加多个 image_url:
Q: 支持哪些图片格式?
A: 支持 JPG/JPEG、PNG、GIF、WebP 格式。Q: 支持哪些视频格式?
A: 支持 MP4、QuickTime(.mov)、Matroska(.mkv)格式。
下一步
场景示例
查看白板转计划、图表转数据、票据转表格等可复用任务模板。
图片理解最佳实践
深入了解图片理解的参数设置、detail 模式和性能优化。
视频理解最佳实践
深入了解视频理解的文件限制、价格预估和 ffmpeg 使用。
推理模型开发指南
了解推理模型在复杂任务、工具调用和长上下文中的推荐用法。