step-3.7-flash 可以把图片、视频和文本放在同一次对话中理解,适合把现实世界里的视觉信息转成计划、表格、代码草稿或问题诊断。本文收集一些常见场景的 prompt 模板,帮助你快速判断任务该怎么组织输入和输出。
使用建议
- 先明确输出格式:让模型输出 Markdown 表格、JSON、CSV 行或任务清单。
- 对关键字段要求保留证据:例如金额、日期、图表数值、任务 owner,需要让模型说明来源或不确定项。
- 不要让模型猜缺失信息:看不清、无法判断的字段应输出
null、空字符串或“无法确认”。 - 涉及财务、报销、合同、医疗等高风险数据时,需要人工复核。
白板转计划
适合处理会议白板、便利贴墙、手写流程图、项目讨论照片。目标是把松散信息转成可执行计划,而不是逐字转录。图表转数据
适合处理报告截图、仪表盘截图、柱状图、折线图、饼图等。目标是把图表内容转成结构化数据,并保留不确定性。图表截图中的数值可能受分辨率、压缩和坐标轴比例影响。需要精确计算时,应优先使用原始数据源;模型提取结果适合作为初稿或人工录入辅助。
票据转表格
适合处理收据、发票、报销单、购物小票等。目标是转成可直接写入表格的行数据,便于复制进表格或继续写入系统。截图生成代码
适合处理网页、移动端界面、组件截图和设计稿截图。目标是得到可继续修改的 HTML / React / Tailwind 初稿。录屏问题诊断
适合处理软件操作录屏、Bug 复现视频、App 使用路径、客服排障录屏等。目标是让模型还原用户动作、定位异常点并给出排查建议。多图对比
适合比较设计改版前后、商品图片差异、截图中的 UI 状态差异、文档扫描页差异等。结构化输出建议
当你需要把结果接入程序或表格时,建议显式要求 JSON 或 CSV,并说明空值策略:response_format 开启 JSON Mode。具体用法见 JSON Mode 使用建议 和 Chat Completions API。
对于需要人工复核的任务,可以让模型同时给出 confidence:
下一步
多模态快速上手
学习图片、视频、Base64 和 Files API 的基础调用方式。
Chat Completions API
查看
messages、image_url、video_url、reasoning_effort 等参数。手机操作 Agent
通过 GELab-Zero 连接 Android 真机,让模型规划手机操作。