Skip to main content
step-3.7-flash 可以把图片、视频和文本放在同一次对话中理解,适合把现实世界里的视觉信息转成计划、表格、代码草稿或问题诊断。本文收集一些常见场景的 prompt 模板,帮助你快速判断任务该怎么组织输入和输出。
这些示例侧重任务设计和输出格式。代码调用方式请先参考 快速上手;图片、视频的细节参数请参考 图片理解最佳实践视频理解最佳实践

使用建议

  • 先明确输出格式:让模型输出 Markdown 表格、JSON、CSV 行或任务清单。
  • 对关键字段要求保留证据:例如金额、日期、图表数值、任务 owner,需要让模型说明来源或不确定项。
  • 不要让模型猜缺失信息:看不清、无法判断的字段应输出 null、空字符串或“无法确认”。
  • 涉及财务、报销、合同、医疗等高风险数据时,需要人工复核。

白板转计划

适合处理会议白板、便利贴墙、手写流程图、项目讨论照片。目标是把松散信息转成可执行计划,而不是逐字转录。
推荐输出:

图表转数据

适合处理报告截图、仪表盘截图、柱状图、折线图、饼图等。目标是把图表内容转成结构化数据,并保留不确定性。
图表截图中的数值可能受分辨率、压缩和坐标轴比例影响。需要精确计算时,应优先使用原始数据源;模型提取结果适合作为初稿或人工录入辅助。

票据转表格

适合处理收据、发票、报销单、购物小票等。目标是转成可直接写入表格的行数据,便于复制进表格或继续写入系统。
如果你希望直接粘贴到电子表格,可以让模型改成 CSV:

截图生成代码

适合处理网页、移动端界面、组件截图和设计稿截图。目标是得到可继续修改的 HTML / React / Tailwind 初稿。
如果截图里包含大量文字,建议先让模型做一次“页面结构分析”,再让它生成代码。这样更容易减少布局遗漏。

录屏问题诊断

适合处理软件操作录屏、Bug 复现视频、App 使用路径、客服排障录屏等。目标是让模型还原用户动作、定位异常点并给出排查建议。
推荐输出:

多图对比

适合比较设计改版前后、商品图片差异、截图中的 UI 状态差异、文档扫描页差异等。

结构化输出建议

当你需要把结果接入程序或表格时,建议显式要求 JSON 或 CSV,并说明空值策略:
如果下游程序需要稳定解析 JSON,可以配合 response_format 开启 JSON Mode。具体用法见 JSON Mode 使用建议Chat Completions API 对于需要人工复核的任务,可以让模型同时给出 confidence

下一步

多模态快速上手

学习图片、视频、Base64 和 Files API 的基础调用方式。

Chat Completions API

查看 messagesimage_urlvideo_urlreasoning_effort 等参数。

手机操作 Agent

通过 GELab-Zero 连接 Android 真机,让模型规划手机操作。