跳到主要内容

输入关键词,快速查找站内精选内容。

← 返回教程
进阶·6 分钟阅读·

Gemini API 多模态入门:让模型读图并输出结构化结果

用一张图片和一个明确任务练习 Gemini API,不只看回答是否自然,更要检查结构化输出是否稳定。

Gemini多模态API结构化输出

完成后你将能够

  • 完成一次文本加图片的 Gemini API 调用
  • 把输出约束成可被程序消费的结构
  • 设计样例判断多模态结果是否可靠

步骤 1

先定义可判断任务

多模态入门不要从开放式鉴赏开始。选择一个结果能被人工快速核对的任务,例如读取截图中的表格字段、识别图片里的产品信息,或把手写便签整理成待办。

为每张图片提前写下你期望模型提取的字段。这样运行后能判断模型是确实理解了图像,还是只生成了看似合理的文本。

步骤 2

一次只接入一种输出格式

按照官方 getting started 文档完成一次文本和图片输入。提示词里明确字段名称、缺失字段处理方式和不要猜测的规则。

如果应用后续要自动处理结果,优先要求 JSON 结构,并在程序里校验字段是否存在、类型是否正确、值是否为空。

步骤 3

用反例建立信任边界

加入模糊、遮挡、低分辨率或无关图片,观察模型何时会拒绝、何时会猜测。把这些失败样例保留下来,作为后续迭代提示词和模型选择的基准。

当图片信息需要事实核验时,不要让视觉模型单独给最终结论,应接入原始系统记录、人工审核或检索来源。