要让 Gemini 描述一张本地图片,可以先通过官方 Files API 上传,再把上传后返回的 URI 与问题一起交给图像模型。它适合提取可见物体、文字线索和画面关系;回答仍要对照原图检查,尤其不能凭描述确定人物身份或推断图片没有展示的事实。
准备一张可核对的测试图
先自己制作一张简单图片,例如白纸上放一个红杯和蓝笔,拍照保存为 sample.jpg。记录你确实看见的物体、颜色与位置,这就是稍后核对回答的基准。避免先上传证件、病历或未获授权的人像。安装官方 Python SDK,并把 API key 配在当前终端的 GEMINI_API_KEY 环境变量中;不要把密钥写进脚本或截图。

python -m pip install -U google-genai
上传图片并提出可验证的问题
下面的代码按 Google 的图像理解文档使用 Files API 和 Interactions API。模型名以该文档当前示例为准;若你的账号提示模型不可用,先在官方模型列表核对可用版本,不要只改一个猜测的名称。
from google import genai
client = genai.Client()
photo = client.files.upload(file="sample.jpg")
answer = client.interactions.create(
model="gemini-3.8-flash",
input=[
{"type": "text", "text": "只描述图片中能直接看到的物体、颜色和相对位置;看不清的地方写不确定。"},
{"type": "image", "uri": photo.uri, "mime_type": photo.mime_type},
],
)
print(answer.output_text)
将代码存为 inspect_photo.py,与图片放在同一目录运行。输出应是一段描述文字;这只是预期输出类型,不是本文替你跑出的实测结果。逐项比对“红杯”“蓝笔”和相对位置,发现凭空添加的物体就标记为错误,并把提问收窄到单个目标。
读不出来时先查哪里
- 报找不到文件:确认脚本当前目录和
sample.jpg路径;可以暂时打印文件是否存在,勿打印密钥。 - 认证或模型错误:确认 API key 已在同一终端生效,再查看账号可用模型与地区限制;模型及配额会变化。
- 颜色或文字说错:裁剪目标区域、提高原图清晰度,要求模型列出不确定项;仍不确定时人工看原图,不要把模型描述当成识别证据。
本例是按官方接口编写的教学演示,未在你的账号上调用,也没有对模型准确率做实测。Google 文档核对于 2026 年 10 月 1 日,实际接口与可用模型请以使用时的官方页面为准。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31302.html