要让 OpenAI API 分析一张图片,应把提问文本和 input_image 放进同一条用户消息,而不是只把图片网址写成普通文字。下面用 Responses API 的 Python 调用展示公开图片 URL 的输入形式,并给出核对模型回答的方法。
准备图片和权限
先确认图片 URL 在未登录的浏览器窗口里能直接打开,而且是允许你发送给 API 的图片。不要为了测试把客户证件、医疗记录或内部截图放到公开图床。官方图像理解指南说明,图片可通过完整 URL、Base64 data URL 或文件 ID 传入;本例只使用 URL。图片会计入用量,尺寸、细节设置与模型都会影响成本。

发送看图问题
先按官方快速入门安装 Python SDK 并配置服务端 OPENAI_API_KEY。将下方官方示例图片 URL 保留作练习,运行后打开同一图片,亲自核对回答;你的项目可换成有权限使用的图片 URL。
from openai import OpenAI
client = OpenAI()
image_url = "https://api.nga.gov/iiif/a2e6da57-3cd1-4235-b20e-95dcaefed6c8/full/!800,800/0/default.jpg"
response = client.responses.create(
model="gpt-6-luna",
input=[{
"role": "user",
"content": [
{"type": "input_text", "text": "只描述画面中能直接看见的主体、颜色和位置;看不清的地方请说明不确定。"},
{"type": "input_image", "image_url": image_url, "detail": "auto"},
],
}],
)
print(response.output_text)
这里选用官方模型目录中的可处理图片输入的模型示例。若控制台提示模型不可用,请在自己的项目里改为有访问权限且支持图片输入的模型;不要把模型错误误判成图片上传失败。
逐项核对回答
- 先在浏览器打开原图,确保不是 403、登录页或被网站替换的缩略图。
- 把回答拆成“主体、颜色、位置”三列,只勾选原图能直接验证的部分。
- 涉及文字识别或细小对象时放大原图人工复核;模型即使语气确定也可能看错。
如果请求失败,先查 URL 可访问性、图像格式与模型权限;若请求成功但描述不准,可缩小任务范围,直接问一个可见细节。图像理解不是身份证明、医学诊断或安全审查的唯一依据。本文代码依据 2026 年 10 月 1 日官方文档,尚未在你的账号和图片上实测。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30918.html