Ollama 支持视觉消息,不代表 Ollama 中每个模型都支持图片。是否能看图由具体模型和标签决定,DeepSeek-R1 的模型页应先作为能力核对入口。 模型库标签和视觉模型会更新,示例未在你的图片、模型版本和硬件上实测;不要把本地视觉模型输出直接用于医疗、身份或安全判断。
本篇验收要点:打开实际使用的模型页和标签,查找是否明确标注 vision 或图像输入,不能只看模型名里有 DeepSeek。 选择当前模型库明确支持视觉的模型,用一张可人工核对的简单图片发送 images 字段,并比较回答。

先区分运行平台与模型能力
Ollama Vision 文档说明如何把图片随消息发送,但能力取决于模型。DeepSeek-R1 模型页主要描述推理模型及不同参数版本;若当前标签未明确列出视觉能力,就不要假定它能理解 images。即使名称相近,社区改版也要单独核对来源与模型卡。
准备一张可人工验收的图片
创建只包含两个红色圆形和一个蓝色方块、无文字的测试图。选择模型库当前明确支持 vision 的模型。Python 客户端示意如下,模型名按实际列表替换:
from ollama import chat
response = chat(
model="YOUR_VISION_MODEL",
messages=[{
"role": "user",
"content": "只说明形状、颜色和数量;不确定就说不确定。",
"images": ["shapes.png"],
}],
)
print(response.message.content)
把“能接收”与“看正确”分开
请求不报错只说明接口接受了输入。人工核对回答是否包含两个红圆和一个蓝方块,再换一张不同组合复测。若模型忽略图片、只复述提示词或胡乱计数,记录为视觉任务未通过。真实文档、截图和照片还要检查分辨率、旋转、文字大小和隐私。
读者下一步是执行 ollama list,记录准确模型名与标签,然后打开对应模型页核对能力。
验证标准是模型页明确支持视觉、API 请求包含可读图片、回答正确指出图片中可核对的对象与数量;文本模型拒绝图片时不把它包装成成功。
常见问题
为什么 API 有 images 字段,模型仍看不懂?
字段属于接口能力,模型本身还必须经过视觉训练并在模型页声明支持。
视觉模型能代替 OCR 吗?
不能直接等同。需要精确文字和坐标时,使用 OCR 并按字符回查;视觉模型更适合整体理解和问答。
官方资料与适用边界
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31182.html