Depth Anything V2 可以从一张照片预测相对深度。它适合查看前后层次、准备视觉效果参考,但普通相对深度检查点不提供已校准的米制距离。先把“能看到层次”和“能量出几米”分开。
准备一张容易核对的照片
选自己拍摄的照片,包含近处杯子、中景桌沿和远处墙面。保留原图,避开只拍白墙的输入。下面用官方 README 给出的 Transformers Small 检查点;首次运行需要下载权重,示例没有在本文执行模型推理。安装匹配的 torch、transformers 与 Pillow,并保存实际版本。

生成可视化副本
from PIL import Image
from transformers import pipeline
image = Image.open("scene.jpg").convert("RGB")
pipe = pipeline(task="depth-estimation",
model="depth-anything/Depth-Anything-V2-Small-hf")
result = pipe(image)
result["depth"].save("scene-depth.png")
print(image.size, result["depth"].size)
print(result["predicted_depth"].shape)
depth 是用于显示的图;predicted_depth 是数值预测。两者不可按同一种像素值解释距离。若输出尺寸不同,不要直接拿原图坐标切原始张量,先记录尺寸并按官方后处理对齐。
检查远近而不是套颜色结论
将原图与深度图并排打开,检查杯子、桌面、墙面是否形成稳定层次。不同可视化映射可能用亮色表示近或远,不能只凭“白色一定近”做判断。再检查细物体边缘、玻璃、镜面和遮挡处,记录不符合实际层次的位置;这些是后续效果处理要避开的区域。
需要真实距离时换契约
官方项目将相对深度和 Metric Depth Estimation 分开,检查点与训练条件不同。如果任务涉及相机测距,需选择相应米制模型并核对相机、场景域和实测标定;普通深度图片上的值不是米。Small 与其他版本的许可也不同,准备使用前按对应权重核对。下一步从同一场景不同拍摄角度各跑一张,比较排序一致性,仍不能据此宣称测距精度。
参考资料
本文依据 2026 年 10 月 3 日读取的官方项目或文档整理。上面的输入均为教学示例,实际结果需按自己的版本和素材核对。
输出字段依据Transformers官方深度估计管线源码核对:predicted_depth为数值张量,depth为显示用PIL图。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/33027.html