计算机视觉
-
图像分类模型怎么微调?用 Torchvision 更换分类头并核对验证集
用 Torchvision 的 ResNet18 预训练权重更换二分类头,在独立 train/val 目录训练并输出验证正确数。
-
Gemini 怎么理解短视频?上传片段后核对时间点与画面描述
用 Gemini Files API 上传短视频并等待 ACTIVE,询问画面事件时间点,再回放原片核对物体和动作。
-
目标检测标注怎么交给训练程序?从 CVAT 导出 YOLO 格式并核对类别
从 CVAT 导出传统 YOLO 标注后,按 obj.names 和归一化坐标核对类别、框和图片文件映射。
-
CVAT 自动标注怎么用?接入 SAM 辅助画掩码并人工复核
在 CVAT 确认可用 SAM interactor 后,用正负点生成杯子掩码,人工核对边缘及标签,并说明部署前提。
-
Gemini 怎么识别图片内容?上传本地图片并核对模型描述
按官方 Gemini 图像 API 上传本地图片并提问,逐项对照原图核查物体、颜色和位置,说明认证与模型限制。
-
人体姿态检测怎么做?用 YOLO 导出关键点并检查遮挡
用 YOLO 姿态模型导出 17 个 COCO 关键点,保存核对图,区分人物序号、坐标和遮挡边界。