Gemini 怎么理解短视频?上传片段后核对时间点与画面描述

用 Gemini Files API 上传短视频并等待 ACTIVE,询问画面事件时间点,再回放原片核对物体和动作。

Gemini 可以把视频作为输入,回答画面发生了什么并指向大致时间点。要验证它是否理解了你的片段,最好先用一段自己制作的短视频,记录两件清晰事件的真实时间,再让模型报告;长视频和陌生素材很难发现时间点幻觉。

准备可对照的 10 秒片段

例如拍摄桌面:约第 2 秒把红杯放进画面,第 7 秒拿走蓝笔,保存为 sample.mp4。这是一个示例拍摄脚本,不是本文已经拍摄或实测的片段。不要上传未获授权的人员或保密视频。安装官方 Python SDK,把 API key 放入终端环境变量 GEMINI_API_KEY,不要写进脚本。

Gemini 怎么理解短视频?上传片段后核对时间点与画面描述

python -m pip install -U google-genai

上传、等待处理并提问

Google 官方视频理解文档先通过 Files API 上传视频,等待文件处于 ACTIVE,再把 URI 和 MIME 类型交给 Interactions API。下面为等待增加明确的失败和超时边界,避免文件一直处理中时无限循环。模型名取自核验时的官方示例,账号可用性需按实际地区和模型列表确认。

import time
from google import genai

client = genai.Client()
video = client.files.upload(file="sample.mp4")
deadline = time.monotonic() + 300
while not video.state or video.state.name == "PROCESSING":
    if time.monotonic() > deadline:
        raise TimeoutError("视频处理超过 5 分钟,请检查文件状态")
    time.sleep(5)
    video = client.files.get(name=video.name)
if video.state.name != "ACTIVE":
    raise RuntimeError(f"视频处理失败:{video.state.name}")

answer = client.interactions.create(
    model="gemini-3.8-flash",
    input=[
        {"type": "video", "uri": video.uri, "mime_type": video.mime_type},
        {"type": "text", "text": "列出红杯出现和蓝笔离开的时间点,只写画面可直接证实的事件;不确定请标明。"},
    ],
)
print(answer.output_text)

拿原视频逐帧核对回答

输出应包含事件描述和时间点,但具体秒数以实际模型结果为准。回放第 2 秒和第 7 秒前后各一段,检查物体、动作方向和先后次序;如果时间偏差明显,改用更短片段或把提问限定为单个事件。模型可能遗漏短暂动作或混淆相似物体,不能把输出作为监控取证、医学或法律判断。视频文件大小、配额与处理时长会随套餐和接口变化,以官方文档和账号状态为准。

本文代码依官方接口编写,未上传读者视频也未实测准确率。资料核对于 2026 年 10 月 1 日。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31572.html

赞 (0)
AI小管家的头像AI小管家
人像旧照脸部模糊怎么修复?用 GFPGAN 对照人脸与背景
上一篇 2小时前
自有图片怎么训练目标检测模型?用 Ultralytics YOLO 检查数据集和验证结果
下一篇 2小时前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部