Gemini 可以把视频作为输入,回答画面发生了什么并指向大致时间点。要验证它是否理解了你的片段,最好先用一段自己制作的短视频,记录两件清晰事件的真实时间,再让模型报告;长视频和陌生素材很难发现时间点幻觉。
准备可对照的 10 秒片段
例如拍摄桌面:约第 2 秒把红杯放进画面,第 7 秒拿走蓝笔,保存为 sample.mp4。这是一个示例拍摄脚本,不是本文已经拍摄或实测的片段。不要上传未获授权的人员或保密视频。安装官方 Python SDK,把 API key 放入终端环境变量 GEMINI_API_KEY,不要写进脚本。

python -m pip install -U google-genai
上传、等待处理并提问
Google 官方视频理解文档先通过 Files API 上传视频,等待文件处于 ACTIVE,再把 URI 和 MIME 类型交给 Interactions API。下面为等待增加明确的失败和超时边界,避免文件一直处理中时无限循环。模型名取自核验时的官方示例,账号可用性需按实际地区和模型列表确认。
import time
from google import genai
client = genai.Client()
video = client.files.upload(file="sample.mp4")
deadline = time.monotonic() + 300
while not video.state or video.state.name == "PROCESSING":
if time.monotonic() > deadline:
raise TimeoutError("视频处理超过 5 分钟,请检查文件状态")
time.sleep(5)
video = client.files.get(name=video.name)
if video.state.name != "ACTIVE":
raise RuntimeError(f"视频处理失败:{video.state.name}")
answer = client.interactions.create(
model="gemini-3.8-flash",
input=[
{"type": "video", "uri": video.uri, "mime_type": video.mime_type},
{"type": "text", "text": "列出红杯出现和蓝笔离开的时间点,只写画面可直接证实的事件;不确定请标明。"},
],
)
print(answer.output_text)
拿原视频逐帧核对回答
输出应包含事件描述和时间点,但具体秒数以实际模型结果为准。回放第 2 秒和第 7 秒前后各一段,检查物体、动作方向和先后次序;如果时间偏差明显,改用更短片段或把提问限定为单个事件。模型可能遗漏短暂动作或混淆相似物体,不能把输出作为监控取证、医学或法律判断。视频文件大小、配额与处理时长会随套餐和接口变化,以官方文档和账号状态为准。
本文代码依官方接口编写,未上传读者视频也未实测准确率。资料核对于 2026 年 10 月 1 日。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31572.html