训练任务是否实际使用 NVIDIA GPU,可以在训练进行时用 nvidia-smi 同时观察设备利用率、显存和进程。单次快照可能错过短促的计算;利用率高也不等于训练吞吐高或模型效果好。本文只适用于装有可用 NVIDIA 驱动且 nvidia-smi 可运行的环境,命令未在特定显卡上实测。
先确认设备可见
在运行训练的同一台机器上打开终端,先执行 nvidia-smi。NVIDIA 官方手册说明这个工具可查询设备和进程,也支持 --query-gpu、CSV 格式与循环采样。看到设备表只表示驱动能看到设备,不能证明当前训练已把模型和数据放到 GPU。

nvidia-smi
nvidia-smi --query-gpu=index,name,utilization.gpu,memory.used,memory.total --format=csv -l 2
第二条命令每约两秒输出一次采样;在它运行时启动训练,观察相应 GPU 的 utilization.gpu 与 memory.used 是否随任务变化。结束观察可在终端按 Ctrl+C。不同设备、驱动和运行方式支持的字段可能不同,显示 N/A 时不能按零解释。
对照进程与训练脚本
在另一个终端再次运行 nvidia-smi,查看 Processes 区域是否出现训练进程的 PID,并与操作系统里的训练进程 ID 对照。共享机器上显存和利用率可能来自别的程序,因此单看设备总量不够;有些环境的进程明细也可能缺失。
验证方法是训练活跃时连续看到目标设备的指标变化,并能把进程与自己的任务对应;在 PyTorch 脚本中还可核对模型参数和输入张量所在设备。如果训练确实运行却一直看不到目标进程或设备活动,先检查驱动、容器 GPU 映射、脚本的设备选择及任务是否仍在数据准备阶段。GPU 利用率表示采样窗口内设备执行内核的时间比例,不能直接当作吞吐量、算力峰值或训练有效性;需要性能诊断时再记录每步耗时并使用框架分析工具。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/29975.html