四步让GPU利用率与显存数据可视化:nvidia_gpu_exporter从安装到看板
四步让GPU利用率与显存数据可视化nvidia_gpu_exporter从安装到看板【免费下载链接】nvidia_gpu_exporterNvidia GPU exporter for prometheus using nvidia-smi binary OR using NVML项目地址: https://gitcode.com/gh_mirrors/nv/nvidia_gpu_exporternvidia_gpu_exporter是一款面向Prometheus的GPU指标导出器它替你执行nvidia-smi命令采集利用率、显存、温度、功耗并在 /metrics 端点以Prometheus文本格式暴露。只要你的机器装好NVIDIA驱动、能跑nvidia-smi10分钟左右就能走完安装 → 启动 → 看到数据的全过程。它怎么干活nvidia-smi → 9835端口 → Prometheusexporter启动时先跑一遍nvidia-smi探测你的GPU和驱动能报告哪些字段此后Prometheus每次来抓取它就执行一次查询把结果写成标准Prometheus文本格式返回。整条链路只有三方nvidia-smi出数据exporter监听9835端口暴露Prometheus抓下来存进时序库Grafana负责画出来。等你打开看板仪表盘背后就是 nvidia_smi_utilization_gpu_ratio利用率、nvidia_smi_memory_used_bytes显存占用、nvidia_smi_temperature_gpu温度这些实时读数。选一条安装路线Linux、Windows、Docker先对照下表挑适合你的方式方式适用系统所需权限一句话点评二进制下载Linux / macOS / Windowssudo最直接没有GPU也能用demo模式试跑PowerShell一键脚本Windows管理员exporter、Prometheus、Grafana一次装齐deb / rpm包Linuxsystemdroot自带systemd服务装完即开机自启Docker镜像带GPU的Linuxdocker容器与集群场景首选单兵二进制进PATH下载最新发行版的Linux x86_64压缩包解压后把二进制放到PATH可达的位置sudo mv nvidia_gpu_exporter /usr/bin # 放入PATH位置 nvidia_gpu_exporter --version # 验证安装成功预期输出nvidia_gpu_exporter, version v1.14.0。接着直接启动它默认监听9835端口nvidia_gpu_exporter --log.levelinfo浏览器打开 http://localhost:9835/metrics看到 nvidia_smi_gpu_info 一行GPU型号、驱动版本链路就通了。手头没有GPU加 --collect.backend demo 输出模拟数据整条链路照样能跑通。想让服务随机器自启把 systemd服务文件 放到 /etc/systemd/system/ 下执行sudo systemctl enable --now nvidia_gpu_exporter即可。Windows一键装齐三件套不想单独配置Prometheus和Grafana就用官方一键脚本下载后以管理员身份打开PowerShell运行powershell -NoProfile -ExecutionPolicy Bypass -File .\windows-all-in-one.ps1脚本会把exporter注册为Windows服务再依次装好Prometheus9090和Grafana3000并预置抓取目标与面板。预期结果结尾打印三个地址浏览器打开 http://localhost:9090 出现Prometheus页面打开 http://localhost:3000初始 admin/admin面板列表里直接有GPU看板。Docker一条命令镜像本身不含GPU组件启动时由NVIDIA容器工具包注入驱动库宿主机需先装好驱动和工具包docker run -d --gpus all -p 9835:9835 \ utkuozdemir/nvidia_gpu_exporter:latest用curl http://localhost:9835/metrics验证返回 nvidia_smi_* 行即成功。接上可视化看板按ID导入Grafana面板脚本版已配好Prometheus手动部署的话在 prometheus.yml 加一个target为 localhost:9835 的抓取任务再连看板打开 http://localhost:3000 登录脚本版为 admin/admin左侧菜单点 Dashboards → New → Import。输入框填面板ID 14574单卡详情视图点 Load多卡再导入 25547 看对比视图。数据源下拉选择 Prometheushttp://localhost:9090点 Import。核对数据详情页顶部是状态灯与利用率仪表GPU在干活时数值每15秒刷新一次。卡住了这样查命令找不到、端口占用、指标缺失现象可能原因解决办法nvidia-smi: command not found驱动未安装或二进制不在PATH装驱动或用--nvidia-smi-command/usr/local/nvidia/bin/nvidia-smi指定完整路径端口9835被占用其他进程已占端口改用--web.listen-address:9836启动并同步更新Prometheus的target/metrics指标不全或看板空白采集失败或字段没被上报确认 nvidia_smi_last_collect_success 为1字段默认AUTO自动探测可用--query-field-names-exclude剔除慢字段从安装到看板一共四步选路线装exporter、暴露9835端口、接上Prometheus抓取、按ID导入面板。指标仍有缺漏时查 docs/METRICS.md 里的完整清单或直接给项目提issue。【免费下载链接】nvidia_gpu_exporterNvidia GPU exporter for prometheus using nvidia-smi binary OR using NVML项目地址: https://gitcode.com/gh_mirrors/nv/nvidia_gpu_exporter创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考