Dalla versione 12.8.658, il monitoraggio delle GPU NVIDIA è supportato tramite 12 monitor CLI introdotti per monitorare metriche chiave relative alle prestazioni della GPU, alla gestione dell'alimentazione e termica, allo stato del dispositivo e all'utilizzo della memoria. Questi monitor offrono agli amministratori di sistema, ai team DevOps e agli ingegneri AI visibilità diretta sul consumo delle risorse GPU e sul loro stato di salute nell'infrastruttura basata su Linux — dove le GPU NVIDIA sono più comunemente distribuite per carichi di lavoro ad alta intensità di calcolo.
Per associare un monitor GPU NVIDIA, andare alla pagina Snapshot del rispettivo dispositivo basato su Linux → Monitor → Monitor delle prestazioni → Azioni → Aggiungi monitor delle prestazioni.
Qui, i monitor sono elencati nella sezione "Monitor GPU NVIDIA". Selezionare i monitor richiesti e fare clic su Aggiungi.
I monitor delle prestazioni possono essere associati in blocco a più dispositivi dalla pagina Impostazioni. I passaggi seguenti descrivono l'associazione dei 12 monitor GPU NVIDIA disponibili nel vendor net-snmp a uno o più dispositivi. I dispositivi verranno associati ai monitor solo quando le rispettive credenziali CLI saranno configurate per tali dispositivi.
L'associazione dei monitor GPU NVIDIA ai dispositivi tramite Impostazioni in OpManager consente il monitoraggio continuo delle prestazioni tra host abilitati per GPU da un singolo punto di configurazione. Una volta associati, i dati raccolti sono disponibili nella pagina Snapshot del dispositivo, dove le soglie possono essere configurate per dispositivo oppure a livello di Impostazioni per applicare contemporaneamente valori di soglia uniformi a più dispositivi.
| Categoria | Monitor | Descrizione |
|---|---|---|
| Prestazioni GPU | Utilizzo GPU NVIDIA | Percentuale delle risorse GPU impegnate nell'elaborazione dei carichi di lavoro |
| Utilizzo della memoria GPU NVIDIA | Percentuale della memoria GPU totale (VRAM) che è attivamente allocata e utilizzata dalle application e dai processi in esecuzione | |
| Velocità di clock della GPU NVIDIA in percentuale | Percentuale della velocità di clock del core della GPU rispetto alla sua frequenza nominale massima | |
| Velocità di clock della memoria GPU NVIDIA in percentuale | Percentuale della velocità di clock della memoria GPU rispetto alla sua frequenza nominale massima | |
| Stato GPU | Disponibilità GPU NVIDIA | Indica se la GPU NVIDIA è attualmente disponibile e accessibile dal sistema |
| Modalità di calcolo GPU NVIDIA | Indica se la modalità di calcolo della GPU NVIDIA è impostata su una configurazione specifica | |
| Stato del display GPU NVIDIA | Indica se l'uscita del display della GPU è attualmente attiva o inattiva | |
| Modalità di persistenza GPU NVIDIA | Indica se la modalità di persistenza della GPU NVIDIA è abilitata, consentendo alla GPU di rimanere inizializzata tra le sessioni e riducendo il ritardo di inizializzazione | |
| Gestione alimentazione / termica GPU | Temperatura GPU NVIDIA in gradi Celsius | Temperatura operativa corrente della GPU in gradi Celsius |
| Consumo energetico GPU NVIDIA in watt | Quantità di energia elettrica attualmente consumata dalla GPU, misurata in watt | |
| Consumo energetico GPU NVIDIA in percentuale | Percentuale dell'utilizzo energetico della GPU rispetto al suo limite di potenza nominale massimo | |
| Velocità della ventola GPU NVIDIA in percentuale | Percentuale della velocità della ventola della GPU rispetto alla sua velocità nominale massima |