Monitoraggio con l'interfaccia a riga di comando tpu-info
La CLI tpu-info è uno strumento per rilevare i dispositivi Cloud TPU e leggere le metriche di runtime dalla libreria libtpu, inclusi la memoria utilizzata e il ciclo di lavoro. Supporta snapshot statici e una tantum e live streaming per monitorare
le metriche in modo continuo.
Installazione
Installa l'ultima release utilizzando pip:
pip install tpu-info
In alternativa, installa tpu-info dall'origine:
pip install git+https://github.com/google/cloud-accelerator-diagnostics/#subdirectory=tpu_info
Se hai già installato una versione di tpu-info, assicurati che sia
compatibile con il tuo ambiente e che non manchino metriche e funzionalità.
Per saperne di più, consulta Funzionalità o metriche mancanti.
Accedere alle metriche standard di LibTPU utilizzando la CLI
Utilizza il seguente comando per visualizzare le metriche tpu-info predefinite con la CLI:
tpu-info
L'output è simile al seguente:
TPU Chips
| Chip | Type | Devices | PID |
|--------------|--------------|---------|--------|
| /dev/vfio/0 | TPU v6e chip | 1 | 1022 |
| /dev/vfio/1 | TPU v6e chip | 1 | 1022 |
| /dev/vfio/2 | TPU v6e chip | 1 | 1022 |
| /dev/vfio/3 | TPU v6e chip | 1 | 1022 |
TPU Runtime Utilization
| Chip | HBM Usage (GiB) | Duty cycle |
|--------|--------------------------|------------|
| 8 | 17.26 GiB / 31.25 GiB | 100.00% |
| 9 | 9.26 GiB / 31.25 GiB | 100.00% |
| 12 | 9.26 GiB / 31.25 GiB | 100.00% |
| 13 | 9.26 GiB / 31.25 GiB | 100.00% |
TensorCore Utilization
| Core ID | TensorCore Utilization |
|---------|------------------------|
| 0 | 15.17% |
| 1 | 14.62% |
| 2 | 14.68% |
| 3 | 15.14% |
TPU Buffer Transfer Latency
| Buffer Size | P50 | P90 | P95 | P999 |
|--------------|--------------|--------------|--------------|--------------|
| 8MB+ | 18264.03 us | 33263.06 us | 35990.98 us | 53997.32 us |
TPU Inbound Buffer Transfer Latency
| Buffer Size | P50 | P90 | P95 | P999 |
|--------------|--------------|--------------|--------------|--------------|
| 8MB+ | 18316.95 us | 32857.03 us | 36501.59 us | 58854.54 us |
TPU Host Compute Latency
| Buffer Size | P50 | P90 | P95 | P999 |
|--------------|--------------|--------------|--------------|--------------|
| 8MB+ | 678.33 us | 2611.93 us | 5258.30 us | 11083.23 us |
TPU gRPC TCP Minimum RTT
| P50 | P90 | P95 | P999 |
|----------|----------|----------|----------|
| 35.99 us | 52.15 us | 53.83 us | 55.51 us |
TPU gRPC TCP Delivery Rate
| P50 | P90 | P95 | P999 |
|---------------|---------------|---------------|---------------|
| 12305.96 Mbps | 18367.10 Mbps | 24872.11 Mbps | 44841.55 Mbps |
Utilizzo
Per visualizzare i dati sull'utilizzo attuale della TPU, tpu-info richiede un workload TPU in esecuzione
con un framework ML supportato, come JAX o PyTorch/XLA. Puoi eseguire il comando
tpu-info nel terminale con i seguenti flag.
Processo
Utilizza il flag --process o -p per visualizzare informazioni sui processi
in esecuzione sulla TPU.
$ tpu-info --process
L'output dovrebbe essere simile al seguente:
TPU Process Info
| Chip | PID | Process Name |
|-------------|--------|--------------|
| /dev/vfio/0 | 799657 | python3 |
| /dev/vfio/1 | 799657 | python3 |
| /dev/vfio/2 | 799657 | python3 |
| /dev/vfio/3 | 799657 | python3 |
| /dev/vfio/4 | 799657 | python3 |
| /dev/vfio/5 | 799657 | python3 |
| /dev/vfio/6 | 799657 | python3 |
| /dev/vfio/7 | 799657 | python3 |
Metrica
Utilizza il flag --metric per visualizzare metriche specifiche. Puoi specificare più metriche separate da spazi. Alcune metriche comuni supportate sono:
hbm_usageduty_cycle_percenttensorcore_utilizationbuffer_transfer_latencyhost_to_device_transfer_latencydevice_to_host_transfer_latencycollective_e2e_latency
$ tpu-info --metric duty_cycle_percent hbm_usage
L'output dovrebbe essere simile al seguente:
TPU Duty Cycle
| Core ID | Duty Cycle (%) |
|---------|----------------|
| 0 | 100.00% |
| 1 | 100.00% |
| 2 | 100.00% |
| 3 | 100.00% |
| 4 | 100.00% |
| 5 | 100.00% |
| 6 | 100.00% |
| 7 | 100.00% |
TPU HBM Usage
| Chip | HBM Usage (GiB) |
|--------|-----------------------|
| 0 | 29.50 GiB / 31.25 GiB |
| 1 | 21.50 GiB / 31.25 GiB |
| 2 | 21.50 GiB / 31.25 GiB |
| 3 | 21.50 GiB / 31.25 GiB |
| 4 | 21.50 GiB / 31.25 GiB |
| 5 | 21.50 GiB / 31.25 GiB |
| 6 | 21.50 GiB / 31.25 GiB |
| 7 | 21.50 GiB / 31.25 GiB |
Elenca metriche
Utilizza il flag --list_metrics per visualizzare tutte le metriche supportate che possono essere
richieste con il flag --metric.
$ tpu-info --list_metrics
L'output dovrebbe essere simile al seguente:
╭─ Supported Metrics ─────────────────────────────────────────────────────────────────────────────╮
│ grpc_tcp_min_rtt │
│ host_to_device_transfer_latency │
│ grpc_tcp_delivery_rate │
│ inbound_buffer_transfer_latency │
│ host_compute_latency │
│ buffer_transfer_latency │
│ collective_e2e_latency │
│ device_to_host_transfer_latency │
│ hbm_usage │
│ duty_cycle_percent │
│ tensorcore_utilization │
╰─────────────────────────────────────────────────────────────────────────────────────────────────╯
Metriche dello stream
La modalità di streaming aggiorna periodicamente e mostra statistiche di utilizzo aggiornate. Per trasmettere in streaming le metriche LibTPU, aggiungi il flag --streaming al
comando tpu-info. Utilizza il flag --rate per controllare la cadenza dello streaming in
secondi.
Utilizza il seguente comando per trasmettere in streaming le metriche tpu-info predefinite con la CLI:
# Refresh metrics every 2 seconds
tpu-info --streaming --rate 2
L'output è simile al seguente:
Refresh rate: 0.1s
Last update: 2025-07-24 11:00:59 UTC
Libtpu version: 0.0.19.dev20250721+nightly
Accelerator type: v6e
TPU Chips
| Chip | Type | Devices | PID |
|--------------|--------------|---------|--------|
| /dev/vfio/0 | TPU v6e chip | 1 | 1022 |
| /dev/vfio/1 | TPU v6e chip | 1 | 1022 |
| /dev/vfio/2 | TPU v6e chip | 1 | 1022 |
| /dev/vfio/3 | TPU v6e chip | 1 | 1022 |
TPU Runtime Utilization
| Chip | HBM Usage (GiB) | Duty cycle |
|--------|--------------------------|------------|
| 8 | 17.26