TPU-VMs überwachen
In diesem Leitfaden wird erläutert, wie Sie Cloud Monitoring verwenden, um Ihre TPU-VMs zu überwachen. Cloud Monitoring erfasst automatisch Messwerte und Logs von Ihrer TPU und der zugehörigen Host-VM. Mit diesen Daten können Sie den Zustand Ihrer TPU und Compute Engine überwachen.
Mit Messwerten können Sie eine numerische Größe im Zeitverlauf verfolgen, z. B. die CPU-Auslastung, die Netzwerknutzung oder die Inaktivitätsdauer der TensorCores. In Logs werden Ereignisse zu einem bestimmten Zeitpunkt erfasst. Logeinträge werden von Ihrem eigenen Code, Diensten vonGoogle Cloud , Anwendungen von Drittanbietern und der Infrastruktur vonGoogle Cloud erstellt. Sie können auch Messwerte aus den Daten in einem Logeintrag generieren, indem Sie einen logbasierten Messwert erstellen. Sie können auch Benachrichtigungsrichtlinien auf Grundlage von Messwerten oder Logeinträgen festlegen.
Sie können zur Überwachung von TPUs auch Capacity Planner (Vorabversion) verwenden. Mit Capacity Planner können Sie TPU-Nutzungs- und Prognosedaten für Ihr Projekt, Ihren Ordner oder Ihre Organisation ansehen. Diese Daten werden alle 24 Stunden aktualisiert. Sie können sie verwenden, um Nutzungstrends zu analysieren und den zukünftigen Kapazitätsbedarf zu planen. Weitere Informationen finden Sie unter Übersicht über Capacity Planner.
Auf TPU-Messwerte zugreifen
Compute Engine generiert zwei Arten von TPU-Messwerten: TPU-Laufzeitmesswerte und TPU-VM-Infrastrukturmesswerte. Sie haben zwei Möglichkeiten, die Messwerte abzurufen:
TPU-Monitoring-Bibliothek: Mit der TPU-Monitoring-Bibliothek können Sie TPU-Laufzeitmesswerte aus dem LibTPU SDK abrufen. So können Ihre Anwendungen Telemetriedaten in Echtzeit aus der Gastumgebung abrufen. Weitere Informationen finden Sie unter TPU Monitoring Library.
AI Telemetry Collector: Mit dem AI Telemetry Collector können Sie Laufzeitmesswerte und VM-Infrastrukturmesswerte abrufen. Der AI Telemetry Collector wird in der TPU-VM ausgeführt und ermöglicht Ihnen den Zugriff auf Messwerte über Cloud Monitoring oder über Ihre eigene Prometheus-basierte Monitoring-Pipeline. Weitere Informationen finden Sie unter AI Telemetry Collector.
TPU-Messwerte
Messwerte inGoogle Cloud für Cloud TPU werden automatisch von Compute Engine-VMs und der Cloud TPU-Laufzeit generiert. Die Messwerte in der folgenden Tabelle werden von Compute Engine-VMs generiert.
Den Strings vom Typ „metric type“ in dieser Tabelle muss compute.googleapis.com/ vorangestellt werden. Dieses Präfix wurde in den Einträgen der Tabelle weggelassen. Verwenden Sie beim Abfragen eines Labels das Präfix metric.labels. Beispiel: metric.labels.LABEL="VALUE".
| Messwerttyp Startphase (Ebenen der Ressourcenhierarchie) Anzeigename |
|
|---|---|
| Art, Typ, Einheit Überwachte Ressourcen |
Beschreibung Labels |
instance/tpu/accelerator/duty_cycle
BETA
(Projekt)
Accelerator-Duty-Cycle |
|
GAUGE, DOUBLE, %
gce_instance |
Prozentsatz der Zeit im Stichprobenzeitraum, in der der Beschleuniger aktiv Daten verarbeitet hat. Die Werte liegen im Bereich [0,100].
accelerator_id:
Geräte-ID des Beschleunigers.
|
instance/tpu/accelerator/memory_bandwidth_utilization
BETA
(Projekt)
Auslastung der Arbeitsspeicher-Bandbreite des Beschleunigers |
|
GAUGE, DOUBLE, %
gce_instance |
Aktueller Prozentsatz der verwendeten Arbeitsspeicherbandbreite des Beschleunigers. Wird berechnet, indem die in einem Stichprobenzeitraum verwendete Arbeitsspeicherbandbreite durch die maximal unterstützte Bandbreite im selben Stichprobenzeitraum geteilt wird.
accelerator_id:
Geräte-ID des Beschleunigers.
|
instance/tpu/accelerator/memory_total
BETA
(Projekt)
Gesamtspeicher des Beschleunigers |
|
GAUGE, INT64, By
gce_instance |
Derzeit zugewiesener Gesamtspeicher des Beschleunigers in Byte.
accelerator_id:
Geräte-ID des Beschleunigers.
|
instance/tpu/accelerator/memory_used
BETA
(Projekt)
Verwendeter Beschleunigerarbeitsspeicher |
|
GAUGE, INT64, By
gce_instance |
Derzeit verwendeter Gesamtspeicher des Beschleunigers in Byte.
accelerator_id:
Geräte-ID des Beschleunigers.
|
instance/tpu/accelerator/tensorcore_utilization
BETA
(Projekt)
TensorCore-Auslastung des Accelerators |
|
GAUGE, DOUBLE, %
gce_instance |
Aktueller Prozentsatz des verwendeten TensorCore. Wird berechnet, indem die TensorCore-Vorgänge, die in einem Stichprobenzeitraum ausgeführt wurden, durch die unterstützte Anzahl von TensorCore-Vorgängen im selben Stichprobenzeitraum geteilt werden.
accelerator_id:
Geräte-ID des Beschleunigers.
|
instance/tpu/active_chips
BETA
(Projekt)
Anzahl der aktiven TPU-Chips |
|
GAUGE, INT64, 1
gce_instance |
Die aktuelle Anzahl der Chips, die aktiv genutzt werden (d. h. nicht im Leerlauf sind).
accelerator_type:
Beschleunigertyp und ‑generation.
reservation_id:
Die ID der Reservierung für die physische Maschine.
provisioning_model:
Das zugehörige Bereitstellungsmodell.
protection_tier:
Das zugehörige Schutzmodell.
block_id:
Die ID des Blocks im Cluster, in dem die VM gehostet wird.
subblock_id:
Die ID des Unterblocks, auf dem die VM gehostet wird.
is_exr:
(BOOL)
Gibt an, ob der Chip Teil einer verlängerten Reservierung ist.
|