TPU-VMs überwachen

In diesem Leitfaden wird erläutert, wie Sie Cloud Monitoring verwenden, um Ihre TPU-VMs zu überwachen. Cloud Monitoring erfasst automatisch Messwerte und Logs von Ihrer TPU und der zugehörigen Host-VM. Mit diesen Daten können Sie den Zustand Ihrer TPU und Compute Engine überwachen.

Mit Messwerten können Sie eine numerische Größe im Zeitverlauf verfolgen, z. B. die CPU-Auslastung, die Netzwerknutzung oder die Inaktivitätsdauer der TensorCores. In Logs werden Ereignisse zu einem bestimmten Zeitpunkt erfasst. Logeinträge werden von Ihrem eigenen Code, Diensten vonGoogle Cloud , Anwendungen von Drittanbietern und der Infrastruktur vonGoogle Cloud erstellt. Sie können auch Messwerte aus den Daten in einem Logeintrag generieren, indem Sie einen logbasierten Messwert erstellen. Sie können auch Benachrichtigungsrichtlinien auf Grundlage von Messwerten oder Logeinträgen festlegen.

Sie können zur Überwachung von TPUs auch Capacity Planner (Vorabversion) verwenden. Mit Capacity Planner können Sie TPU-Nutzungs- und Prognosedaten für Ihr Projekt, Ihren Ordner oder Ihre Organisation ansehen. Diese Daten werden alle 24 Stunden aktualisiert. Sie können sie verwenden, um Nutzungstrends zu analysieren und den zukünftigen Kapazitätsbedarf zu planen. Weitere Informationen finden Sie unter Übersicht über Capacity Planner.

Auf TPU-Messwerte zugreifen

Compute Engine generiert zwei Arten von TPU-Messwerten: TPU-Laufzeitmesswerte und TPU-VM-Infrastrukturmesswerte. Sie haben zwei Möglichkeiten, die Messwerte abzurufen:

  • TPU-Monitoring-Bibliothek: Mit der TPU-Monitoring-Bibliothek können Sie TPU-Laufzeitmesswerte aus dem LibTPU SDK abrufen. So können Ihre Anwendungen Telemetriedaten in Echtzeit aus der Gastumgebung abrufen. Weitere Informationen finden Sie unter TPU Monitoring Library.

  • AI Telemetry Collector: Mit dem AI Telemetry Collector können Sie Laufzeitmesswerte und VM-Infrastrukturmesswerte abrufen. Der AI Telemetry Collector wird in der TPU-VM ausgeführt und ermöglicht Ihnen den Zugriff auf Messwerte über Cloud Monitoring oder über Ihre eigene Prometheus-basierte Monitoring-Pipeline. Weitere Informationen finden Sie unter AI Telemetry Collector.

TPU-Messwerte

Messwerte inGoogle Cloud für Cloud TPU werden automatisch von Compute Engine-VMs und der Cloud TPU-Laufzeit generiert. Die Messwerte in der folgenden Tabelle werden von Compute Engine-VMs generiert.

Den Strings vom Typ „metric type“ in dieser Tabelle muss compute.googleapis.com/ vorangestellt werden. Dieses Präfix wurde in den Einträgen der Tabelle weggelassen. Verwenden Sie beim Abfragen eines Labels das Präfix metric.labels. Beispiel: metric.labels.LABEL="VALUE".

Messwerttyp Startphase (Ebenen der Ressourcenhierarchie)
Anzeigename
Art, Typ, Einheit
Überwachte Ressourcen
Beschreibung
Labels
instance/tpu/accelerator/duty_cycle BETA(Projekt)
Accelerator-Duty-Cycle
GAUGEDOUBLE%
gce_instance
Prozentsatz der Zeit im Stichprobenzeitraum, in der der Beschleuniger aktiv Daten verarbeitet hat. Die Werte liegen im Bereich [0,100].
accelerator_id: Geräte-ID des Beschleunigers.
instance/tpu/accelerator/memory_bandwidth_utilization BETA(Projekt)
Auslastung der Arbeitsspeicher-Bandbreite des Beschleunigers
GAUGEDOUBLE%
gce_instance
Aktueller Prozentsatz der verwendeten Arbeitsspeicherbandbreite des Beschleunigers. Wird berechnet, indem die in einem Stichprobenzeitraum verwendete Arbeitsspeicherbandbreite durch die maximal unterstützte Bandbreite im selben Stichprobenzeitraum geteilt wird.
accelerator_id: Geräte-ID des Beschleunigers.
instance/tpu/accelerator/memory_total BETA(Projekt)
Gesamtspeicher des Beschleunigers
GAUGEINT64By
gce_instance
Derzeit zugewiesener Gesamtspeicher des Beschleunigers in Byte.
accelerator_id: Geräte-ID des Beschleunigers.
instance/tpu/accelerator/memory_used BETA(Projekt)
Verwendeter Beschleunigerarbeitsspeicher
GAUGEINT64By
gce_instance
Derzeit verwendeter Gesamtspeicher des Beschleunigers in Byte.
accelerator_id: Geräte-ID des Beschleunigers.
instance/tpu/accelerator/tensorcore_utilization BETA(Projekt)
TensorCore-Auslastung des Accelerators
GAUGEDOUBLE%
gce_instance
Aktueller Prozentsatz des verwendeten TensorCore. Wird berechnet, indem die TensorCore-Vorgänge, die in einem Stichprobenzeitraum ausgeführt wurden, durch die unterstützte Anzahl von TensorCore-Vorgängen im selben Stichprobenzeitraum geteilt werden.
accelerator_id: Geräte-ID des Beschleunigers.
instance/tpu/active_chips BETA(Projekt)
Anzahl der aktiven TPU-Chips
GAUGEINT641
gce_instance
Die aktuelle Anzahl der Chips, die aktiv genutzt werden (d. h. nicht im Leerlauf sind).
accelerator_type: Beschleunigertyp und ‑generation.
reservation_id: Die ID der Reservierung für die physische Maschine.
provisioning_model: Das zugehörige Bereitstellungsmodell.
protection_tier: Das zugehörige Schutzmodell.
block_id: Die ID des Blocks im Cluster, in dem die VM gehostet wird.
subblock_id: Die ID des Unterblocks, auf dem die VM gehostet wird.
is_exr: (BOOL) Gibt an, ob der Chip Teil einer verlängerten Reservierung ist.