Zum Hauptinhalt springen
Google Cloud Documentation
Technologiebereiche
  • KI und ML
  • Anwendungsentwicklung
  • Anwendungshosting
  • Compute
  • Datenanalyse und Pipelines
  • Datenbanken
  • Verteilt, Hybrid und Multi-Cloud
  • Branchenlösungen
  • Migration
  • Netzwerk
  • Beobachtbarkeit und Monitoring
  • Sicherheit
  • Storage
Produktübergreifende Tools
  • Zugriffs- und Ressourcenverwaltung
  • Kosten- und Nutzungsmanagement
  • Infrastruktur als Code
  • SDK, Sprachen, Frameworks und Tools
/
Console
  • English
  • Deutsch
  • Español
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
Anmelden
  • Cloud TPU
Jetzt kostenlos testen
Übersicht Leitfäden Referenzen Beispiele Support Ressourcen
Google Cloud Documentation
  • Technologiebereiche
    • Mehr
    • Übersicht
    • Leitfäden
    • Referenzen
    • Beispiele
    • Support
    • Ressourcen
  • Produktübergreifende Tools
    • Mehr
  • Console
  • Erste Schritte
  • Einführung in Cloud TPU
  • TPU-Architektur
  • TPU-Versionen
    • TPU7x (Ironwood)
    • TPU v6e
    • TPU v5p
    • TPU v5e
    • TPU v4
  • Regionen und Zonen
  • Cloud TPU-Ressourcen in Compute Engine
  • JAX AI-Stack
  • Los gehts
  • Google Cloud-Projekt einrichten
  • Kurzanleitungen
    • TPU-Instanz erstellen
    • TPU-Slice mit mehreren Hosts erstellen
  • Cloud TPU-Ressourcen planen
  • TPUs reservieren
    • TPU-Reservierungen
    • Reservierung für bis zu 90 Tage anfordern (im Kalendermodus)
    • Vorausschauende Reservierung für ein Jahr oder länger anfordern
    • Reservierung teilen
    • Reservierung nutzen
  • TPUs erstellen
    • TPU-Erstellung – Übersicht
    • TPU-VM-Instanz erstellen
    • TPU Flex-Start-VMs erstellen
    • TPU-Spot-VMs erstellen
    • TPU-Instanzen in MIGs
    • MIG für einen TPU-Slice mit mehreren Hosts erstellen
    • MIG für TPU-Slices mit einem Host erstellen
  • TPUs konfigurieren
  • Netzwerk und Zugriff konfigurieren
  • TPU-Betriebssystem-Images
  • Benutzerdefiniertes Betriebssystem-Image verwenden
  • TPU-VM-Bootlaufwerk mit einem CMEK verschlüsseln
  • Projektübergreifendes Dienstkonto verwenden
  • Speicher verwalten
    • Speicheroptionen für TPU-VMs
    • Best Practices
    • Speicherlaufwerke anhängen
    • Verbindung zu Cloud Storage-Buckets herstellen
  • TPUs verwalten
  • TPU-Ressourcen mit Compute Engine verwalten
  • Wartungsereignisse im Modus für verwaltete Kapazität verwalten
  • TPUs im Modus „All Capacity“ verwalten
    • Übersicht über den Modus „Gesamte Kapazität“
    • Reservierung im Modus „Alle Kapazitäten“ anfordern
    • Topologie und Status von TPUs im Modus „Alle Kapazitäten“ ansehen
    • Fehlerhafte Hosts im Modus „Alle Kapazitäten“ melden und reparieren
    • Wartungsereignisse im Modus „Alle Kapazitäten“ verwalten
  • Multislice-Training
  • TPU-Sammlungen für Inferenz-Arbeitslasten planen
  • Arbeitslasten ausführen
  • Modell mit TPU7x trainieren
  • Inferenz auf Cloud TPU ausführen
  • Auf Cloud TPU-Slices trainieren
  • Modell auf TPUs skalieren
  • Mit Bild-Datasets arbeiten
    • Imageklassifizierungs-Datasets zur Verwendung mit Cloud TPU konvertieren
    • Das ImageNet-Dataset herunterladen, vorverarbeiten und hochladen
    • COCO-Dataset herunterladen, vorverarbeiten und hochladen
  • Leistung optimieren
  • Leistungsleitfaden für Cloud TPU
  • Modellleistung mit bfloat16 verbessern
  • Leistungsoptimierungen für TPU7x (Ironwood)
  • TPUs überwachen und Fehler beheben
  • TPU-VMs überwachen
  • TPU-Zustand überwachen
  • TPU-Goodput überwachen
  • TPU-Monitoring-Bibliothek
  • Mit der tpu-info-Befehlszeile überwachen
  • Fehlerbehebung bei PyTorch-Modellen
  • Fehlerbehebung bei JAX-Modellen
  • ML Diagnostics-Plattform
    • Übersicht
    • GKE einrichten
    • Erste Schritte mit dem SDK
    • Erste Schritte mit der CLI
    • ML Diagnostics mit MaxText verwenden
    • Machine-Learning-Ausführungen ansehen
    • Arbeitslasten überwachen
  • Profil für TPUs erstellen
  • Profil für TPU-VMs erstellen
  • Profil für Multislice-Umgebungen erstellen
  • Profil für PyTorch/XLA-Arbeitslasten erstellen
  • Cloud TPU API
  • Erste Schritte
    • TPU-Softwareversionen
    • TPU-Versionen
      • TPU v3
      • TPU v2
  • Los gehts
    • Google Cloud-Projekt einrichten
    • TPUs erstellen
    • Reservierung nutzen
    • JAX auf der Cloud TPU-VM ausführen
    • PyTorch auf Cloud TPU-VM ausführen
    • JAX auf Cloud TPU-Slices ausführen
    • PyTorch auf Cloud TPU-Slices ausführen
  • TPUs konfigurieren
    • TPU mit einem gemeinsam genutzten VPC-Netzwerk verbinden
    • Verbindung zu einer TPU-VM ohne öffentliche IP-Adresse herstellen
    • Netzwerk und Zugriff konfigurieren
    • TPU-VM-Bootlaufwerk mit einem CMEK verschlüsseln
    • Projektübergreifendes Dienstkonto verwenden
    • Langlebigen Blockspeicher an eine TPU-VM anhängen
    • Verbindung zu Cloud Storage-Buckets herstellen
    • Filestore-Instanz auf einer TPU-VM bereitstellen
  • TPUs verwalten
    • TPU-Ressourcen verwalten
    • In die Warteschlange gestellte Ressourcen verwalten
    • TPU-Flex-Start-VMs anfordern
    • TPU-Spot-VMs verwalten
    • Auf Wartungsereignisse vorbereiten
    • Automatischer Checkpoint
    • Wartungsbenachrichtigungen ansehen
    • Hostwartung manuell starten
    • TPUs auf Abruf
  • Arbeitslasten ausführen
    • Modell mit v6e trainieren
    • Modell mit v5e trainieren
    • ML-Arbeitslasten mit Ray skalieren
    • TPU-Anwendungen in einem Docker-Container ausführen
  • TPUs überwachen und Fehler beheben
    • Fehlerbehebung bei TPU-VMs
    • TPU-VMs überwachen
    • Dashboards für Monitoring und Logging
    • Fehlerbehebung bei TensorFlow-Modellen
    • Cloud TPU-Fehlerglossar
    • Cloud TPU-Audit-Logs
  • Anleitungen und Notebooks
    • ResNet mit PyTorch trainieren
    • MaxDiffusion-Inferenz auf v6e
    • Notebooks
  • KI und ML
  • Anwendungsentwicklung
  • Anwendungshosting
  • Compute
  • Datenanalyse und Pipelines
  • Datenbanken
  • Verteilt, Hybrid und Multi-Cloud
  • Branchenlösungen
  • Migration
  • Netzwerk
  • Beobachtbarkeit und Monitoring
  • Sicherheit
  • Storage
  • Zugriffs- und Ressourcenverwaltung