TPU v6e

In diesem Dokument werden die Architektur und die unterstützten Konfigurationen von Cloud TPU v6e (Trillium) beschrieben.

Trillium ist der KI-Beschleuniger der neuesten Generation für Cloud TPU. Auf allen technischen Oberflächen, z. B. in der API und in Logs, sowie in diesem Dokument wird Trillium als v6e bezeichnet.

Mit 256 Chips pro Pod ähnelt die v6e-Architektur der v5e-Architektur. Dieses optimierte System ist ein hochwertiges Produkt für das Training, die Feinabstimmung und die Bereitstellung von Transformer-, Text-zu-Bild- und CNN-Modellen (Convolutional Neural Network).

Systemarchitektur

Jeder v6e-Chip enthält einen TensorCore. Jeder TensorCore hat 2 MXUs (Matrix Multiply Units), eine Vektoreinheit und eine Skalareinheit. In der folgenden Tabelle sind die wichtigsten Spezifikationen und ihre Werte für TPU v6e im Vergleich zu TPU v5e aufgeführt.

Spezifikation v5e v6e
Leistung/Gesamtbetriebskosten (erwartet) 0,65x 1
Maximale Rechenleistung pro Chip (bf16) 197 TFLOPs 918 TFLOPs
Maximale Rechenleistung pro Chip (Int8) 393 TOPS 1.836 TOPS
HBM-Kapazität pro Chip 16 GB 32 GB
HBM-Bandbreite pro Chip 800 GBps 1600 GBps
ICI-Bandbreite (Inter-Chip Interconnect) 1600 GBps 3200 GBps
ICI-Ports pro Chip 4 4
DRAM pro Host 512 GiB 1.536 GiB
Chips pro Host 8 8
TPU-Pod-Größe 256 Chips 256 Chips
Interconnect-Topologie 2D-Torus 2D-Torus
Maximale BF16-Rechenleistung pro Pod 50,63 PFLOPs 234,9 PFLOPs
All-Reduce-Bandbreite pro Pod 51,2 TB/s 102,4 TB/s
Bisektionsbandbreite pro Pod 1,6 TB/s 3,2 TB/s
NIC-Konfiguration pro Host NIC mit 2 × 100 Gbit/s NIC mit 4 × 200 Gbit/s
Netzwerkbandbreite des Rechenzentrums pro Pod 6,4 Tbit/s 25,6 Tbit/s
Besondere Features - SparseCore

Unterstützte Konfigurationen

In der folgenden Tabelle sind die 2D-Slice-Formen aufgeführt, die für v6e unterstützt werden:

Topologie TPU-Chips Hosts VMs Beschleunigertyp (TPU API) Maschinentyp (GKE API) Umfang
1x1 1 1/8 1 v6e-1 ct6e-standard-1t Untergeordneter Host
2x2 4 1/2 1 v6e-4 ct6e-standard-4t Untergeordneter Host
2x4 8 1 1 v6e-8