Scegliere l'infrastruttura dell'acceleratore

Utilizza questo documento per identificare l'infrastruttura di accelerazione ottimale per i workload di intelligenza artificiale (AI) e machine learning (ML) in base alla fase del ciclo di vita, ad esempio prototipazione su piccola scala, inferenza in tempo reale e addestramento distribuito su larga scala. AI Hypercomputer organizza le offerte di acceleratori in due categorie: GPU generali e GPU in cluster.

Infrastruttura GPU

AI Hypercomputer offre due categorie distinte di GPU. Ogni categoria ha un modello di gestione distinto che determina il modo in cui il sistema gestisce gli eventi del ciclo di vita, gestisce la manutenzione e ottimizza il networking per il tuo workload:

Modello di gestione delle GPU generali

Il modello di gestione delle GPU generali è progettato per i workload che danno la priorità all'indipendenza delle risorse e all'alta affidabilità. Questo modello utilizza il piano di gestione standard Google Cloud , fornendo un'esperienza familiare ai team che utilizzano già Compute Engine o GKE.

  • Manutenzione: asincrona. Le singole istanze vengono aggiornate in modo indipendente. In un parco risorse di pubblicazione multi-nodo, un evento di manutenzione su un nodo non influisce sulla disponibilità degli altri, consentendo di reindirizzare il traffico ai nodi integri senza bloccare l'intero job.

  • Casi d'uso principali: consigliato per attività mainstream come inferenza in tempo reale, erogazione del modello, prototipazione su piccola scala e ambienti di sviluppo in cui non è richiesta la scala di supercomputing.

Serie di macchine GPU generali

Le seguenti serie di macchine sono GPU generali:

  • G2 (L4)
  • G4 (RTX PRO 6000)
  • A2 (A100)
  • NT1+T4
  • A3 Edge
  • A3 High (1, 2 o 4 GPU)

Per informazioni tecniche su ciascuna delle macchine GPU generali, vedi Tipi di macchine GPU.

Modello di gestione delle GPU in cluster

Il modello di gestione delle GPU in cluster è un ambiente di classe supercomputing progettato per l'addestramento distribuito su larga scala. Le risorse vengono gestite come un unico sistema strettamente accoppiato utilizzando uno stack di GPU in cluster.

  • Manutenzione: coordinata. Questo modello coordina gli eventi di manutenzione per supportare i workload strettamente accoppiati. Per l'addestramento distribuito, puoi utilizzare la manutenzione sincronizzata, in cui gli aggiornamenti vengono applicati contemporaneamente a tutti i nodi. Questo approccio impedisce il riavvio dei nodi che bloccano i job e massimizza il goodput. Questo modello offre anche notifiche di manutenzione di 90 giorni.

  • Casi d'uso principali: progettato per l'addestramento di modelli di base exascale con trilioni di parametri o per l'esecuzione di simulazioni complesse di computing ad alte prestazioni (HPC), come la scoperta di farmaci e il ripiegamento delle proteine.

Serie di macchine GPU in cluster

Le seguenti serie di macchine sono GPU in cluster:

  • A4X
  • A4 (Blackwell)