跳至主要內容
技術領域
close
AI 和機器學習
應用程式開發
應用程式託管
運算
資料分析和管道
資料庫
分散式雲端、混合雲和多雲端
產業解決方案
遷移
網路
觀測能力與監控
安全性
Storage
跨產品工具
close
存取權與資源管理
費用與用量管理
基礎架構即程式碼
SDK、語言、框架和工具
/
控制台
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
登入
AI Hypercomputer
免費試用
總覽
指南
資源
技術領域
更多
總覽
指南
資源
跨產品工具
更多
控制台
Discover
總覽
選擇加速器基礎架構
選擇自動調度管理工具和部署選項
加速器
關於 GPU 加速器
一般 GPU
叢集 GPU
效能最佳化基礎架構
GPU 機器
網路服務
GPU 網路總覽
部署作業的網路服務
網路最佳做法
儲存服務
開放軟體
OS 和 Docker 映像檔
選擇使用選項
管理叢集
叢集管理總覽
叢集管理設定
術語
開始使用
規劃及建立 AI 基礎架構
選擇一般 GPU 或叢集 GPU
取得容量和配額
總覽
預留容量
查看預留容量
快速入門導覽課程
使用 A4 VM 建立全代管 Slurm 叢集
使用 A4 VM 建立自行管理的 Slurm 叢集
部署基礎架構
部署選項總覽
密集配置政策和工作負載政策總覽
部署 AI 最佳化 VM 和叢集
建立 GKE 叢集
使用預設設定建立 AI 最佳化 GKE 叢集
建立使用 A4X Max 的自訂 AI 適用 GKE 叢集
建立使用 A4X 的自訂 AI 適用 GKE 叢集
建立使用 A4 或 A3 Ultra 的自訂 AI 適用 GKE 叢集
建立使用 A3 Mega 或 A3 High 的 GKE Standard 叢集
建立使用 A3 Mega 或 A3 High 的 GKE Autopilot 叢集
建立 Slurm 叢集
建立全代管叢集
建立自行管理的叢集
建立執行個體
建立 A4X Max
建立 A4X
建立 A4 或 A3 Ultra
建立 A3 High 或 A3 Mega
建立 A3 Edge
建立 A2
建立 G4
建立 G2
建立具有 GPU 的 N1
大量建立執行個體
建立 A4X Max
建立 A4X
建立 A4 或 A3 Ultra
建立 A3 High 或 A3 Mega
建立 A3 Edge
建立 A2
建立 G4
建立 G2
建立具有 GPU 的 N1
建立代管執行個體群組 (MIG)
建立 A4X Max
建立 A4X
建立 A4 或 A3 Ultra
建立 A3 High 或 A3 Mega
建立 A3 Edge
建立 A2
建立 G4
建立 G2
建立具有 GPU 的 N1
執行工作負載
使用 Pathways on Cloud 執行工作負載
Cloud 上的路徑簡介
使用 Pathways 建立 GKE 叢集
使用 Pathways 執行批次工作負載
使用 Pathways 執行互動式工作負載
使用 Pathways 執行多主機推論
透過 Pathways 進行彈性訓練
將 JAX 工作負載移植到 Pathways
排解 Pathways on Cloud 問題
安排 GKE 工作負載
使用拓撲感知排程 (TAS) 排定工作負載
啟用節點健康狀態預測功能
使用 Kueue 自動化調度管理工作負載
AI 工作負載教學課程
總覽
GPU
在 GKE 上使用 vLLM 執行推論作業
DeepSeek V3.1
DeepSeek V3.2-Speciale
Gemma 3
GPT-OSS
Llama 4
Qwen3 模型服務,
執行微調
GKE 叢集上的 Gemma 3
在多主機 GKE 叢集上使用 Gemma 3
在 Slurm 叢集上使用 Gemma 3
在 GKE 上使用 Gemma 3 處理視覺工作
Slurm 叢集上的 Llama 4
Slurm 叢集上的 Mixtral-8x7b
執行訓練
Slurm 叢集上的 Qwen2
TPU
提供工作負載
透過 vLLM 在 TPU 上提供 Qwen2-7B 服務
透過 vLLM 在 TPU 上提供 Qwen2-7B-Instruct 服務
透過 vLLM 在 TPU 上提供 Qwen3-8B-Base 服務
透過 vLLM 在 TPU 上提供 Llama-3.1-8B 服務
執行微調
使用 MaxText 在 TPU VM 上執行監督式微調
使用 MaxText 在 Qwen3-14b 上執行多主機監督式微調
在 v6e-8 TPU VM 上執行 RL 訓練
使用 MaxText 在 Qwen3-30b-a3b 上執行多主機 RL 訓練
管理基礎架構
管理 GKE 叢集
管理執行個體和 Slurm 叢集
查看執行個體的拓撲
管理主辦人活動
在執行個體中舉辦活動
預留項目中的主機事件
回報出錯的主機
測試並調整
運用 NCCL/gIB 最佳化調整叢集網路
執行 NCCL 測試
在 Compute Engine 執行個體上執行 NCCL
在採用預設設定的 GKE 叢集上執行 NCCL
在採用 A4X Max 的自訂 GKE 叢集上執行 NCCL
在採用 A4X 的自訂 GKE 叢集上執行 NCCL
在採用 A4 或 A3 Ultra 的自訂 GKE 叢集上執行 NCCL
在採用 A3 Mega 或 A3 High 的自訂 GKE 叢集上執行 NCCL
在 Slurm 叢集上執行 NCCL
收集並瞭解 NCCL 記錄,以利排解問題
使用配方測試工作負載