跳至主要內容
Google Cloud Documentation
技術領域
  • AI 和機器學習
  • 應用程式開發
  • 應用程式託管
  • 運算
  • 資料分析和管道
  • 資料庫
  • 分散式雲端、混合雲和多雲端
  • 產業解決方案
  • 遷移
  • 網路
  • 觀測能力與監控
  • 安全性
  • Storage
跨產品工具
  • 存取權與資源管理
  • 費用與用量管理
  • 基礎架構即程式碼
  • SDK、語言、框架和工具
/
控制台
  • English
  • Deutsch
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
登入
  • Cloud TPU
免費試用
總覽 指南 參考資料 範例 支援 資源
Google Cloud Documentation
  • 技術領域
    • 更多
    • 總覽
    • 指南
    • 參考資料
    • 範例
    • 支援
    • 資源
  • 跨產品工具
    • 更多
  • 控制台
  • Discover
  • Cloud TPU 簡介
  • TPU 架構
  • TPU 版本
    • TPU7x (Ironwood)
    • TPU v6e
    • TPU v5p
    • TPU v5e
    • TPU v4
  • 區域和可用區
  • Compute Engine 中的 Cloud TPU 資源
  • JAX AI 堆疊
  • 開始使用
  • 設定 Google Cloud 專案
  • 快速入門導覽課程
    • 建立 TPU 執行個體
    • 建立多主機 TPU 配量
  • 規劃 Cloud TPU 資源
  • 預訂 TPU
    • 關於 TPU 預留項目
    • 預約最多 90 天的行程 (日曆模式)
    • 要求一年或更久的未來預留項目
    • 分享預訂資訊
    • 使用預留項目
  • 建立 TPU
    • TPU 建立機制簡介
    • 建立 TPU VM 執行個體
    • 建立 TPU Flex-start VM
    • 建立 TPU Spot VM
    • MIG 中的 TPU 執行個體
    • 為多主機 TPU 配量建立 MIG
    • 為單一主機 TPU 配量建立 MIG
  • 設定 TPU
  • 設定網路和存取權
  • TPU OS 映像檔
  • 使用自訂 OS 映像檔
  • 使用 CMEK 加密 TPU VM 開機磁碟
  • 使用跨專案服務帳戶
  • 管理儲存空間
    • TPU VM 的儲存空間選項
    • 儲存空間最佳做法
    • 附加儲存磁碟
    • 連線至 Cloud Storage 值區
  • 管理 TPU
  • 使用 Compute Engine 管理 TPU 資源
  • 在受管理容量模式下管理維護事件
  • 在「所有容量」模式下管理 TPU
    • All Capacity 模式簡介
    • 要求預訂「所有容量」模式
    • 查看「所有容量」模式 TPU 的拓撲和健康狀態
    • 在「所有容量」模式中回報及修復出錯的主機
    • 在「所有容量」模式下管理維護事件
  • 多切片訓練
  • 排定推論工作負載的 TPU 集合
  • 執行工作負載
  • 使用 TPU7x 訓練模型
  • 在 Cloud TPU 上執行推論
  • 在 Cloud TPU 配量上訓練
  • 在 TPU 上調度模型資源
  • 使用圖片資料集
    • 轉換圖片分類資料集,以便用於 Cloud TPU
    • 下載、預先處理及上傳 ImageNet 資料集
    • 下載、預先處理及上傳 COCO 資料集
  • 發揮最佳效能
  • Cloud TPU 效能指南
  • 使用 bfloat16 提升模型效能
  • TPU7x (Ironwood) 效能最佳化
  • 監控及排解 TPU 問題
  • 監控 TPU VM
  • 監控 TPU 健康狀態
  • 監控 TPU 輸送量
  • TPU 監控程式庫
  • 使用 tpu-info CLI 監控
  • 排解 PyTorch 模型問題
  • 排解 JAX 模型問題
  • 機器學習診斷平台
    • 總覽
    • 設定 GKE
    • 開始使用 SDK
    • 開始使用 CLI
    • 搭配 MaxText 使用 ML 診斷
    • 查看機器學習執行作業
    • 監控工作負載
  • 剖析 TPU
  • 剖析 TPU VM
  • 剖析多配量環境
  • 剖析 PyTorch/XLA 工作負載
  • Cloud TPU API
  • Discover
    • TPU 軟體版本
    • TPU 版本
      • TPU v3
      • TPU v2
  • 開始使用
    • 設定 Google Cloud 專案
    • 建立 TPU
    • 使用預留項目
    • 在 Cloud TPU VM 上執行 JAX
    • 在 Cloud TPU VM 上執行 PyTorch
    • 在 Cloud TPU 配量上執行 JAX
    • 在 Cloud TPU 配量上執行 PyTorch
  • 設定 TPU
    • 將 TPU 連線至共用虛擬私有雲網路
    • 連線至沒有公開 IP 位址的 TPU VM
    • 設定網路和存取權
    • 使用 CMEK 加密 TPU VM 開機磁碟
    • 使用跨專案服務帳戶
    • 將耐用的區塊儲存空間附加至 TPU VM
    • 連線至 Cloud Storage 值區
    • 在 TPU VM 上掛接 Filestore 執行個體
  • 管理 TPU
    • 管理 TPU 資源
    • 管理排入佇列的資源
    • 要求 TPU 彈性啟動 VM
    • 管理 TPU Spot VM
    • 為維護事件做好準備
    • 自動檢查點
    • 查看維護通知
    • 手動啟動主機維護
    • 先占 TPU
  • 執行工作負載
    • 使用 v6e 訓練模型
    • 使用 v5e 訓練模型
    • 使用 Ray 擴充機器學習工作負載
    • 在 Docker 容器中執行 TPU 應用程式
  • 監控及排解 TPU 問題
    • 排解 TPU VM 問題
    • 監控 TPU VM
    • 監控與記錄資訊主頁
    • 排解 TensorFlow 模型問題