跳至主要內容
技術領域
close
AI 和機器學習
應用程式開發
應用程式託管
運算
資料分析和管道
資料庫
分散式雲端、混合雲和多雲端
產業解決方案
遷移
網路
觀測能力與監控
安全性
Storage
跨產品工具
close
存取權與資源管理
費用與用量管理
基礎架構即程式碼
SDK、語言、框架和工具
/
控制台
English
Deutsch
Español
Español – América Latina
Français
Indonesia
Italiano
Português
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
登入
Cloud TPU
免費試用
總覽
指南
參考資料
範例
支援
資源
技術領域
更多
總覽
指南
參考資料
範例
支援
資源
跨產品工具
更多
控制台
Discover
Cloud TPU 簡介
TPU 架構
TPU 版本
TPU7x (Ironwood)
TPU v6e
TPU v5p
TPU v5e
TPU v4
區域和可用區
Compute Engine 中的 Cloud TPU 資源
JAX AI 堆疊
開始使用
設定 Google Cloud 專案
快速入門導覽課程
建立 TPU 執行個體
建立多主機 TPU 配量
規劃 Cloud TPU 資源
預訂 TPU
關於 TPU 預留項目
預約最多 90 天的行程 (日曆模式)
要求一年或更久的未來預留項目
分享預訂資訊
使用預留項目
建立 TPU
TPU 建立機制簡介
建立 TPU VM 執行個體
建立 TPU Flex-start VM
建立 TPU Spot VM
MIG 中的 TPU 執行個體
為多主機 TPU 配量建立 MIG
為單一主機 TPU 配量建立 MIG
設定 TPU
設定網路和存取權
TPU OS 映像檔
使用自訂 OS 映像檔
使用 CMEK 加密 TPU VM 開機磁碟
使用跨專案服務帳戶
管理儲存空間
TPU VM 的儲存空間選項
儲存空間最佳做法
附加儲存磁碟
連線至 Cloud Storage 值區
管理 TPU
使用 Compute Engine 管理 TPU 資源
在受管理容量模式下管理維護事件
在「所有容量」模式下管理 TPU
All Capacity 模式簡介
要求預訂「所有容量」模式
查看「所有容量」模式 TPU 的拓撲和健康狀態
在「所有容量」模式中回報及修復出錯的主機
在「所有容量」模式下管理維護事件
多切片訓練
排定推論工作負載的 TPU 集合
執行工作負載
使用 TPU7x 訓練模型
在 Cloud TPU 上執行推論
在 Cloud TPU 配量上訓練
在 TPU 上調度模型資源
使用圖片資料集
轉換圖片分類資料集,以便用於 Cloud TPU
下載、預先處理及上傳 ImageNet 資料集
下載、預先處理及上傳 COCO 資料集
發揮最佳效能
Cloud TPU 效能指南
使用 bfloat16 提升模型效能
TPU7x (Ironwood) 效能最佳化
監控及排解 TPU 問題
監控 TPU VM
監控 TPU 健康狀態
監控 TPU 輸送量
TPU 監控程式庫
使用 tpu-info CLI 監控
排解 PyTorch 模型問題
排解 JAX 模型問題
機器學習診斷平台
總覽
設定 GKE
開始使用 SDK
開始使用 CLI
搭配 MaxText 使用 ML 診斷
查看機器學習執行作業
監控工作負載
剖析 TPU
剖析 TPU VM
剖析多配量環境
剖析 PyTorch/XLA 工作負載
Cloud TPU API
Discover
TPU 軟體版本
TPU 版本
TPU v3
TPU v2
開始使用
設定 Google Cloud 專案
建立 TPU
使用預留項目
在 Cloud TPU VM 上執行 JAX
在 Cloud TPU VM 上執行 PyTorch
在 Cloud TPU 配量上執行 JAX
在 Cloud TPU 配量上執行 PyTorch
設定 TPU
將 TPU 連線至共用虛擬私有雲網路
連線至沒有公開 IP 位址的 TPU VM
設定網路和存取權
使用 CMEK 加密 TPU VM 開機磁碟
使用跨專案服務帳戶
將耐用的區塊儲存空間附加至 TPU VM
連線至 Cloud Storage 值區
在 TPU VM 上掛接 Filestore 執行個體
管理 TPU
管理 TPU 資源
管理排入佇列的資源
要求 TPU 彈性啟動 VM
管理 TPU Spot VM
為維護事件做好準備
自動檢查點
查看維護通知
手動啟動主機維護
先占 TPU
執行工作負載
使用 v6e 訓練模型
使用 v5e 訓練模型
使用 Ray 擴充機器學習工作負載
在 Docker 容器中執行 TPU 應用程式
監控及排解 TPU 問題
排解 TPU VM 問題
監控 TPU VM
監控與記錄資訊主頁
排解 TensorFlow 模型問題
Cloud TPU 錯誤字彙表
Cloud TPU 稽核記錄
教學課程和筆記本
使用 PyTorch 訓練 ResNet
在 v6e 上進行 MaxDiffusion 推論
筆記本
AI 和機器學習
應用程式開發
應用程式託管
運算
資料分析和管道
資料庫
分散式雲端、混合雲和多雲端
產業解決方案
遷移
網路
觀測能力與監控
安全性
Storage
存取權與資源管理
費用與用量管理
基礎架構即程式碼
SDK、語言、框架和工具