请求 TPU 灵活启动虚拟机

TPU 灵活启动虚拟机由动态工作负载调度器提供支持,是一种灵活且经济高效的方式,可让您访问 TPU 资源来运行 AI 工作负载。借助灵活启动虚拟机,您可以根据需要动态预配 TPU,最长可预配 7 天,而无需长期预留或复杂的配额管理。借助 TPU 灵活启动虚拟机,您可以提交 TPU 预配请求,该请求会一直存在,直到容量可用为止。TPU 虚拟机可用后,会按照您在请求中指定的时长运行。

TPU 灵活启动虚拟机非常适合快速实验、小规模测试、为推理工作负载动态预配 TPU、模型微调以及运行时间不到 7 天的工作负载。如需详细了解其他 TPU 使用选项,请参阅 Cloud TPU 使用选项

您可以随时删除 TPU 资源,以停止计费。如需详细了解 TPU 价格,请参阅 Cloud TPU 价格

限制

TPU 灵活启动虚拟机具有以下限制:

  • 您可以请求 TPU 灵活启动虚拟机,时长最多为 7 天。
  • 您可以请求以下 Cloud TPU 版本和可用区:
  • 您必须使用 Queued Resources API 才能使用 TPU 灵活启动虚拟机。

准备工作

在请求 TPU 灵活启动虚拟机之前,您必须执行以下操作:

  • 安装 Google Cloud CLI
  • 创建 Google Cloud 项目
  • 启用 Cloud TPU API

如需了解详情,请参阅设置 Cloud TPU 环境

您还应确保有足够的抢占式配额来使用 TPU 灵活启动虚拟机。如果您需要的 TPU 核心数超出默认配额授予的数量,则需要申请更高的配额分配。如需详细了解默认配额以及如何申请更多配额,请参阅 Cloud TPU 配额

请求 TPU 灵活启动虚拟机

TPU 灵活启动虚拟机使用 Queued Resources API 以排队方式请求 TPU 资源。请求的资源可用后,会分配给您的 Google Cloud 项目,供您立即专门使用。 在请求的运行时长结束后,系统会删除 TPU 虚拟机,并且已排队的资源会转换为 SUSPENDED 状态。如需详细了解已排队的资源,请参阅管理已排队的资源

如需请求 TPU 灵活启动虚拟机,请使用 gcloud alpha compute tpus queued-resources create 命令,并将 --provisioning-model 标志设置为 flex-start,将 --max-run-duration 标志设置为您希望 TPU 运行的时长。

gcloud alpha compute tpus queued-resources create QUEUED_RESOURCE_ID \
    --zone=ZONE \
    --accelerator-type=ACCELERATOR_TYPE \
    --runtime-version=RUNTIME_VERSION \
    --node-id=NODE_ID \
    --provisioning-model=flex-start \
    --max-run-duration=RUN_DURATION

替换以下占位符:

  • QUEUED_RESOURCE_ID:用户为已排队的资源请求分配的 ID。
  • ZONE:要在其中创建 TPU 虚拟机的可用区
  • ACCELERATOR_TYPE:指定要创建的 Cloud TPU 的版本和大小。如需详细了解每个 TPU 版本支持的加速器类型,请参阅 TPU 版本
  • RUNTIME_VERSION:Cloud TPU 软件版本