Introducción a la TPU de Cloud
Las unidades de procesamiento de tensor (TPU) son circuitos integrados para aplicaciones específicas (ASIC) que se desarrollan de forma personalizada y se utilizan para agilizar cargas de trabajo de aprendizaje automático. Para obtener más información sobre el hardware de las TPU, consulta Arquitectura de las TPU. TPU de Cloud es un servicio web que ofrece TPUs como recursos de computación escalables en Google Cloud.
Las TPUs entrenan tus modelos de forma eficiente usando hardware diseñado para realizar operaciones de matrices grandes que suelen encontrarse en los algoritmos de aprendizaje automático. Las TPUs tienen memoria de alto ancho de banda (HBM) en el chip, lo que te permite usar modelos y tamaños de lote más grandes. Las TPUs se pueden conectar en grupos llamados "slices" que escalan tus cargas de trabajo con pocos o ningún cambio en el código.
El código que se ejecuta en las TPUs debe compilarse con el compilador de álgebra lineal del acelerador (XLA). XLA es un compilador just-in-time que toma el gráfico emitido por una aplicación de framework de aprendizaje automático y compila los componentes de álgebra lineal, pérdida y gradiente del gráfico en código de máquina de TPU. El resto del programa se ejecuta en la máquina host de la TPU. El compilador XLA forma parte de la imagen de VM de TPU que se ejecuta en una máquina host de TPU.
Para obtener más información sobre las unidades de procesamiento de tensor, consulta Cómo usar las TPUs.
Cuándo usar las TPUs
Las TPUs de Cloud están optimizadas para cargas de trabajo específicas. En algunas situaciones, puede que quieras usar GPUs o CPUs en instancias de Compute Engine para ejecutar tus cargas de trabajo de aprendizaje automático. En general, puedes decidir qué hardware es el más adecuado para tu carga de trabajo según las directrices que se indican a continuación.
CPUs
- Prototipos rápidos que requieren la máxima flexibilidad