Como fazer o download, o pré-processamento e o upload do conjunto de dados COCO

O COCO é um conjunto de dados de detecção, segmentação e legendagem de objetos em grande escala. Os modelos de machine learning que usam o conjunto de dados COCO incluem:

  • Mask-RCNN
  • RetinaNet
  • ShapeMask

Antes de treinar um modelo em um Cloud TPU, você precisa preparar os dados de treinamento.

Neste documento, descrevemos como preparar o conjunto de dados COCO para modelos executados no Cloud TPU. O conjunto de dados COCO só pode ser preparado depois que você cria uma VM do Compute Engine. O script usado para preparar os dados, download_and_preprocess_coco.sh, é instalado na VM e precisa ser executado nela.

Depois de preparar os dados executando o script download_and_preprocess_coco.sh, você pode abrir o Cloud TPU e executar o treinamento.

O download, o pré-processamento e o upload completos do conjunto de dados COCO em um bucket do Cloud Storage levam aproximadamente duas horas.

  1. No Cloud Shell, configure gcloud com o ID do projeto.

    export PROJECT_ID=project-id
    gcloud config set project ${PROJECT_ID}
  2. No Cloud Shell, crie um bucket do Cloud Storage usando o seguinte comando:

    gcloud storage buckets create gs://bucket-name --project=${PROJECT_ID} --location=us-central2
  3. Crie uma VM do Compute Engine para fazer o download e o pré-processamento do conjunto de dados. Para mais informações, consulte Criar e iniciar uma instância do Compute Engine.

    $ gcloud compute instances create vm-name \
        --zone=us-central2-b \
        --image-family=ubuntu-2204-lts \
        --image-project=ubuntu-os-cloud \
        --machine-type=n1-standard-16 \
        --boot-disk-size=300GB \
        --scopes=https://www.googleapis.com/auth/cloud-platform
  4. Conecte-se à VM do Compute Engine usando SSH:

    $ gcloud compute ssh vm-name --zone=us-central2-b

    Quando você se conecta à VM, o prompt de shell muda de username@projectname para username@vm-name.

  5. Configure duas variáveis: uma para o bucket de armazenamento criado anteriormente e outra para o diretório que contém os dados de treinamento (DATA_DIR) no bucket de armazenamento.

    (vm)$ export STORAGE_BUCKET=gs://bucket-name
    (vm)$ export DATA_DIR=${STORAGE_BUCKET}/coco
  6. Instale os pacotes necessários para pré-processar os dados.