Détecter des thèmes

L'API Cloud Vision peut détecter et extraire des informations sur les entités d'une image, dans un large groupe de catégories.

Les étiquettes permettent d'identifier d'une manière générale des objets, des lieux, des activités, des espèces animales, des produits, etc. Si vous avez besoin d'étiquettes personnalisées ciblées, Cloud AutoML Vision vous permet d'entraîner un modèle de machine learning personnalisé pour classifier des images.

Les étiquettes ne sont renvoyées qu'en anglais. L'API Cloud Translation peut traduire les libellés en anglais dans plusieurs autres langues.

Image de la rue Ward du quartier Setagaya
Crédit image :Alex Knight sur Unsplash

Par exemple, l'image ci-dessus peut correspondre à la liste de libellés suivante :

Description Note
Rue 0.872
Instantané 0.852
Ville 0.848
Nuit 0.804
Allée 0.713

Requêtes de détection de thèmes

Configurer votre projet Google Cloud et votre authentification

Détecter des thèmes dans une image locale

L'API Vision permet de détecter des caractéristiques dans un fichier image local.

Pour les requêtes REST, envoyez le contenu du fichier image en tant que chaîne encodée en base64 dans le corps de votre requête.

Pour les requêtes gcloud et les bibliothèques clientes, spécifiez le chemin d'accès à une image locale dans votre requête.

REST

Avant d'utiliser les données de requête ci-dessous, effectuez les remplacements suivants :

  • BASE64_ENCODED_IMAGE : représentation en base64 (chaîne ASCII) de vos données d'image binaires. Cette chaîne doit ressembler à la chaîne suivante :
    • /9j/4QAYRXhpZgAA...9tAVx/zDQDlGxn//2Q==
    Consultez la section encodage en base64 pour plus d'informations.
  • RESULTS_INT : (facultatif) valeur entière des résultats à renvoyer. Si vous omettez le champ "maxResults" et sa valeur, l'API renvoie la valeur par défaut de 10 résultats. Ce champ ne s'applique pas aux types de fonctionnalités suivants : TEXT_DETECTION, DOCUMENT_TEXT_DETECTION ni CROP_HINTS.
  • PROJECT_ID : ID de votre projet Google Cloud .

Méthode HTTP et URL :

POST https://vision.googleapis.com/v1/images:annotate

Corps JSON de la requête :

{
  "requests": [
    {
      "image": {
        "content": "BASE64_ENCODED_IMAGE"
      },
      "features": [
        {
          "maxResults": RESULTS_INT,
          "type": "LABEL_DETECTION"
        }
      ]
    }
  ]
}

Pour envoyer votre requête, choisissez l'une des options suivantes :

curl

Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :

curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "x-goog-user-project: PROJECT_ID" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://vision.googleapis.com/v1/images:annotate"

PowerShell

Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :

$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred"; "x-goog-user-project" = "PROJECT_ID" }

Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://vision.googleapis.com/v1/images:annotate" | Select-Object -Expand Content

Si la requête aboutit, le serveur affiche un code d'état HTTP 200 OK et la réponse au format JSON.

Une réponse LABEL_DETECTION inclut les étiquettes détectées, leur score, leur thématique et un ID d'étiquette opaque, où :

  • mid, s'il est présent, contient un identifiant généré automatiquement correspondant à l'entrée de l'entité sur Google Knowledge Graph. Notez que les valeurs mid restent uniques dans les différentes langues. Vous pouvez donc les utiliser pour associer des entités dans différentes langues. Pour inspecter ces valeurs mid, consultez la documentation de l'API Google Knowledge Graph.
  • description : description du libellé.
  • score : score de confiance, qui varie de 0 (niveau de confiance nul) à 1 (niveau de confiance très élevé).
  • topicality : pertinence du libellé ICA (Image Content Annotation) par rapport à l'image. Cette valeur permet de mesurer l'importance d'une étiquette par rapport au contexte global d'une page.
{
  "responses": [
    {
      "labelAnnotations": [
        {
          "mid": "/m/01c8br",
          "description": "Street",
          "score": 0.87294734,
          "topicality": 0.87294734
        },
        {
          "mid": "/m/06pg22",
          "description": "Snapshot",
          "score": 0.8523099,
          "topicality": 0.8523099
        },
        {
          "mid": "/m/0dx1j",
          "description": "Town",
          "score": 0.8481104,
          "topicality": 0.8481104
        },
        {
          "mid": "/m/01d74z",
          "description": "Night",
          "score": 0.80408716,
          "topicality": 0.80408716
        },
        {
          "mid": "/m/01lwf0",
          "description": "Alley",
          "score": 0.7133322,
          "topicality": 0.7133322
        }
      ]
    }
  ]
}

Go

Avant d'essayer cet exemple, suivez les instructions de configuration pour Go décrites dans le guide de démarrage rapide de Vision à l'aide des bibliothèques clientes. Pour en savoir plus, consultez la documentation de référence de l'API Vision pour Go.

Pour vous authentifier auprès de Vision, configurez le service Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.


// detectLabels gets labels from the Vision API for an image at the given file path.
func detectLabels(w io.Writer, file string) error {
	ctx := context.Background()

	client, err := vision.NewImageAnnotatorClient(ctx)
	if err != nil {
		return err
	}

	f, err := os.Open(file)
	if err != nil {
		return err
	}
	defer f.Close()

	image, err := vision.NewImageFromReader(f)
	if err != nil {
		return err
	}
	annotations, err := client.DetectLabels(ctx, image