Migre para a versão mais recente da Cloud Speech-to-Text API

A API Cloud Speech-to-Text V2 oferece o mais recente Google Cloud design de API para os clientes para cumprir os requisitos regulamentares e de segurança empresariais de imediato.

Estes requisitos são concretizados através do seguinte:

  • Residência de dados: o Cloud STT V2 oferece a vasta gama dos nossos modelos de transcrição existentes em Google Cloud regiões, como a Bélgica ou Singapura. Isto permite a invocação dos nossos modelos de transcrição através de um serviço totalmente regionalizado.

  • Engenhosidade do reconhecedor: os reconhecedores são configurações de reconhecimento reutilizáveis que podem conter uma combinação de modelo, idioma e funcionalidades.

  • Registo: a criação de recursos e as transcrições geram registos disponíveis na consola, o que permite uma melhor telemetria e depuração. Google Cloud

  • Encriptação: o Cloud Speech-to-Text V2 suporta chaves de encriptação geridas pelo cliente para todos os recursos, bem como a transcrição em lote.

  • Deteção automática de áudio: o Cloud Speech-to-Text V2 pode detetar automaticamente a taxa de amostragem, a contagem de canais e o formato dos seus ficheiros de áudio, sem necessidade de fornecer essas informações na configuração do pedido.

Migrar da V1 para a V2

A migração da API V1 para a API V2 não ocorre automaticamente. São necessárias alterações de implementação mínimas para tirar partido do conjunto de funcionalidades.

Migrar na API

Semelhante ao Cloud STT V1, para transcrever áudio, tem de criar um RecognitionConfig selecionando o idioma do áudio e o modelo de reconhecimento à sua escolha:

Python

import os

from google.cloud.speech_v2 import SpeechClient
from google.cloud.speech_v2.types import cloud_speech

PROJECT_ID = os.getenv("GOOGLE_CLOUD_PROJECT")


def quickstart_v2(audio_file: str) -> cloud_speech.RecognizeResponse:
    """Transcribe an audio file.
    Args:
        audio_file (str): Path to the local audio file to be transcribed.
    Returns:
        cloud_speech.RecognizeResponse: The response from the recognize request, containing
        the transcription results
    """
    # Reads a file as bytes
    with open(audio_file, "rb") as f:
        audio_content = f.read()

    # Instantiates a client
    client = SpeechClient()

    config = cloud_speech.RecognitionConfig(
        auto_decoding_config=cloud_speech.AutoDetectDecodingConfig(),
        language_codes=["en-US"],
        model="long",
    )

    request = cloud_speech.RecognizeRequest(
        recognizer=f"projects/{PROJECT_ID}/locations/global/recognizers/_",
        config=config,
        content=audio_content,
    )

    # Transcribes the audio into text
    response = client.