Rozumienie mowy

Gemini może analizować dane wejściowe audio i generować odpowiedzi tekstowe.

Python

from google import genai
import base64

client = genai.Client()

uploaded_file = client.files.upload(file="path/to/sample.mp3")

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=[
        {"type": "text", "text": "Describe this audio clip"},
        {
            "type": "audio",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        }
    ]
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const client = new GoogleGenAI({});

const uploadedFile = await client.files.upload({
    file: "path/to/sample.mp3",
    config: { mime_type: "audio/mp3" }
});

const interaction = await client.interactions.create({
    model: "gemini-3.6-flash",
    input: [
        {type: "text", text: "Describe this audio clip"},
        {
            type: "audio",
            uri: uploadedFile.uri,
            mime_type: uploadedFile.mimeType
        }
    ]
});
console.log(interaction.output_text);

REST

# First upload the file, then use the URI:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "gemini-3.6-flash",
    "input": [
      {"type": "text", "text": "Describe this audio clip"},
      {
        "type": "audio",
        "uri": "YOUR_FILE_URI",
        "mime_type": "audio/mp3"
      }
    ]
  }'

Przegląd

Gemini może analizować i rozumieć dane wejściowe audio oraz generować odpowiedzi tekstowe, co umożliwia realizację takich przypadków użycia jak:

  • opisywanie, podsumowywanie lub odpowiadanie na pytania dotyczące treści audio,
  • transkrypcja i tłumaczenie (mowa na tekst),
  • rozdzielanie rozmówców (identyfikowanie różnych osób mówiących),
  • wykrywanie emocji w mowie i muzyce,
  • analizowanie konkretnych segmentów z sygnaturami czasowymi.

W przypadku interakcji głosowych i wideo w czasie rzeczywistym zapoznaj się z interfejsem Live API. Aby korzystać z modeli mowy na tekst, które obsługują transkrypcję w czasie rzeczywistym, użyj interfejsu Google Cloud Speech-to-Text API.

Transkrypcja mowy na tekst

Ten przykład pokazuje, jak transkrybować, tłumaczyć i podsumowywać mowę za pomocą sygnatur czasowych, rozdzielania rozmówców i wykrywania emocji przy użyciu