Gemini może analizować dane wejściowe audio i generować odpowiedzi tekstowe.
Python
from google import genai
import base64
client = genai.Client()
uploaded_file = client.files.upload(file="path/to/sample.mp3")
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=[
{"type": "text", "text": "Describe this audio clip"},
{
"type": "audio",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
}
]
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const client = new GoogleGenAI({});
const uploadedFile = await client.files.upload({
file: "path/to/sample.mp3",
config: { mime_type: "audio/mp3" }
});
const interaction = await client.interactions.create({
model: "gemini-3.6-flash",
input: [
{type: "text", text: "Describe this audio clip"},
{
type: "audio",
uri: uploadedFile.uri,
mime_type: uploadedFile.mimeType
}
]
});
console.log(interaction.output_text);
REST
# First upload the file, then use the URI:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.6-flash",
"input": [
{"type": "text", "text": "Describe this audio clip"},
{
"type": "audio",
"uri": "YOUR_FILE_URI",
"mime_type": "audio/mp3"
}
]
}'
Przegląd
Gemini może analizować i rozumieć dane wejściowe audio oraz generować odpowiedzi tekstowe, co umożliwia realizację takich przypadków użycia jak:
- opisywanie, podsumowywanie lub odpowiadanie na pytania dotyczące treści audio,
- transkrypcja i tłumaczenie (mowa na tekst),
- rozdzielanie rozmówców (identyfikowanie różnych osób mówiących),
- wykrywanie emocji w mowie i muzyce,
- analizowanie konkretnych segmentów z sygnaturami czasowymi.
W przypadku interakcji głosowych i wideo w czasie rzeczywistym zapoznaj się z interfejsem Live API. Aby korzystać z modeli mowy na tekst, które obsługują transkrypcję w czasie rzeczywistym, użyj interfejsu Google Cloud Speech-to-Text API.
Transkrypcja mowy na tekst
Ten przykład pokazuje, jak transkrybować, tłumaczyć i podsumowywać mowę za pomocą sygnatur czasowych, rozdzielania rozmówców i wykrywania emocji przy użyciu