Binjakët mund të analizojnë të dhënat audio dhe të gjenerojnë përgjigje me tekst.
Python
from google import genai
import base64
client = genai.Client()
uploaded_file = client.files.upload(file="path/to/sample.mp3")
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{"type": "text", "text": "Describe this audio clip"},
{
"type": "audio",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
}
]
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const client = new GoogleGenAI({});
const uploadedFile = await client.files.upload({
file: "path/to/sample.mp3",
config: { mime_type: "audio/mp3" }
});
const interaction = await client.interactions.create({
model: "gemini-3.7-flash",
input: [
{type: "text", text: "Describe this audio clip"},
{
type: "audio",
uri: uploadedFile.uri,
mime_type: uploadedFile.mimeType
}
]
});
console.log(interaction.output_text);
PUSHTIM
# First upload the file, then use the URI:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.7-flash",
"input": [
{"type": "text", "text": "Describe this audio clip"},
{
"type": "audio",
"uri": "YOUR_FILE_URI",
"mime_type": "audio/mp3"
}
]
}'
Përmbledhje
Gemini mund të analizojë dhe kuptojë të dhënat audio dhe të gjenerojë përgjigje me tekst, duke mundësuar raste përdorimi si:
- Përshkruani, përmbledhni ose përgjigjuni pyetjeve rreth përmbajtjes audio
- Transkriptim dhe përkthim (nga të folurit në tekst)
- Diarizimi i folësit (identifikimi i folësve të ndryshëm)
- Zbulimi i emocioneve në të folur dhe muzikë
- Analizimi i segmenteve specifike me vula kohore
Për ndërveprimet me zë dhe video në kohë reale, shihni Live API . Për modele të dedikuara të të folurit në tekst me mbështetje për transkriptim në kohë reale, përdorni Google Cloud Speech-to-Text API .
Transkripto të folurit në tekst
Ky shembull tregon se si të transkriptohet, përkthehet dhe përmblidhet fjalimi me vula kohore, ditarizim të folësit dhe zbulim të emocioneve duke përdorur rezultate të strukturuara .
Python
from google import genai
client = genai.Client()
YOUTUBE_URL = "https://www.youtube.com/watch?v=ku-N-eS1lgM"
prompt = """
Process the audio file and generate a detailed transcription.
Requirements:
1. Identify distinct speakers (e.g., Speaker 1, Speaker 2).
2. Provide accurate timestamps for each segment (Format: MM:SS).
3. Detect the primary language of each segment.
4. If not English, provide the English translation.
5. Identify the primary emotion: Happy, Sad, Angry, or Neutral.
6. Provide a brief summary at the beginning.
"""
response_schema = {
"type": "object",
"properties": {
"summary": {"type": "string"},
"segments": {
"type": "array",
"items": {
"type": "object",
"properties": {
"speaker"