Kuptimi audio

Binjakët mund të analizojnë të dhënat audio dhe të gjenerojnë përgjigje me tekst.

Python

from google import genai
import base64

client = genai.Client()

uploaded_file = client.files.upload(file="path/to/sample.mp3")

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {"type": "text", "text": "Describe this audio clip"},
        {
            "type": "audio",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        }
    ]
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const client = new GoogleGenAI({});

const uploadedFile = await client.files.upload({
    file: "path/to/sample.mp3",
    config: { mime_type: "audio/mp3" }
});

const interaction = await client.interactions.create({
    model: "gemini-3.7-flash",
    input: [
        {type: "text", text: "Describe this audio clip"},
        {
            type: "audio",
            uri: uploadedFile.uri,
            mime_type: uploadedFile.mimeType
        }
    ]
});
console.log(interaction.output_text);

PUSHTIM

# First upload the file, then use the URI:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "gemini-3.7-flash",
    "input": [
      {"type": "text", "text": "Describe this audio clip"},
      {
        "type": "audio",
        "uri": "YOUR_FILE_URI",
        "mime_type": "audio/mp3"
      }
    ]
  }'

Përmbledhje

Gemini mund të analizojë dhe kuptojë të dhënat audio dhe të gjenerojë përgjigje me tekst, duke mundësuar raste përdorimi si:

  • Përshkruani, përmbledhni ose përgjigjuni pyetjeve rreth përmbajtjes audio
  • Transkriptim dhe përkthim (nga të folurit në tekst)
  • Diarizimi i folësit (identifikimi i folësve të ndryshëm)
  • Zbulimi i emocioneve në të folur dhe muzikë
  • Analizimi i segmenteve specifike me vula kohore

Për ndërveprimet me zë dhe video në kohë reale, shihni Live API . Për modele të dedikuara të të folurit në tekst me mbështetje për transkriptim në kohë reale, përdorni Google Cloud Speech-to-Text API .

Transkripto të folurit në tekst

Ky shembull tregon se si të transkriptohet, përkthehet dhe përmblidhet fjalimi me vula kohore, ditarizim të folësit dhe zbulim të emocioneve duke përdorur rezultate të strukturuara .

Python

from google import genai

client = genai.Client()

YOUTUBE_URL = "https://www.youtube.com/watch?v=ku-N-eS1lgM"

prompt = """
  Process the audio file and generate a detailed transcription.

  Requirements:
  1. Identify distinct speakers (e.g., Speaker 1, Speaker 2).
  2. Provide accurate timestamps for each segment (Format: MM:SS).
  3. Detect the primary language of each segment.
  4. If not English, provide the English translation.
  5. Identify the primary emotion: Happy, Sad, Angry, or Neutral.
  6. Provide a brief summary at the beginning.
"""

response_schema = {
    "type": "object",
    "properties": {
        "summary": {"type": "string"},
        "segments": {
            "type": "array",
            "items": {
                "type": "object",
                "properties": {
                    "speaker"