Gjenerimi i tekstit në të folur (TTS)

API-ja Gemini mund ta transformojë tekstin e futur në audio nga një ose shumë altoparlantë duke përdorur aftësitë e gjenerimit të tekstit në të folur (TTS) të Gemini. Gjenerimi i tekstit në të folur (TTS) është i kontrollueshëm , që do të thotë se mund të përdorni gjuhën natyrore për të strukturuar ndërveprimet dhe për të udhëhequr stilin , theksin , ritmin dhe tonin e audios.

Aftësia TTS ndryshon nga gjenerimi i të folurit i ofruar përmes Live API , i cili është projektuar për audio interaktive, të pastrukturuar dhe hyrje dhe dalje multimodale. Ndërsa Live API shkëlqen në kontekstet dinamike të bisedave, TTS përmes Gemini API është përshtatur për skenarë që kërkojnë recitim të saktë të tekstit me kontroll të imët mbi stilin dhe tingullin, siç është gjenerimi i podkasteve ose i audiolibrave.

Ky udhëzues ju tregon se si të gjeneroni audio me një dhe shumë altoparlantë nga teksti.

Para se të filloni

Sigurohuni që të përdorni një variant modeli Gemini 2.5 me aftësi tekst-në-fjalë (TTS) Gemini, siç listohen në seksionin Modelet e mbështetura . Për rezultate optimale, merrni në konsideratë se cili model i përshtatet më mirë rastit tuaj specifik të përdorimit.

Mund ta gjeni të dobishme të testoni modelet Gemini TTS në AI Studio përpara se të filloni ndërtimin.

TTS me një folës të vetëm

Për të konvertuar tekstin në audio me një altoparlant të vetëm, caktoni modalitetin e përgjigjes në "audio" dhe kaloni një objekt speech_config me një emër zëri. Do t'ju duhet të zgjidhni një emër zëri nga zërat e daljes të parapërgatitur.

Ky shembull ruan audion dalëse nga modeli në një skedar wave:

Python

from google import genai
import wave
import base64

def wave_file(filename, pcm, channels=1, rate=24000, sample_width=2):
    with wave.open(filename, "wb") as wf:
        wf.setnchannels(channels)
        wf.setsampwidth(sample_width)
        wf.setframerate(rate)
        wf.writeframes(pcm)

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.1-flash-tts-preview",
    input="Say cheerfully: Have a wonderful day!",
    response_format={"type": "audio"},
    generation_config={
        "speech_config": [
            {"voice": "Kore"}
        ]
    }
)

wave_file('out.wav', base64.b64decode(interaction.output_audio.data))

JavaScript

import {GoogleGenAI} from '@google/genai';
import wav from 'wav';

async function saveWaveFile(
   filename,
   pcmData,
   channels = 1,
   rate = 24000,
   sampleWidth = 2,
) {
   return new Promise((resolve, reject) => {
      const writer = new wav.FileWriter(filename, {
            channels,
            sampleRate: rate,
            bitDepth: sampleWidth * 8,
      });

      writer.on('finish', resolve);
      writer.on('error', reject);

      writer.write(pcmData);
      writer.end();
   });
}

async function main() {
   const client = new GoogleGenAI({});

   const interaction =