Sprachausgabe

Mit der Gemini API kann Texteingabe mithilfe der Gemini-Funktionen zur Text-zu-Sprache-Generierung (TTS) in Audio mit einem oder mehreren Sprechern umgewandelt werden. Die TTS-Generierung (Text-to-Speech) ist steuerbar. Das bedeutet, dass Sie mit natürlicher Sprache Interaktionen strukturieren und den Stil, Akzent, Rhythmus und Ton des Audiosignals festlegen können.

Die TTS-Funktion unterscheidet sich von der Sprachgenerierung über die Live API, die für interaktive, unstrukturierte Audio- sowie multimodale Ein- und Ausgaben konzipiert ist. Während die Live API sich durch dynamische Konversationskontexte auszeichnet, ist TTS über die Gemini API auf Szenarien zugeschnitten, die eine genaue Textwiedergabe mit detaillierter Steuerung von Stil und Klang erfordern, z. B. die Generierung von Podcasts oder Hörbüchern.

In dieser Anleitung erfahren Sie, wie Sie Audio mit einem oder mehreren Sprechern aus Text generieren.

Hinweis

Achten Sie darauf, dass Sie eine Gemini 2.5-Modellvariante mit Gemini-TTS-Funktionen (Text-zu-Sprache) verwenden, wie im Abschnitt Unterstützte Modelle aufgeführt. Für optimale Ergebnisse sollten Sie überlegen, welches Modell am besten zu Ihrem spezifischen Anwendungsfall passt.

Es kann hilfreich sein, die Gemini TTS-Modelle in AI Studio zu testen, bevor Sie mit der Entwicklung beginnen.

TTS für einen einzelnen Sprecher

Wenn Sie Text in Audio mit einem einzelnen Sprecher umwandeln möchten, legen Sie die Antwortmodalität auf „audio“ fest und übergeben Sie ein speech_config-Objekt mit einem Sprachnamen. Sie müssen einen Namen für die Stimme aus den vorkonfigurierten Ausgabestimmen auswählen.

In diesem Beispiel wird die Audioausgabe des Modells in einer WAV-Datei gespeichert:

Python

from google import genai
import wave
import base64

def wave_file(filename, pcm, channels=1, rate=24000, sample_width=2):
    with wave.open(filename, "wb") as wf:
        wf.setnchannels(channels)
        wf.setsampwidth(sample_width)
        wf.setframerate(rate)
        wf.writeframes