Modelle

In diesem Leitfaden werden alle Modelle vorgestellt, die über die Gemini API verfügbar sind.


Gemini 3

Stabil

Vorschau

Alle Gemini 3-Modelle

Modell Endpunkt
Gemini 3.1 Pro
gemini-3.1-pro-preview
Gemini 3.5 Flash
gemini-3.5-flash
Gemini 3 Flash
gemini-3-flash-preview
Gemini 3.1 Flash-Lite
gemini-3.1-flash-lite
Nano Banana 2
gemini-3.1-flash-image
Nano Banana 2 Lite
gemini-3.1-flash-lite-image
Nano Banana Pro
gemini-3-pro-image
Gemini 3.5 Live-Übersetzung
gemini-3.5-live-translate-preview
Gemini 3.1 Flash Live
gemini-3.1-flash-live-preview
Gemini 3.1 Flash TTS
gemini-3.1-flash-tts-preview

Gemini 2.5 Flash

Modell Beschreibung Endpunkt
Gemini 2.5 Flash Unser bestes Preis-Leistungs-Modell für latenzarme Aufgaben mit hohem Volumen, die Reasoning erfordern.
gemini-2.5-flash
Nano Banana Hochmoderne native Bildgenerierung und ‑bearbeitung für schnelle, kreative Workflows.
gemini-2.5-flash-image
Gemini 2.5 Flash Live Optimiert für Konversationsagenten in Echtzeit mit nativem Audio-Streaming in weniger als einer Sekunde.
gemini-2.5-flash-native-audio-preview-12-2025
Gemini 2.5 Flash TTS Steuerbare Text-zu-Sprache-Audio-Generierung mit präziser Steuerung von Stil und Tempo.
gemini-2.5-flash-preview-tts

Gemini 2.5 Flash-Lite

Modell Beschreibung Endpunkt
Gemini 2.5 Flash Lite Das schnellste und kostengünstigste multimodale Modell der 2.5-Familie.
gemini-2.5-flash-lite

Gemini 2.5 Pro

Modell Beschreibung Endpunkt
Gemini 2.5 Pro Unser fortschrittlichstes Modell für komplexe Aufgaben mit umfassenden Funktionen für logisches Denken und Programmieren in der 2.5-Familie.
gemini-2.5-pro
Gemini 2.5 Pro TTS Sprachsynthese mit hoher Wiedergabetreue, die für Qualität in strukturierten Workflows wie Podcasts und Hörbüchern optimiert ist.
gemini-2.5-pro-preview-tts

Audiomodelle

Dieser Abschnitt enthält alle Audiomodelle, auch solche, die möglicherweise bereits in anderen Abschnitten aufgeführt sind.

Modell Beschreibung Endpunkt
Gemini 3.1 Flash Live Unser hochwertiges Audio-zu-Audio-Modell (A2A) mit geringer Latenz wurde für Echtzeitdialoge und KI-Anwendungen mit Sprachsteuerung entwickelt.
gemini-3.1-flash-live-preview
Gemini 3.1 Flash TTS Leistungsstarke Sprachgenerierung mit geringer Latenz, natürlichen Ausgaben, steuerbaren Prompts und neuen ausdrucksstarken Audio-Tags für eine präzise Steuerung der Sprachausgabe.
gemini-3.1-flash-tts-preview
Gemini 2.5 Flash Live Unser Flaggschiff-Live API-Modell für bidirektionale Sprach- und Videoagenten mit geringer Latenz und nativer Audioanalyse.
gemini-2.5-flash-native-audio-preview-12-2025
Gemini 2.5 Flash TTS Schnelle und steuerbare Sprachsynthese für kostengünstige Anwendungen mit geringer Latenz und Echtzeit-Assistenten.
gemini-2.5-flash-preview-tts
Gemini 2.5 Pro TTS Sprachsynthese mit hoher Wiedergabetreue, die für Qualität in strukturierten Workflows wie Podcasts und Hörbüchern optimiert ist.
gemini-2.5-pro-preview-tts

Generative Medienmodelle

Dieser Abschnitt enthält alle generativen Media-Modelle, auch solche, die möglicherweise bereits in anderen Abschnitten aufgeführt sind.

Modell Beschreibung Endpunkt
Nano Banana 2 Hocheffiziente visuelle Inhalte in Produktionsqualität erstellen – mit der Intelligenz der Gemini 3-Serie und blitzschnellen Generierungsgeschwindigkeiten.
gemini-3.1-flash-image
Nano Banana 2 Lite Dieses Modell wurde als Effizienzspezialist der Bildgenerierungsfamilie entwickelt und bietet eine extrem niedrige Latenz sowie eine kostengünstige Bildgenerierung und ‑bearbeitung.
gemini-3.1-flash-lite-image
Veo 3.1 Hochmoderne filmische Videogenerierung mit erweiterten kreativen Steuerungselementen und nativ synchronisiertem Audio.
veo-3.1-generate-preview
Nano Banana Pro Eine professionelle Design-Engine mit einem Reasoning-Kern für 4K-Visuals in Studioqualität, komplexe Layouts und präzises Textrendering.
gemini-3-pro-image
Veo 3.1 Lite Hocheffiziente, kostengünstige Videogenerierung, ‑bearbeitung und filmreife Steuerung für Entwickler aus der Veo 3.1-Familie.
veo-3.1-lite-generate-preview
Gemini Omni Flash Schnelles, konversationelles Generieren und Bearbeiten von Videos. Sie können Text und Bilder in Videos umwandeln und die Ergebnisse mithilfe natürlicher Sprache optimieren.
gemini-omni-flash
Nano Banana Hochmoderne native Bildgenerierung und ‑bearbeitung für schnelle, kreative Workflows.
gemini-2.5-flash-image
Imagen 4 (eingestellt) Text-zu-Bild-Modell mit schneller und ultraschneller Generierung und außergewöhnlicher Klarheit bis zu einer Auflösung von 2K.
imagen-4.0-generate

Modelle zur Musikgenerierung

Dieser Abschnitt enthält alle Modelle zur Musikgenerierung, auch solche, die möglicherweise bereits in anderen Abschnitten aufgeführt sind.

Modell Beschreibung Endpunkt
Lyria 3 Pro Unser Flagship-Modell für die Musikgenerierung, optimiert für Songs in voller Länge mit komplexer struktureller Kohärenz.
lyria-3-pro-preview
Lyria 3 Clip Optimiert für die Generierung kurzer Musikclips, Loops und Vorschauen von bis zu 30 Sekunden Länge.
lyria-3-clip-preview
Lyria RealTime Modell zur Musikgenerierung mit hoher Qualität, das eine detaillierte kreative Kontrolle und Echtzeit-Streaming ermöglicht.
lyria-realtime-exp

Tool- und Agent-Modelle

Modell Beschreibung Endpunkt
Computer Use Ein spezialisiertes Modell, das einen digitalen Bildschirm „sehen“ und Benutzeroberflächenaktionen wie Klicken, Tippen und Navigieren ausführen kann, um komplexe Browseraufgaben zu automatisieren.
gemini-2.5-computer-use-preview-10-2025
Gemini Deep Research Ein agentisches Modell, das autonom mehrstufige Recherchen in Hunderten von Quellen plant und ausführt, um zitierte, interaktive Berichte zu erstellen.
deep-research-preview-04-2026
Gemini Deep Research Max Maximale Vollständigkeit für die automatische Kontextbeschaffung und ‑synthese aus Hunderten von Quellen.
deep-research-max-preview-04-2026
Antigravity-Agent Ein Agent für allgemeine Zwecke, der autonom plant, Schlussfolgerungen zieht, Code ausführt, Dateien verwaltet und das Web in einer sicheren, isolierten Linux-Sandbox durchsucht.
antigravity-preview-05-2026

Spezialisierte Aufgabenmodelle

Modell Beschreibung Endpunkt
Gemini Embedding 2 Unser erstes multimodales Einbettungsmodell, das Text, Bilder, Videos, Audio und PDFs in einen einheitlichen Einbettungsbereich für erweiterte semantische Such- und RAG-Systeme (Retrieval-Augmented Generation) umwandelt.
gemini-embedding-2-preview
Gemini Embedding Hochdimensionale Vektordarstellungen für erweiterte semantische Suche, Textklassifizierung und RAG-Systeme.
gemini-embedding-001
Gemini Robotics ER 2 Ein Modell für verkörperte Schlussfolgerungen, das fortschrittliches Videoverständnis, räumliches Denken, mehrstufige Tool-Orchestrierung und die Zusammenarbeit mehrerer Roboter für Robotikaufgaben bietet.