Gemini (lateinisch Zwillinge) ist die von Google DeepMind entwickelte Familie multimodaler Foundation-Modelle, die seit Dezember 2023 unter diesem Namen veröffentlicht wird und gleichzeitig den ChatGPT-vergleichbaren Konsumenten-Assistenten Googles bezeichnet.
Die Gemini-Modellfamilie umfasst Stand 2025/2026 mehrere Größenklassen (Ultra, Pro, Flash, Flash-Lite, Nano) und mehrere Generationen (1.0, 1.5, 2.0, 2.5, 3, 3.1, 3.5) und konkurriert primär mit OpenAIs GPT-Familie und Anthropics Claude-Familie.
Zentral sind die nativ multimodale Trainings-Architektur (Verarbeitung von Text, Bild, Audio, Video, Code in einem gemeinsamen Modell von Beginn an) und eine Mixture-of-Experts-Architektur ab Gemini 1.5. Hinzu kommt ein Kontextfenster, das mit 1 Million Tokens (Gemini 1.5 Pro, Februar 2024) und 2 Millionen Tokens (Gemini 1.5 Pro Update Juni 2024) die jeweiligen Konkurrenz-Modelle deutlich übertraf.
Zusammenfassung
Gemini entstand aus der Konsolidierung der KI-Forschung bei Google nach der Vereinigung von Google Brain (Jeff Dean, Greg Corrado, Andrew Ng) und DeepMind (Demis Hassabis) im April 2023 unter Hassabis als CEO.
Der Modellname wurde erstmals auf der Google I/O 2023 (10. Mai 2023) angekündigt, die erste Generation am 6. Dezember 2023 in den drei Größen Ultra, Pro und Nano veröffentlicht.
Die Hauptbeiträge der Gemini-Linie umfassen erstens das nativ multimodale Pre-Training (statt nachträglicher Fusion separat trainierter Encoder) und zweitens die Mixture-of-Experts-Architektur (MoE) ab Gemini 1.5 (Februar 2024). Drittens kommt das Long-Context-Kontextfenster (1 Million Tokens, später 2 Millionen Tokens) hinzu, viertens die Reasoning-Linie mit Gemini 2.5 Pro Deep Think (Mai 2025).
Die Modellfamilie ist über die Gemini-App, die Google-Workspace-Integration, die Google-Cloud-Vertex-AI-Plattform und das Google-AI-Studio zugänglich. Gemini ist Stand Mai 2026 eines der drei führenden Frontier-Modelle der weltweiten LLM-Landschaft.
Begriffsgeschichte
Vorgeschichte: PaLM, Bard und die Brain-DeepMind-Fusion (2022–2023)
Die Vorgeschichte des Gemini-Modells liegt in zwei parallelen Google-Forschungslinien. Google Brain publizierte 2022 das Pathways Language Model (PaLM, Chowdhery u. a., arXiv 2204.02311) mit 540 Milliarden Parametern; nachfolgend PaLM 2 (Mai 2023). DeepMind publizierte 2022 das Chinchilla-Skalierungsgesetz (Hoffmann u. a. arXiv 2203.15556) und 2022 das multimodale Flamingo-Modell (Alayrac u. a. NeurIPS 2022).
Auf Druck durch die ChatGPT-Veröffentlichung (30. November 2022) startete Google am 6. Februar 2023 den auf LaMDA basierenden Assistenten Bard als ChatGPT-Konkurrent – ein erster Versuch unter erheblichem Zeitdruck.
Er führte in mehreren öffentlichen Demonstrationen zu Fehlern, unter anderem einer fehlerhaften Aussage über das James-Webb-Teleskop in einer Demo am 8. Februar 2023, die zu einem Kurssturz der Alphabet-Aktie um etwa 100 Milliarden US-Dollar führte.
Am 20. April 2023 kündigte Google-CEO Sundar Pichai die organisatorische Vereinigung von Google Brain und DeepMind zu Google DeepMind unter Demis Hassabis an. Diese Fusion war die methodisch entscheidende organisatorische Voraussetzung der Gemini-Entwicklung.
Gemini 1.0 (Dezember 2023)
Auf der Google I/O am 10. Mai 2023 wurde der Modellname Gemini erstmals öffentlich angekündigt. Die erste Generation wurde am 6. Dezember 2023 in drei Größen veröffentlicht: Gemini Ultra (größte Variante, als ChatGPT-4-Konkurrent positioniert), Gemini Pro (mittlere Variante, ab Dezember 2023 in Bard integriert) und Gemini Nano (kleinste Variante, für Pixel-Smartphone-Anwendungen).
Die wichtigste Demonstration zum Launch – ein Video, das Geminis multimodale Echtzeit-Fähigkeiten zeigte – wurde im Verlauf der Folgewoche als nachträglich geschnitten und beschönigt aufgedeckt. Die Kontroverse („Gemini Demo Was Faked”, The Verge, 8. Dezember 2023) war eine substantielle Reputations-Belastung für Google.
Am 8. Februar 2024 wurde der Assistent Bard in Gemini umbenannt; die kostenpflichtige Premium-Variante Gemini Advanced (auf Basis von Gemini Ultra) wurde gleichzeitig eingeführt.
Gemini 1.5 (Februar 2024)
Am 15. Februar 2024 veröffentlichte Google DeepMind Gemini 1.5 – ein substantieller Architektur-Sprung.
Die zentralen Innovationen: erstens die Mixture-of-Experts-Architektur, die deutlich effizientere Inferenz ermöglicht; zweitens ein Kontextfenster von 1 Million Tokens (mit Forschungs-Variante bis 10 Millionen Tokens), das erstmals umfangreiche Buchsammlungen, mehrstündige Videos oder ganze Codebases in einer einzigen Anfrage verarbeitbar machte (Gemini Team 2024).
Im Juni 2024 wurde das Kontextfenster für Gemini 1.5 Pro auf 2 Millionen Tokens erweitert (Gemini Team 2024). Im September 2024 wurde mit Gemini 1.5 Flash-8B eine besonders leichtgewichtige Variante eingeführt.
Gemini 2.0 und Agentische Fähigkeiten (Dezember 2024)
Am 11. Dezember 2024 veröffentlichte Google DeepMind Gemini 2.0 – fokussiert auf agentische Anwendungen und multimodale Echtzeit-Interaktion. Die Live API ermöglichte streaming-basierte Audio- und Video-Eingabe.
Die parallele Vorstellung von Project Mariner (Browser-Agent), Project Astra (multimodaler Echtzeit-Assistent) und Jules (Coding-Agent) etablierte Google DeepMinds Positionierung im sich konsolidierenden Markt agentischer Systeme.
Gemini 2.5 und Deep Think (März–Mai 2025)
Am 25. März 2025 veröffentlichte Google DeepMind Gemini 2.5 Pro (experimental) – das erste Reasoning-Modell der Gemini-Familie. Das Modell debütierte auf der LMArena-Benchmark auf Position 1 und übertraf bestehende Konkurrenz-Modelle auf zahlreichen Benchmarks (GPQA, AIME 2025, Humanity’s Last Exam).
Auf der Google I/O am 20. Mai 2025 wurde Deep Think – ein Modus mit besonders intensiver schrittweiser Reasoning-Berechnung – vorgestellt. Parallel zur GPT-o-Reihe (OpenAI) und Claude Opus 4 (Anthropic).
Gemini 3 und Generationswechsel (November 2025–2026)
Am 18. November 2025 veröffentlichte Google DeepMind Gemini 3 – nach eigenen Angaben eine Verbesserung gegenüber Gemini 2.5 Pro auf praktisch jedem wichtigen Benchmark und damit ein substantieller Generationssprung. In rascher Folge erschienen Gemini 3.1 Pro, Gemini 3.1 Deep Think, Gemini 3.1 Flash-Lite und Gemini 3 Flash.
Als vorläufig neueste Variante veröffentlichte Google DeepMind Gemini 3.5 Flash – ausgerichtet auf agentische und Coding-Anwendungen; Gemini 3.5 Pro wurde als „demnächst” verfügbar angekündigt.
Spezialisierte Modelle (2024–2026)
Eine eigenständige Linie sind die spezialisierten Gemini-basierten Modelle:
Imagen 3 (Dezember 2024) und nachfolgende Bildgenerierungs-Modelle.
Veo 2 (Dezember 2024) und Veo 3 (Mai 2025) – Video-Generierungs-Modelle.
Gemini Robotics (März 2025) und Gemini Robotics-ER 1.5 (2025) – Vision-Language-Action-Modelle für Robotik-Anwendungen.
AlphaProof, AlphaGeometry 2 (Juli 2024) – spezialisierte Reasoning-Systeme für mathematische Probleme.
Methodische Grundlagen
Native Multimodalität
Anders als Modelle, die separat trainierte Bild- und Text-Encoder nachträglich verbinden, wurde Gemini von Anfang an auf gemischten Modalitäten trainiert. Diese Architektur-Entscheidung erlaubt direkten Transfer zwischen den Modalitäten.
Mixture-of-Experts
Gemini 1.5 und nachfolgende Versionen verwenden eine MoE-Architektur, die durch selektive Aktivierung von Sub-Netzwerken eine deutlich effizientere Inferenz ermöglicht als monolithische dichte Modelle vergleichbarer Größe.
Long-Context-Verarbeitung
Das 1-Millionen- bzw. 2-Millionen-Token-Kontextfenster ist durch besondere Architektur- und Attention-Optimierungen ermöglicht, deren Details Google DeepMind nicht vollständig publiziert hat. Standard-Benchmarks (Needle-in-a-Haystack) zeigten gute Retrieval-Leistung über das gesamte Kontextfenster.
Reasoning und Deep Think
Gemini 2.5 verwendet eine RL-trainierte interne Reasoning-Spuren-Architektur (vergleichbar mit OpenAI o-Reihe). Deep Think ist ein Modus, der mehr Inferenz-Compute auf einzelne Anfragen verwendet.
Trainingsdaten und Compute
Google DeepMind hat die exakten Trainingsdaten und die Trainings-Compute-Größenordnungen nicht öffentlich gemacht. Schätzungen externer Beobachter platzieren Gemini Ultra im Bereich 10^25 bis 10^26 FLOPs Trainingsrechenleistung – oberhalb der EU-AI-Act-Schwelle für GPAI mit systemischem Risiko.
Anwendungsfelder
Konsumenten-Assistent
Über die Gemini-App (Web, iOS, Android), die Gemini Advanced-Abonnement-Variante und die Integration in Google-Workspace-Produkte (Gmail, Docs, Sheets, Meet) ist Gemini Stand 2025/2026 ein Konsumenten-Assistent mit mehreren hundert Millionen monatlichen Nutzer:innen.
Entwickler-API
Über die Gemini API (Google AI Studio, Vertex AI auf Google Cloud) ist die Modellfamilie für Entwickler:innen zugänglich, einschließlich Function-Calling, Tool-Use und MCP-Unterstützung.
Enterprise-Integration
Gemini for Workspace, Gemini Code Assist und die Integration in Google Cloud adressieren den Enterprise-Markt. Gemini Enterprise ist die Hauptlinie für Unternehmenskunden.
Mobile und Edge
Gemini Nano ist für On-Device-Verarbeitung auf Pixel-Smartphones, Samsung-Galaxy-Geräten und vergleichbaren Plattformen optimiert. Anwendungen umfassen Spracherkennung, Übersetzung, Bildverarbeitung.
Wissenschaftliche Anwendungen
AlphaProof und AlphaGeometry 2 (Juli 2024) erreichten eine Silbermedaillen-Leistung auf der International Mathematical Olympiad 2024. Diese Linie verbindet die Gemini-Reasoning-Fähigkeiten mit symbolischer Mathematik-Verarbeitung.
Kontroversen und Kritik
Gefälschte Launch-Demo (Dezember 2023)
Die zur Gemini-1.0-Veröffentlichung am 6. Dezember 2023 publizierte Demonstrations-Video wurde nachträglich als geschnitten und beschönigt aufgedeckt – die tatsächliche Modell-Leistung in Echtzeit-Interaktion war deutlich schwächer als suggeriert. Die Kontroverse beschädigte das Vertrauen in Googles KI-Kommunikation.
Bilderzeugungs-Kontroverse (Februar 2024)
Im Februar 2024 erregte die Bilderzeugungs-Funktion von Gemini öffentliche Kritik, weil Anfragen nach historischen Personen zu rassisch und geschlechtlich diversifizierten, historisch inakkuraten Darstellungen führten (etwa rassisch diverse Darstellungen von Wehrmachtssoldaten, Wikinger oder US-Gründungsvätern).
Google reagierte mit der temporären Deaktivierung der Personen-Bilderzeugung und einer öffentlichen Entschuldigung durch Sundar Pichai (28. Februar 2024). Die Kontroverse wurde in der Debatte um Bias und Fairness in KI-Systemen unterschiedlich rezipiert – teils als Beispiel über-korrigierender Bias-Mitigation, teils als systemisches Problem industrieller KI-Entwicklung.
Datenschutz und Trainingsdaten
Wie bei vergleichbaren Frontier-Modellen ist die Provenienz der Trainingsdaten Stand 2025/2026 nur teilweise transparent. Mehrere Klagen sind in den USA und der EU anhängig.
Wettbewerbsrechtliche Aufmerksamkeit
Googles Marktstellung in Suche, Cloud und mobilen Betriebssystemen führt zu wettbewerbsrechtlicher Aufmerksamkeit hinsichtlich der Gemini-Integration in diese Produkte. EU-Kommission, US-Justizministerium und mehrere nationale Wettbewerbsbehörden untersuchen Stand 2025/2026 verschiedene Aspekte.
Project Maven und militärische Anwendungen
Googles Wiedereinstieg in militärische KI-Anwendungen – insbesondere nach Aufhebung der 2018 erlassenen Selbstbeschränkungen – ist Gegenstand interner und öffentlicher Debatte. Die Aktualisierung der Google AI Principles im Februar 2025 entfernte die explizite Beschränkung auf nicht-militärische Anwendungen.
Stand 2025/2026
Stand Mai 2026 gehört Gemini zu den drei führenden Frontier-Modellfamilien neben OpenAIs GPT-Familie und Anthropics Claude-Familie. Am 18. November 2025 veröffentlichte Google DeepMind Gemini 3, das nach Unternehmensangaben Gemini 2.5 Pro auf praktisch jedem wichtigen Benchmark übertraf.
Seither folgten Gemini 3.1 Pro, Gemini 3.1 Deep Think, Gemini 3.1 Flash-Lite und Gemini 3 Flash. Als neueste verfügbare Variante positioniert Google DeepMind Gemini 3.5 Flash – mit Fokus auf agentische und Coding-Anwendungen –, während Gemini 3.5 Pro Stand August 2026 als „demnächst” verfügbar angekündigt ist.
Gemini-Modelle sind im EU AI Act (Verordnung 2024/1689) als GPAI mit systemischem Risiko eingestuft. Google DeepMind hat den General-Purpose AI Code of Practice (10. Juli 2025) der EU-Kommission unterzeichnet.
Forschungslinien umfassen die Verbindung von Gemini-Modellen mit agentischen Systemen (Project Astra, Project Mariner), die Skalierung der Reasoning-Fähigkeiten, Robotik-Anwendungen (Gemini Robotics), wissenschaftliche Anwendungen (AlphaProof, AlphaGeometry) und die Integration in Googles breitere Produktlandschaft.
Offene Fragen umfassen die langfristige Wettbewerbsdynamik gegenüber OpenAI und Anthropic, die methodische Verlässlichkeit der Long-Context-Verarbeitung, die ethische und juristische Klärung der Bias- und Bilderzeugungs-Kontroversen sowie die Folgen der Lockerung der militärischen Selbstbeschränkungen.
Verwandte Begriffe
- Claude-Familie – konkurrierende Modellfamilie
- Mixture-of-Experts (MoE) – Architektur
- Reasoning Models – Anwendungslinie
- Long Context – Alleinstellungsmerkmal
- Foundation Models – übergeordneter Begriff
- PaLM – Vorgeschichte
Quellenangaben
- Alayrac, Jean-Baptiste u. a., 2022. Flamingo: A Visual Language Model for Few-Shot Learning. In: Advances in Neural Information Processing Systems 35 (NeurIPS 2022). arXiv: 2204.14198.
- Chowdhery, Aakanksha u. a., 2022. PaLM: Scaling Language Modeling with Pathways. arXiv: 2204.02311.
- Coldewey, Devin, 2023. Google’s Best Gemini Demo Was Faked. TechCrunch, 7. Dezember 2023.
- Europäische Union, 2024. Verordnung (EU) 2024/1689 zur Festlegung harmonisierter Vorschriften für künstliche Intelligenz. In: Amtsblatt der Europäischen Union L, 2024/1689, 12. Juli 2024. (Artikel 9 Risikomanagementsystem; Artikel 17 Qualitätsmanagementsystem.)
- Gemini Team, Google, 2023. Gemini: A Family of Highly Capable Multimodal Models. arXiv: 2312.11805.
- Gemini Team, Google, 2024. Gemini 1.5: Unlocking Multimodal Understanding Across Millions of Tokens of Context. arXiv: 2403.05530.
- Google, 2025. A new era of intelligence with Gemini 3. blog.google/products/gemini/gemini-3, 18. November 2025.
- Google DeepMind, 2023. Introducing Gemini: Our Largest and Most Capable AI Model. blog.google, 6. Dezember 2023.
- Google DeepMind, 2024. Introducing Gemini 2.0: Our New AI Model for the Agentic Era. blog.google, 11. Dezember 2024.
- Google DeepMind, 2025. Gemini 2.5: Our Most Intelligent AI Model. blog.google, 25. März 2025.
- Google DeepMind, 2025. Gemini 2.5 Deep Think. blog.google, Mai 2025.
- Google DeepMind, 2025. Updated AI Principles. deepmind.google, Februar 2025.
- Google DeepMind, 2026. Gemini Models Overview. deepmind.google/models/gemini/, 2026.
- Hoffmann, Jordan / Borgeaud, Sebastian / Mensch, Arthur u. a., 2022. Training Compute-Optimal Large Language Models. DeepMind. arXiv: 2203.15556. (Chinchilla).
- Pichai, Sundar / Hassabis, Demis, 2023. Google DeepMind: Bringing Together Two World-Class AI Teams. blog.google, 20. April 2023.
- Raghavan, Prabhakar, 2024. Gemini Image Generation Got It Wrong. We’ll Do Better. blog.google, 23. Februar 2024.
- Trinh, Trieu H. / Wu, Yuhuai / Le, Quoc V. / He, He / Luong, Thang, 2024. Solving Olympiad Geometry without Human Demonstrations. In: Nature 625 (7995), S. 476–482. DOI: 10.1038/s41586-023-06747-5.