Blog

MuZero

MuZero ist ein von Google DeepMind entwickeltes Reinforcement-Learning-System, das plant und handelt, ohne die Regeln seiner Umgebung vorher zu kennen. Es lernt stattdessen selbst ein internes Modell genau der Aspekte, die für die Planung relevant sind.

Zusammenfassung

AlphaZero benötigt ein vollständiges, exaktes Regelmodell, um mittels Monte-Carlo-Tree-Search zu planen. MuZero kennt diese Regeln nicht. Es lernt selbst, welche Aspekte der Umgebung für gute Entscheidungen wichtig sind, und plant auf Basis dieses gelernten Modells statt auf Basis der echten Spielregeln.

Damit ordnet sich MuZero in das übergeordnete Konzept der World Models ein: Systeme, die ein kompaktes internes Modell ihrer Umgebung lernen und darin simulieren, statt ausschließlich modellfrei zu handeln.

Begriffsgeschichte

Der Preprint „Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model” erschien am 19. November 2019, die Nature-Publikation folgte am 23. Dezember 2020. Autor:innen waren unter anderem Julian Schrittwieser, Ioannis Antonoglou und Thomas Hubert von DeepMind.

Methodische Grundlagen

MuZeros gelerntes Modell besteht aus drei neuronalen Netzfunktionen: einer Repräsentationsfunktion, die Beobachtungen in eine interne Einbettung umwandelt, einer Dynamikfunktion, die aus dieser Einbettung und einer Aktion den Folgezustand vorhersagt, und einer Vorhersagefunktion, die daraus Wert, Handlungsstrategie und erwartete Belohnung schätzt.

Die Monte-Carlo-Baumsuche läuft auf diesem gelernten Modell statt auf den echten Spielregeln. Das Modell muss dabei nur die für die Planung relevanten Größen korrekt vorhersagen, nicht die gesamte Umgebung originalgetreu rekonstruieren.

Ergebnisse

In Schach, Shogi und Go erreichte MuZero trotz unbekannter Spielregeln ein zu AlphaZero vergleichbares, übermenschliches Niveau. Bei 57 Atari-2600-Spielen erzielte es zum Veröffentlichungszeitpunkt einen neuen Bestwert unter Reinforcement-Learning-Algorithmen.

Eine datenffiziente Variante, MuZero Reanalyze, nutzte das gelernte Modell in rund 90 Prozent der Fälle zur erneuten Planung bereits gesammelter Erfahrungen, statt ständig neue Umgebungsdaten zu sammeln.

Anwendungsfelder

Am 11. Februar 2022 beschrieb DeepMind den ersten Praxiseinsatz: eine Kooperation mit YouTube zur Optimierung der Videokompression im Codec VP9. „MuZero-RC” ersetzt dessen Standard-Ratensteuerung und entscheidet pro Bild über den passenden Kompressionsgrad, was im Produktivbetrieb auf einem Teil des YouTube-Live-Traffics eine durchschnittliche Bitratenreduktion von rund 4 Prozent bei vergleichbarer Qualität erzielte.

Auf den Grundalgorithmus folgten mehrere Varianten: Stochastic MuZero für nicht-deterministische Umgebungen, Sampled MuZero für kontinuierliche Aktionsräume und Gumbel MuZero zur Reduktion der Suchkomplexität in großen Aktionsräumen.

Stand 2026

MuZero gilt als Übergang von aufgabenspezifischen Systemen wie AlphaZero zu allgemeineren, modellbasierten Ansätzen – dem ersten Algorithmus, der planungsbasiertes Reinforcement Learning ohne vorgegebenes Regelmodell auf Brettspiel- und Atari-Niveau zugleich demonstrierte. Externe Weiterentwicklungen wie EfficientZero verfolgen dasselbe Grundprinzip mit deutlich geringerem Trainingsaufwand.

Verwandte Begriffe

Quellenangaben

  1. Schrittwieser, Julian u. a., 2019. Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model. arXiv: 1911.08265.
  2. Schrittwieser, Julian u. a., 2020. Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model. In: Nature 588, S. 604–609. DOI: 10.1038/s41586-020-03051-4.
  3. Google DeepMind, o. J. MuZero: Mastering Go, Chess, Shogi and Atari without Rules. deepmind.google.
  4. Google DeepMind, 2022. MuZero’s First Step from Research into the Real World. deepmind.google, 11. Februar 2022.

← Zurück zur Lexikon-Übersicht