Blog

AlphaZero

AlphaZero ist ein von Google DeepMind entwickelter Reinforcement-Learning-Algorithmus, der Schach, Shogi und Go allein durch Selbstspiel meistert – ohne menschliches Vorwissen und mit einem einzigen, spielunabhängigen Verfahren für alle drei Spiele.

Zusammenfassung

Vor AlphaZero brauchte jedes starke Spielprogramm eigene, mühsam von Hand kodierte Heuristiken. AlphaZero verzichtet darauf vollständig: Es kennt zu Beginn nur die Grundregeln eines Spiels und lernt alles Weitere – Strategie, Stellungsbewertung, Eröffnungstheorie – ausschließlich aus Partien gegen sich selbst.

Das macht AlphaZero zum direkten Nachfolger von AlphaGo Zero, verallgemeinert dessen Prinzip aber über ein einzelnes Spiel hinaus.

Begriffsgeschichte

Am 5. Dezember 2017 erschien der Preprint „Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm”, die peer-reviewte Fassung folgte am 7. Dezember 2018 in Science. Anders als AlphaGo Zero, das im Oktober 2017 ausschließlich auf Go spezialisiert war, wendet AlphaZero denselben Algorithmus ohne spielspezifische Anpassung auf drei unterschiedliche Spiele an.

Eine weitere technische Vereinfachung betrifft das Training selbst: AlphaGo Zero testete neue Modellversionen periodisch gegen den bisher besten Spieler und übernahm nur Verbesserungen. AlphaZero verzichtet auf diesen Auswahlschritt und aktualisiert seine Gewichte fortlaufend. Im internen Vergleich schlug die neue Version die 3-Tage-Trainingsversion von AlphaGo Zero mit 60 zu 40 Siegen.

Methodische Grundlagen

AlphaZero kombiniert Monte-Carlo-Tree-Search mit einem einzigen tiefen neuronalen Netz, das sowohl die Handlungsstrategie als auch die Stellungsbewertung übernimmt – kein separates Modul pro Spiel. Trainiert wird ausschließlich durch Selbstspiel-Reinforcement-Learning, ohne menschliche Partien, Eröffnungsbücher oder spielspezifische Heuristiken.

Ergebnisse

Nach neun Stunden Training besiegte AlphaZero die Schach-Engine Stockfish 8 in einem 100-Partien-Turnier mit 28 Siegen, keiner Niederlage und 72 Remis. Im Shogi gewann es gegen die amtierende CSA-Weltmeister-Engine Elmo mit einer Quote von 91,2 Prozent, im Go gegen AlphaGo Zero mit 61 Prozent der Partien. Alle drei Spielstärken erreichte AlphaZero jeweils innerhalb von 24 Stunden Trainingszeit.

Kontroversen und Kritik

Der Stockfish-Vergleich wurde in der Schachprogrammierer-Community wegen ungleicher Bedingungen kritisiert: AlphaZero lief auf spezialisierten TPUs, Stockfish auf klassischer CPU-Hardware, und die verwendete Zeitkontrolle galt manchen als untypisch für Turnierbedingungen.

Auch der Verzicht von Stockfish auf sein übliches Eröffnungsbuch wurde als Asymmetrie genannt. Diese Kritik stammt überwiegend aus Foren und der Schach-Community, nicht aus einer peer-reviewten Gegenpublikation.

In der KI-Fachwelt gilt AlphaZero unabhängig davon als Meilenstein: Ein einziger Algorithmus, der ohne Domänenwissen mehrere komplexe Spiele meistert, war vor 2017 nicht demonstriert worden.

Stand 2026

Der direkte Nachfolgealgorithmus MuZero erweiterte den Ansatz 2019/2020 um ein zentrales Merkmal: Er benötigt nicht einmal die Spielregeln, sondern lernt selbst ein Modell der relevanten Umgebungsdynamik.

AlphaZeros Grundprinzip – Selbstspiel statt menschlicher Trainingsdaten – bleibt bis heute die Grundlage aktueller DeepMind-Systeme wie AlphaProof.

Verwandte Begriffe

Quellenangaben

  1. Silver, David u. a., 2017. Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm. arXiv: 1712.01815.
  2. Silver, David u. a., 2018. A General Reinforcement Learning Algorithm that Masters Chess, Shogi, and Go through Self-Play. In: Science 362 (6419), S. 1140–1144. DOI: 10.1126/science.aar6404.
  3. Google DeepMind, o. J. AlphaZero: Shedding New Light on Chess, Shogi, and Go. deepmind.google.
  4. Google DeepMind, 2020. MuZero: Mastering Go, Chess, Shogi and Atari without Rules. deepmind.google.

← Zurück zur Lexikon-Übersicht