Mamba
Mamba ist eine selektive State-Space-Architektur von Gu und Dao (2023) mit linearer Laufzeit – der prominenteste Alternativentwurf zum Transformer.
Übersicht
Mamba ist eine selektive State-Space-Architektur von Gu und Dao (2023) mit linearer Laufzeit – der prominenteste Alternativentwurf zum Transformer.
DALL·E ist OpenAIs Text-zu-Bild-Modellfamilie seit Januar 2021 – benannt nach Dalí und WALL-E, vom autoregressiven Transformer bis zur Diffusion.
Adam passt die Lernrate für jeden Parameter einzeln an – seit 2014 der Standardoptimierer im Deep Learning, in der Variante AdamW bei fast jedem Sprachmodell.
Stochastic Gradient Descent passt Modellparameter anhand kleiner Zufallsstichproben an – Rückgrat des Trainings jedes neuronalen Netzes.
Proximal Policy Optimization begrenzt riskante Strategiesprünge im bestärkenden Lernen – der Algorithmus, der RLHF bei ChatGPT erstmals praktikabel machte.
ResNet löste 2015 das Degradationsproblem sehr tiefer Netze durch Skip-Connections – ein Prinzip, das heute auch jeden Transformer-Layer trägt.
GloVe gewinnt Wortvektoren aus globalen Häufigkeiten des gemeinsamen Auftretens – das Stanford-Verfahren von 2014, das bis heute neue Ausgaben erhält.
Die Skalierungshypothese besagt, dass Größe genügt: Herkunft in den Scaling Laws, Belege, Gegenpositionen und die Debatte um ihr Ende seit 2024.
Der Turing Award ist die höchste Auszeichnung der Informatik: Vergabe seit 1966, die KI-Preisträger, der Deep-Learning-Preis 2018 und die Zurechnungsfrage.
Der Physik-Nobelpreis 2024 ging an Hopfield und Hinton für neuronale Netze: Begründung, Vorarbeiten, der Streit um die Fachzugehörigkeit und Hintons Warnung.