Deep Belief Networks
Deep Belief Networks (Hinton u. a. 2006) trainierten erstmals tiefe Netze erfolgreich – schichtweises Vortraining löste das Problem verschwindender Gradienten.
Übersicht
Deep Belief Networks (Hinton u. a. 2006) trainierten erstmals tiefe Netze erfolgreich – schichtweises Vortraining löste das Problem verschwindender Gradienten.
The Organization of Behavior (Hebb 1949) begründete die Lernregel: gemeinsam aktive Neuronen verstärken ihre Verbindung – konnektionistisches Grundprinzip.
The Algebraic Mind (Marcus 2001) argumentierte: reiner Konnektionismus erklärt echte Verallgemeinerung nicht – ein Einwand bis zu heutigen LLMs.
Performer approximiert 2020 die Transformer-Attention über Zufallsmerkmale (FAVOR+) und senkt den Rechenaufwand von quadratisch auf linear in der Sequenzlänge.
Parallel Distributed Processing (1986) popularisierte Backpropagation und verteilte Repräsentationen – Gründungswerk des modernen Konnektionismus.
Longformer kombiniert 2020 lokale Sliding-Window-Attention mit gezielter globaler Attention und macht Transformer so für ganze Dokumente praktikabel.
Linformer projiziert 2020 die Attention-Matrix eines Transformers auf niedrige Dimension und senkt so den Rechenaufwand von quadratisch auf linear.
Double Descent beschreibt, wie der Testfehler eines Modells mit wachsender Größe zunächst steigt, dann wieder fällt – gegen die klassische Bias-Variance-Kurve.
Sequence to Sequence Learning etablierte 2014 das Encoder-Decoder-Schema mit LSTMs – die Vorstufe von Attention und Transformer für Übersetzung.
RWKV kombiniert paralleles Transformer-Training mit konstantem RNN-Speicher bei der Anwendung – ein Ausweg aus der Kostenexplosion langer Kontexte.