Transformer (Maschinelles Lernen)
Der Transformer ist die 2017 vorgestellte Architektur aus reiner Self-Attention, auf der heute praktisch alle großen Sprach- und Bildmodelle beruhen.
Übersicht
Der Transformer ist die 2017 vorgestellte Architektur aus reiner Self-Attention, auf der heute praktisch alle großen Sprach- und Bildmodelle beruhen.
Reinforcement Learning lernt aus Belohnung statt aus gelabelten Daten – von Bellmans Entscheidungsprozessen über AlphaGo bis zum RLHF heutiger Sprachmodelle.
Künstliche Neuronale Netze sind der biologischen Neuronenverschaltung nachempfunden: von McCulloch und Pitts 1943 bis zu heutigen Architekturklassen.
Maschinelles Lernen lässt Systeme aus Erfahrungsdaten statt expliziter Programmierung lernen: von Samuels Damespiel 1959 bis zu den heutigen Risiken.
Künstliche Intelligenz ist der Sammelbegriff der Disziplin seit Dartmouth 1956: Definitionsachsen, Teildisziplinen, schwache und starke KI im Überblick.
Deep Learning ist der methodische Kern der aktuellen KI-Welle – von den Deep Belief Nets 2006 über Faltungsnetze bis AlphaFold, samt seiner Grenzen.
Der Attention-Mechanismus lässt Modelle Eingabeteilen unterschiedliches Gewicht geben – von Bahdanaus Übersetzungsarbeit 2014 bis zur Self-Attention.
Attention Is All You Need brachte 2017 die Transformer-Architektur hervor – eine der meistzitierten Publikationen der Informatik und die Zäsur des Feldes.
Das Vanishing Gradient Problem ist das exponentielle Schrumpfen von Gradienten in tiefen Netzen – von Hochreiter 1991 über LSTM und ReLU bis zum Transformer.
ImageNet baute ab 2009 als Datensatz und Wettbewerb die Computer Vision um – WordNet-Taxonomie, Klickarbeit, AlexNet 2012 und eine lange Kritikgeschichte.