BERT
BERT war Googles Encoder-Modell von 2018, das Sprachverstehen beherrschte, bevor die generative Linie es aus der öffentlichen Sichtbarkeit verdrängte.
Übersicht
BERT war Googles Encoder-Modell von 2018, das Sprachverstehen beherrschte, bevor die generative Linie es aus der öffentlichen Sichtbarkeit verdrängte.
Tokenmaxxing ist die Praxis, Modellantworten durch immer längere Denkspuren zu verbessern – und die Frage, ab wann mehr Tokens nur mehr Kosten bedeuten.
Tokenisierung zerlegt Text in diskrete Einheiten vor der numerischen Verarbeitung – und diese unscheinbare Vorstufe prägt Modellverhalten und Kosten.
Ein Token ist die kleinste Verarbeitungseinheit eines Sprachmodells – warum Modelle in Tokens statt Wörtern rechnen, mit Folgen für Kosten und Kontext.
Token Embedding bildet diskrete Tokens auf dichte Vektoren ab – die erste lernbare Schicht jedes Sprachmodells und Grundlage seiner Repräsentationen.
Retrieval-Augmented Generation lässt Sprachmodelle vor der Antwort extern nachschlagen – das gängigste Mittel gegen veraltetes Wissen und Halluzinationen.
Scaling Laws sind die Potenzgesetze, nach denen der Trainingsverlust mit Parametern, Daten und Rechenleistung vorhersagbar sinkt – von Kaplan bis Chinchilla.
Prompt Engineering gestaltet Eingaben statt Gewichte zu ändern – von der GPT-3-API 2020 über Chain-of-Thought bis zur Frage, ob die Disziplin sich erübrigt.
Pre-Training ist die erste und rechenintensivste Trainingsphase: selbstüberwachtes Lernen auf großen allgemeinen Datenmengen, Grundlage aller Sprachmodelle.
In-Context Learning ist die Fähigkeit, neue Aufgaben allein aus Beispielen im Prompt zu lösen – ohne Gewichtsänderung, entdeckt mit GPT-3, bis heute umstritten.