Übersicht

Lexikon-Thema: Sprachmodelle

BERT

BERT war Googles Encoder-Modell von 2018, das Sprachverstehen beherrschte, bevor die generative Linie es aus der öffentlichen Sichtbarkeit verdrängte.

Weiterlesen

Tokenmaxxing

Tokenmaxxing ist die Praxis, Modellantworten durch immer längere Denkspuren zu verbessern – und die Frage, ab wann mehr Tokens nur mehr Kosten bedeuten.

Weiterlesen

Tokenisierung

Tokenisierung zerlegt Text in diskrete Einheiten vor der numerischen Verarbeitung – und diese unscheinbare Vorstufe prägt Modellverhalten und Kosten.

Weiterlesen

Token (Maschinelles Lernen)

Ein Token ist die kleinste Verarbeitungseinheit eines Sprachmodells – warum Modelle in Tokens statt Wörtern rechnen, mit Folgen für Kosten und Kontext.

Weiterlesen

Token Embedding

Token Embedding bildet diskrete Tokens auf dichte Vektoren ab – die erste lernbare Schicht jedes Sprachmodells und Grundlage seiner Repräsentationen.

Weiterlesen

Retrieval-Augmented Generation

Retrieval-Augmented Generation lässt Sprachmodelle vor der Antwort extern nachschlagen – das gängigste Mittel gegen veraltetes Wissen und Halluzinationen.

Weiterlesen

Scaling Laws

Scaling Laws sind die Potenzgesetze, nach denen der Trainingsverlust mit Parametern, Daten und Rechenleistung vorhersagbar sinkt – von Kaplan bis Chinchilla.

Weiterlesen

Prompt Engineering

Prompt Engineering gestaltet Eingaben statt Gewichte zu ändern – von der GPT-3-API 2020 über Chain-of-Thought bis zur Frage, ob die Disziplin sich erübrigt.

Weiterlesen

Pre-Training

Pre-Training ist die erste und rechenintensivste Trainingsphase: selbstüberwachtes Lernen auf großen allgemeinen Datenmengen, Grundlage aller Sprachmodelle.

Weiterlesen

In-Context Learning

In-Context Learning ist die Fähigkeit, neue Aufgaben allein aus Beispielen im Prompt zu lösen – ohne Gewichtsänderung, entdeckt mit GPT-3, bis heute umstritten.

Weiterlesen