Blog

BERT

BERT (Bidirectional Encoder Representations from Transformers) ist ein 2018 von Google vorgestelltes Sprachmodell, das Texte in beide Richtungen zugleich verarbeitet und dadurch kontextabhängige Wortrepräsentationen erzeugt. Es begründete das Verfahren, ein allgemein vortrainiertes Modell anschließend für einzelne Aufgaben nachzujustieren, und war jahrelang die Grundlage nahezu aller Systeme zur Sprachverarbeitung.

Zusammenfassung

BERT nutzt den Encoder-Teil der Transformer-Architektur und steht damit systematisch neben der GPT-Reihe, die auf dem Decoder-Teil beruht.

Der Unterschied ist grundlegend: BERT sieht bei jeder Position den gesamten Satz – vorher und nachher –, kann aber keinen Text fortschreiben; GPT sieht nur das Vorangegangene und erzeugt daraus die Fortsetzung. Aus dieser Trennung ergaben sich zwei Entwicklungslinien.

BERT dominierte Aufgaben des Verstehens: Klassifikation, Beantwortung von Fragen zu vorliegenden Texten, Erkennung von Eigennamen; Google setzte es ab 2019 in der Websuche ein. Mit dem Aufstieg der generativen Modelle verlor die Encoder-Linie an Sichtbarkeit, bleibt aber dort im Einsatz, wo nicht Erzeugung, sondern Einordnung von Text gefragt ist.

Funktionsweise

Bidirektionalität

Ältere Verfahren verarbeiteten Text in einer Richtung oder verbanden zwei getrennt trainierte Richtungen nachträglich. BERT verarbeitet beide Richtungen in derselben Schicht gemeinsam. Für die Bedeutung eines Wortes stehen damit sämtliche umgebenden Wörter gleichzeitig zur Verfügung.

Der Kniff besteht darin, dass echte Bidirektionalität mit dem üblichen Trainingsziel – Vorhersage des nächsten Wortes – unvereinbar ist: Ein Modell, das die Folge sieht, kennt die Antwort bereits.

Trainingsziele

BERT löst dies durch zwei Ersatzaufgaben:

Maskierte Sprachmodellierung. Ein Teil der Token wird verdeckt; das Modell soll sie aus dem beidseitigen Kontext erschließen. Das entspricht einem Lückentext.

Vorhersage des Folgesatzes. Das Modell beurteilt, ob zwei vorgelegte Sätze im Original aufeinanderfolgten. Dieses zweite Ziel erwies sich in späteren Arbeiten als entbehrlich und wurde in Nachfolgemodellen fallen gelassen.

Vortraining und Feinabstimmung

BERT etablierte ein zweistufiges Vorgehen: Zunächst wird ein Modell auf großen unbeschrifteten Textmengen allgemein trainiert, anschließend mit vergleichsweise wenigen beschrifteten Beispielen auf eine konkrete Aufgabe zugeschnitten. Der Aufwand für die aufgabenspezifische Anpassung sinkt dadurch erheblich – für viele Anwendungen genügt das Anfügen einer einzelnen Ausgabeschicht.

Verhältnis zu GPT

BERT GPT
Transformer-Teil Encoder Decoder
Blickrichtung beidseitig nur vorangehender Text
Trainingsziel maskierte Token erschließen nächstes Token vorhersagen
Stärke Verstehen, Einordnen Erzeugen, Fortschreiben
Anpassung Feinabstimmung je Aufgabe Anweisung im Kontext
Herkunft Google, 2018 OpenAI, ab 2018

Die beiden Modelle erschienen fast gleichzeitig und beruhen auf derselben Architektur. Dass sich die Decoder-Linie durchsetzte, liegt weniger an überlegenem Sprachverständnis als an der Anwendungsform: Ein generatives Modell lässt sich ohne erneutes Training über eine Anweisung im Eingabetext auf neue Aufgaben richten, während BERT für jede Aufgabe nachjustiert werden muss.

Wirkung

BERT prägte die Sprachverarbeitung zwischen 2018 und etwa 2021 nachhaltig. Es erreichte auf den damals maßgeblichen Vergleichsmaßstäben deutliche Verbesserungen und löste eine Reihe von Weiterentwicklungen aus – RoBERTa mit verändertem Trainingsverfahren, ALBERT mit geteilten Parametern, DistilBERT als verkleinerte Variante, sowie sprach- und fachspezifische Ableitungen.

Google setzte BERT ab Oktober 2019 in der Websuche ein und bezeichnete dies als eine der bedeutendsten Veränderungen der Suchqualität seit Jahren, weil Suchanfragen erstmals im Satzzusammenhang statt als Wortmenge verstanden wurden.

Gegenwärtige Bedeutung

Encoder-Modelle sind aus der öffentlichen Wahrnehmung weitgehend verschwunden, aus der Praxis jedoch nicht. Wo Text eingeordnet statt erzeugt werden soll – Klassifikation, Ähnlichkeitssuche, Vektorisierung für Retrieval-Verfahren, Moderationsfilter –, sind sie großen generativen Modellen in Geschwindigkeit und Kosten deutlich überlegen.

Insbesondere in Retrieval-Augmented-Generation-Systemen arbeiten beide Linien zusammen: Ein Encoder-Modell sucht die einschlägigen Textstellen, ein generatives Modell formuliert daraus die Antwort.

Kritik

Undurchsichtigkeit trotz überschaubarer Größe. Mit dem Erfolg des Modells entstand ein eigener Forschungszweig, der untersuchte, was BERT eigentlich gelernt hatte – durch Prüfaufgaben auf einzelne Schichten, durch Analyse der Aufmerksamkeitsmuster, durch gezieltes Ausschalten von Komponenten.

Die Befunde blieben uneinheitlich: Es ließ sich zeigen, dass bestimmte Schichten mit syntaktischen Kategorien korrespondieren, nicht aber, dass das Modell diese Kategorien im erklärenden Sinne verwendet. Dass selbst ein Modell dieser vergleichsweise bescheidenen Größe seiner Analyse derart widerstand, gilt rückblickend als frühe Warnung vor der Erwartung, größere Systeme ließen sich nachträglich verstehen.

Instabilität beim Anpassen. Das Zuschneiden auf eine Zielaufgabe erwies sich als überraschend empfindlich: Bei kleinen Datensätzen konnten unterschiedliche Zufallsinitialisierungen zu deutlich abweichenden Ergebnissen führen, gelegentlich bis zum vollständigen Scheitern des Trainings. Veröffentlichte Bestwerte spiegeln daher teilweise die Zahl der Versuche.

Abkürzungen statt Verstehen. Mehrere Untersuchungen zeigten, dass hohe Werte auf Aufgaben des Sprachverstehens auch durch das Ausnutzen statistischer Eigenheiten der jeweiligen Datensätze zustande kommen – etwa durch Wortüberlappung zwischen Frage und Textstelle.

Werden solche Abkürzungen durch gezielt konstruierte Prüffälle blockiert, brechen die Ergebnisse ein. Die Debatte darüber, ob Modelle dieser Bauart Bedeutung erfassen oder Verteilungen, nahm hier ihren Ausgang und wurde wenig später im Aufsatz über die Grenzen des Bedeutungserwerbs aus Form allein zugespitzt.

Verwandte Begriffe

Quellenangaben

  1. Devlin, Jacob / Chang, Ming-Wei / Lee, Kenton / Toutanova, Kristina, 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics (NAACL 2019), S. 4171–4186. DOI: 10.18653/v1/N19-1423.
  2. Liu, Yinhan u. a. (2019): RoBERTa: A Robustly Optimized BERT Pretraining Approach. arXiv: 1907.11692.
  3. Radford, Alec u. a., 2019. Language Models are Unsupervised Multitask Learners. OpenAI Technical Report. (GPT-2).
  4. Vaswani, Ashish / Shazeer, Noam / Parmar, Niki / Uszkoreit, Jakob / Jones, Llion / Gomez, Aidan N. / Kaiser, Łukasz / Polosukhin, Illia, 2017. Attention Is All You Need. In: Advances in Neural Information Processing Systems 30 (NeurIPS 2017), S. 5998–6008. arXiv: 1706.03762.

← Zurück zur Lexikon-Übersicht

Zuletzt bearbeitet: 10. August 2026

Zusammengestellt, formuliert, lektoriert und korrigiert mit KI-Unterstützung. Kuratiert von Nils Brauer. Alle Angaben ohne Gewähr.