Longformer ist eine 2020 vom Allen Institute for AI vorgestellte Transformer-Variante, die den Attention-Mechanismus auf ein lokales Fenster begrenzt und ihn für ausgewählte Tokens um eine globale Komponente ergänzt.
Zusammenfassung
Klassische Transformer stoßen bei sehr langen Dokumenten an eine harte Grenze: Die quadratisch mit der Sequenzlänge wachsende Attention-Berechnung macht Kontextfenster von mehreren tausend Tokens rechnerisch unpraktikabel. Longformer löst dieses Problem durch eine Sliding-Window-Attention, bei der jedes Token nur mit einer begrenzten Zahl benachbarter Tokens verglichen wird, sodass der Rechenaufwand linear statt quadratisch mit der Sequenzlänge wächst.
Methodische Grundlagen
Ergänzend zur lokalen Fenster-Attention führt Longformer eine globale Attention für ausgewählte Tokens ein – etwa für Klassifikations-Tokens oder Fragen in Frage-Antwort-Aufgaben. Diese ausgewählten Tokens dürfen mit der gesamten Sequenz interagieren, während alle übrigen Tokens auf ihr lokales Fenster beschränkt bleiben. Diese Kombination erhält einen Großteil der Modellierungsfähigkeit klassischer Attention, ohne deren Rechenkosten zu übernehmen.
Anwendungsfelder
Longformer wurde gezielt für Aufgaben entwickelt, die lange Kontexte erfordern: die Verarbeitung ganzer Dokumente statt einzelner Absätze, dokumentenübergreifende Frage-Antwort-Systeme und die Zusammenfassung langer Texte. Die Architektur diente als Vorbild für zahlreiche spätere Modelle, die ebenfalls versuchen, Sprachmodelle über die typische Kontextfenstergrenze klassischer Transformer hinaus zu skalieren.
Kontroversen und Kritik
Die feste Fenstergröße der lokalen Attention ist ein Kompromiss: Zu klein gewählt, gehen weitreichende Abhängigkeiten zwischen entfernten Textstellen verloren; zu groß gewählt, nähert sich der Rechenaufwand wieder dem des klassischen, vollständigen Attention-Mechanismus an. Welche Tokens globale Attention erhalten, muss zudem aufgabenspezifisch von Hand festgelegt werden, was die Übertragbarkeit auf neue Anwendungsfälle einschränkt.
Verwandte Begriffe
- Attention-Mechanismus – der Mechanismus, den Longformer strukturell einschränkt
- Performer – alternativer Ansatz, der dieselbe Effizienzsteigerung über Kernel-Approximation statt struktureller Einschränkung erreicht
- Linformer – weiterer Ansatz mit linearer Attention-Komplexität über Low-Rank-Projektion
Quellenangaben
- Beltagy, Iz / Peters, Matthew E. / Cohan, Arman, 2020. Longformer: The Long-Document Transformer. arXiv: 2004.05150.