Blog

Adapter

Adapter-Module sind eine 2019 von Neil Houlsby und Kolleg:innen bei Google vorgestellte Methode zum parameter-effizienten Fine-Tuning von Sprachmodellen, die kleine, trainierbare Zwischenschichten in ein ansonsten eingefrorenes vortrainiertes Modell einfügt.

Zusammenfassung

Adapter fügen zwischen die bestehenden Schichten eines vortrainierten Transformers zusätzliche, kleine neuronale Module ein. Beim Fine-Tuning werden nur diese neu eingefügten Adapter-Module trainiert, während sämtliche ursprünglichen Modellgewichte eingefroren bleiben.

Begriffsgeschichte

Die Arbeit erschien 2019 auf der International Conference on Machine Learning (ICML), am Beginn einer Welle von Forschungsarbeiten zu parameter-effizientem Fine-Tuning, die später auch Prefix-Tuning und LoRA hervorbrachte.

Methodische Grundlagen

Ein typisches Adapter-Modul projiziert die Ausgabe einer Transformer-Schicht zunächst auf eine niedrigere Dimension, wendet eine nichtlineare Aktivierungsfunktion an und projiziert das Ergebnis anschließend zurück auf die ursprüngliche Dimension.

Diese Engpassstruktur hält die Zahl zusätzlicher Parameter gering. Nach Angaben der Autor:innen fügen Adapter pro Aufgabe nur rund 3,6 Prozent zusätzlicher Parameter hinzu und erreichen dabei auf dem GLUE-Benchmark Ergebnisse innerhalb von 0,4 Prozentpunkten des vollständigen Fine-Tunings (Houlsby u. a. 2019).

Anwendungsfelder

Da jede Aufgabe ihre eigenen, kompakten Adapter-Module erhält, lassen sich neue Aufgaben hinzufügen, ohne bereits trainierte Adapter für andere Aufgaben zu verändern oder erneut zu trainieren. Das ist ein praktischer Vorteil für Systeme, die kontinuierlich um neue Fähigkeiten erweitert werden müssen, ohne bereits erlernte Fähigkeiten zu gefährden.

Kontroversen und Kritik

Adapter-Module verändern die Modellarchitektur selbst, indem sie zusätzliche Schichten einfügen, wodurch sich die Inferenzzeit gegenüber dem unveränderten Basismodell geringfügig erhöht – ein Nachteil gegenüber Verfahren wie LoRA, deren trainierte Zusatzmatrizen sich nach dem Training verlustfrei in die Originalgewichte einrechnen lassen.

Diese architektonische Umständlichkeit trug dazu bei, dass sich LoRA in der Praxis gegenüber Adaptern weitgehend durchsetzte.

Verwandte Begriffe

Quellenangaben

  1. Houlsby, Neil u. a., 2019. Parameter-Efficient Transfer Learning for NLP. Proceedings of the 36th International Conference on Machine Learning (ICML), arXiv: 1902.00751.

← Zurück zur Lexikon-Übersicht