Blog

Quantisierung

Quantisierung ist ein Verfahren zur Modellkompression, das die Zahlenpräzision der Gewichte eines neuronalen Netzes reduziert – typischerweise von 16-Bit-Gleitkommazahlen (fp16/bf16) auf 8-Bit- (int8) oder 4-Bit-Ganzzahlen (int4). Sie senkt Speicherbedarf und Rechenaufwand drastisch und macht dadurch große Sprachmodelle auf gewöhnlicher Verbraucherhardware lauffähig.

Zusammenfassung

Ein bei fp16 trainiertes Modell benötigt zwei Byte Speicher je Parameter. Quantisierung auf int8 reduziert das auf ein Byte je Gewicht bei 256 möglichen Werten – eine Kompression um den Faktor vier gegenüber fp16, meist ohne merkliche Qualitätseinbußen. Quantisierung auf int4 senkt den Bedarf auf ein halbes Byte je Gewicht bei nur 16 möglichen Werten – Faktor acht, bei ausgeprägterem, aber für viele Anwendungen noch tolerierbarem Qualitätsverlust.

Methodische Grundlagen

Entscheidend ist eine geeignete Skalierung: Statt eine einzige Umrechnung auf das gesamte Modell anzuwenden, verwenden moderne Verfahren blockweise Skalierungsfaktoren, die pro Gewichtsgruppe kalibriert werden und so die Präzisionsverluste gezielt dort minimieren, wo sie am stärksten ins Gewicht fallen.

Verbreitete Formate und Verfahren unterscheiden sich in Zielhardware und Vorgehen: GGUF ist für CPU-Inferenz im llama.cpp-Ökosystem optimiert, GPTQ für GPU-Inferenz. AWQ (Activation-aware Weight Quantization) berücksichtigt bei der Kalibrierung zusätzlich, welche Gewichte für die tatsächlichen Aktivierungen besonders wichtig sind.

NF4 (4-Bit NormalFloat) kommt bei QLoRA zum Einsatz, um selbst das eingefrorene Basismodell während des Fine-Tunings im Speicher zu komprimieren.

Innerhalb des GGUF-Formats gilt die Stufe Q4_K_M verbreitet als bester Kompromiss zwischen Dateigröße und Modellqualität für den lokalen Einsatz.

Anwendungsfelder

Quantisierung ist die Schlüsseltechnik, um Sprachmodelle von spezialisierten Rechenzentren auf gewöhnliche Endgeräte zu bringen: int8-Quantisierung eignet sich für Mittelklasse-Hardware, int4-Quantisierung für Geräte mit stark begrenztem Speicher. Sie ist damit eine notwendige Voraussetzung für lokale Inferenz, Edge-Deployment und den Betrieb großer Modelle ohne Cloud-Anbindung.

Kontroversen und Kritik

Der Zielkonflikt zwischen Kompressionsgrad und Modellqualität bleibt ungelöst: Je aggressiver die Quantisierung, desto stärker leidet insbesondere die Zuverlässigkeit bei komplexeren Aufgaben wie mehrstufigem Schlussfolgern, während einfachere Aufgaben oft kaum betroffen sind. Welche Quantisierungsstufe für einen gegebenen Anwendungsfall vertretbar ist, lässt sich nur empirisch je Modell und Aufgabe bestimmen, nicht pauschal vorhersagen.

Verwandte Begriffe

Quellenangaben

  1. Dettmers, Tim / Pagnoni, Artidoro / Holtzman, Ari / Zettlemoyer, Luke, 2023. QLoRA: Efficient Finetuning of Quantized LLMs. University of Washington. In: Advances in Neural Information Processing Systems 36 (NeurIPS 2023). arXiv: 2305.14314.
  2. Lin, Ji u. a., 2024. AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration. MIT. arXiv: 2306.00978.

← Zurück zur Lexikon-Übersicht