Positional Encoding
Positional Encoding gibt dem Transformer die fehlende Ordnung zurück: sinusförmige, gelernte und rotierende Verfahren sowie ihre Grenzen bei langen Texten.
Übersicht
Positional Encoding gibt dem Transformer die fehlende Ordnung zurück: sinusförmige, gelernte und rotierende Verfahren sowie ihre Grenzen bei langen Texten.
Long Context bezeichnet Kontextfenster von Hunderttausenden Einheiten: wie sie möglich wurden, wie sie gemessen werden und warum angegebene Länge täuscht.
Eine Vector Database sucht ähnliche Vektoren statt exakter Werte: Herkunft, Näherungsverfahren wie HNSW, Anwendungen und der Streit um die Produktkategorie.
Subwort-Modelle zerlegen Text in Einheiten zwischen Zeichen und Wort: die drei Verfahren BPE, WordPiece und Unigram, ihre Unterschiede und Grenzen.
Natural Language Processing ist das Fach der maschinellen Sprachverarbeitung: vier Epochen von der Regel zum Sprachmodell und der Streit um seine Zukunft.
Ein Embedding-Modell überführt Texte in Vektoren für den Ähnlichkeitsvergleich: Herkunft, Training, Einsatz im Abruf und die Grenzen des Verfahrens.
Byte Pair Encoding zerlegt Text in Subwörter: Herkunft in der Datenkompression 1994, Übertragung 2015, Verfahren, Byte-Ebene und bekannte Schwächen.
GPT bezeichnet OpenAIs Reihe großer Sprachmodelle und die Architekturidee dahinter: Transformer-Decoder, vortrainiert auf Vorhersage des nächsten Tokens.
Das Vokabular ist die endliche Zeichenmenge, die ein Sprachmodell darstellen kann – vor dem Training festgelegt, danach unveränderlich.
Chain-of-Thought lässt Modelle Zwischenschritte ausgeben, bevor sie antworten – von der Prompting-Technik zum trainierten Verhalten heutiger Reasoning-Modelle.