WordPiece und SentencePiece
WordPiece und SentencePiece sind zwei Tokenisierungsverfahren aus Googles Forschung – Auswahlkriterium, Werkzeugcharakter und Einsatz in BERT, T5, ALBERT.
Übersicht
WordPiece und SentencePiece sind zwei Tokenisierungsverfahren aus Googles Forschung – Auswahlkriterium, Werkzeugcharakter und Einsatz in BERT, T5, ALBERT.
Parametrisches Wissen ist das Wissen, das ein Sprachmodell während des Trainings in seinen Gewichtungen speichert, ohne dafür externe Quellen abzurufen.
KI-Suche (AI Search) liefert direkt formulierte Antworten statt Linklisten, gestützt auf Sprachmodelle statt auf klassische Suchindizes.
Language Models are Few-Shot Learners zeigt: Skalierung allein erzeugt Few-Shot-Lernen ohne Gradienten-Update – das GPT-3-Paper von Brown u. a. 2020.
Mamba ist eine selektive State-Space-Architektur von Gu und Dao (2023) mit linearer Laufzeit – der prominenteste Alternativentwurf zum Transformer.
InstructGPT ist die erste mit RLHF trainierte GPT-3-Modellreihe (OpenAI, Januar 2022) – der Beleg, dass Ausrichtung mehr bringt als bloße Skalierung.
Ein Wissensgraph verbindet Fakten als Entitäten und Beziehungen statt als Fließtext – die strukturierte Alternative zum Vektorraum in modernen RAG-Systemen.
Reranking sortiert Suchtreffer einer RAG-Pipeline nach dem ersten groben Abruf präziser neu – teurer als die Suche selbst, aber deutlich genauer.
Semantische Suche findet Bedeutungsähnlichkeit statt Stichwortgleichheit – gemessen am Vektorabstand, nicht am Wortlaut. Die Grundlage jeder RAG-Pipeline.
Chunking zerlegt Dokumente in Suchabschnitte für RAG-Systeme – die Grenzziehung entscheidet über die Antwortqualität mehr als jede andere Design-Entscheidung.