Diffusionsmodelle
Diffusionsmodelle erzeugen Bilder, indem sie schrittweise Rauschen entfernen – seit 2021 die vorherrschende Technik der generativen Bildsynthese.
Übersicht
Diffusionsmodelle erzeugen Bilder, indem sie schrittweise Rauschen entfernen – seit 2021 die vorherrschende Technik der generativen Bildsynthese.
Die Boltzmann-Maschine von Hinton und Sejnowski (1985) ist das stochastische Netzmodell, dessen eingeschränkte Variante das Deep Learning der 2000er anstieß.
AlexNet gewann 2012 den ImageNet-Wettbewerb und löste damit die Deep-Learning-Ära aus – Architektur, Umstände des Sieges und seine Nachwirkung.
Kingmas und Wellings Variational Autoencoder (2013/2014): probabilistische Latent-Variablen-Modelle, die generatives Lernen praktisch trainierbar machten.
Goodfellows Generative Adversarial Networks von 2014: zwei Netze im Nullsummenspiel – jahrelang das dominante generative Verfahren vor den Diffusionsmodellen.
CLIP ist OpenAIs kontrastives Modell von 2021, das Bilder und Sprache in einen gemeinsamen Vektorraum bringt – Grundlage von Stable Diffusion und Nachfolgern.
Vision Transformer übertragen die Transformer-Architektur auf Bilder: Zerlegung in Patches statt Faltung – von ViT 2020 über DeiT bis heute.
Mixture of Experts aktiviert je Eingabe nur einen Teil spezialisierter Experten – die Grundlage heutiger Modelle mit sehr hoher Parameterzahl.
Long Short-Term Memory ist die Gating-Architektur von Hochreiter und Schmidhuber (1997), die das Vanishing-Gradient-Problem löste und Sequenzmodelle prägte.
Convolutional Neural Networks trugen die Computer Vision – von LeCuns LeNet über den AlexNet-Durchbruch 2012 bis zur Ablösung durch Vision Transformer.