GoogLeNet ist eine 2014 von einem Forschungsteam um Christian Szegedy bei Google vorgestellte Convolutional-Neural-Network-Architektur, die den Sieger der Bildklassifikation beim ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2014 stellte.
Zusammenfassung
Kernstück der Architektur ist das Inception-Modul: Statt sich pro Schicht auf eine feste Filtergröße festzulegen, verarbeitet ein Inception-Modul denselben Input parallel mit 1×1-, 3×3- und 5×5-Faltungen sowie Pooling und fügt die Ergebnisse anschließend zusammen (Szegedy u. a. 2014). Zusätzliche 1×1-Faltungen vor den größeren Filtern (Szegedy u. a. 2014) reduzieren die Dimensionalität und halten den Rechenaufwand trotz der Parallelität in Grenzen.
GoogLeNet erreichte mit 22 Gewichtsschichten eine Fehlerrate von 6,67 Prozent (Top-5) beim ILSVRC 2014 (Szegedy u. a. 2014) – bei deutlich weniger Parametern als das im selben Jahr vorgestellte VGGNet.
Begriffsgeschichte
Die Architektur entstand im direkten Wettbewerbsumfeld des ILSVRC 2014, in dem mehrere Forschungsgruppen um die tiefste und genaueste Bildklassifikationsarchitektur konkurrierten. Der Name „GoogLeNet” ist eine bewusste Anspielung auf LeCuns frühere LeNet-Architektur, verbunden mit dem Namen des Herkunftsunternehmens.
Methodische Grundlagen
Über das Inception-Modul hinaus verzichtet GoogLeNet auf große vollverbundene Schichten am Ende des Netzes zugunsten von Global Average Pooling, was die Parameterzahl gegenüber Architekturen wie VGGNet drastisch senkt. Zusätzliche Hilfsklassifikatoren an mittleren Netzwerkschichten während des Trainings mildern das Problem verschwindender Gradienten in sehr tiefen Netzen.
Anwendungsfelder
Das Inception-Prinzip paralleler Filtergrößen prägte zahlreiche Nachfolgearchitekturen bei Google, die in mehreren Versionen (Inception-v2 bis Inception-v4) verfeinert wurden, und beeinflusste allgemein die Entwicklung effizienterer, parametersparsamer CNN-Designs.
Kontroversen und Kritik
Die Komplexität des Inception-Moduls mit seinen parallelen Pfaden erschwert die architektonische Nachvollziehbarkeit im Vergleich zur homogenen Struktur von VGGNet. Kritiker:innen wiesen zudem darauf hin, dass viele der spezifischen Designentscheidungen empirisch statt aus einem klaren theoretischen Prinzip abgeleitet waren.
Verwandte Begriffe
- ImageNet – Wettbewerb, den GoogLeNet 2014 gewann
- AlexNet – Vorgänger-Architektur, die den Deep-Learning-Boom auslöste, gegen den GoogLeNet 2014 antrat
- ResNet – Nachfolgearchitektur, die das Tiefenproblem, dem GoogLeNet nur mit Hilfsklassifikatoren begegnete, durch Skip-Connections löste
Quellenangaben
- Szegedy, Christian u. a., 2014. Going Deeper with Convolutions. arXiv: 1409.4842.