Deep Speech 2: End-to-End Speech Recognition in English and Mandarin ist eine 2015 von Baidu Research unter Leitung von Dario Amodei veröffentlichte Arbeit, an der auch Andrew Ng als damaliger Chefwissenschaftler des Labors beteiligt war. Sie zeigte, dass sich dieselbe End-to-End-Architektur ohne sprachspezifische Anpassung auf zwei linguistisch sehr unterschiedliche Sprachen anwenden lässt.
Zusammenfassung
Klassische Spracherkennungssysteme bestanden aus mehreren separat entwickelten Komponenten – akustischen Modellen, Aussprachewörterbüchern und Sprachmodellen –, die jeweils sprachspezifisches Expertenwissen erforderten. Deep Speech 2 ersetzt diese Pipeline durch ein einziges, end-to-end trainiertes rekurrentes Netz, das direkt von Audiospektrogrammen zu Textzeichen abbildet.
Begriffsgeschichte
Die Arbeit erschien als Nachfolger des ursprünglichen, 2014 vorgestellten Deep-Speech-Systems und demonstrierte einen deutlichen Genauigkeitssprung durch größere Modelle, mehr Trainingsdaten und verbesserte Trainingsverfahren. Sie erschien in einer Phase, in der End-to-End-Deep-Learning-Ansätze klassische, aus vielen Einzelkomponenten bestehende Sprachverarbeitungssysteme zunehmend verdrängten.
Methodische Grundlagen
Das Modell kombiniert mehrschichtige rekurrente Netze mit Convolutional-Vorverarbeitungsschichten und wird mit der Connectionist-Temporal-Classification-Verlustfunktion trainiert, die es erlaubt, Audiosequenzen unterschiedlicher Länge direkt auf Textausgaben unterschiedlicher Länge abzubilden, ohne dass eine Wort-für-Wort-Ausrichtung zwischen Audio und Text vorab bekannt sein muss.
Anwendungsfelder
Deep Speech 2 diente als Grundlage für Baidus kommerzielle Spracherkennungsprodukte und zeigte praxisrelevante Robustheit gegenüber Hintergrundgeräuschen, unterschiedlichen Akzenten und Sprechgeschwindigkeiten – Eigenschaften, die für den produktiven Einsatz außerhalb kontrollierter Laborbedingungen entscheidend sind.
Kontroversen und Kritik
Der enorme Rechenaufwand für Training und Inferenz eines derart großen End-to-End-Modells war zum Erscheinungszeitpunkt für viele Forschungsgruppen außerhalb gut ausgestatteter Industrielabore kaum reproduzierbar. Zudem bleibt die interne Fehleranalyse bei End-to-End-Systemen schwieriger als bei klassischen, modular aufgebauten Pipelines, bei denen sich Fehler einzelnen Komponenten zuordnen lassen.
Verwandte Begriffe
- Andrew Ng – leitete zum Erscheinungszeitpunkt Baidus KI-Forschungslabor
- Neuronale Netze – übergeordnete Systemklasse
Quellenangaben
- Amodei, Dario u. a., 2015. Deep Speech 2: End-to-End Speech Recognition in English and Mandarin. arXiv: 1512.02595.