Blog

Text-und-Data-Mining-Schranke

Die Text-und-Data-Mining-Schranke (kurz TDM-Schranke) ist eine gesetzliche Ausnahme im Urheberrecht. Sie erlaubt es, Werke für die automatisierte Analyse zu vervielfältigen, ohne dass der Rechtsinhaber zustimmen muss. Die EU hat sie 2019 in den Artikeln 3 und 4 der DSM-Richtlinie (EU) 2019/790 vorgeschrieben. Deutschland regelt sie in den Paragrafen 44b und 60d des Urheberrechtsgesetzes (UrhG).

Zusammenfassung

Das Gesetz kennt zwei Schranken mit unterschiedlicher Reichweite. § 44b UrhG gilt allgemein und kennt keine Zweckbindung, ist also auch für kommerzielle Vorhaben nutzbar. Er greift aber nur, wenn der Rechtsinhaber sich die Nutzung nicht vorbehalten hat. § 60d UrhG gilt für wissenschaftliche Forschung und kennt im Wortlaut keinen solchen Vorbehalt.

Der Gesetzestext nennt künstliche Intelligenz nicht. Ob und wie weit das Training von KI-Modellen darunter fällt, ist deshalb eine Auslegungsfrage. Deutsche Gerichte haben die Schranke bisher auf die Vorbereitung von Trainingsdaten angewandt. Eine höchstrichterliche Entscheidung steht aus.

Abgrenzung

§ 44b UrhG (allgemeine Schranke) – erlaubt Vervielfältigungen rechtmäßig zugänglicher Werke für das Text und Data Mining. Die Kopien sind zu löschen, sobald sie dafür nicht mehr erforderlich sind. Die Nutzung ist nur zulässig, wenn der Rechtsinhaber sich diese nicht vorbehalten hat. Bei online zugänglichen Werken ist der Vorbehalt nur wirksam, wenn er in maschinenlesbarer Form erfolgt.

§ 60d UrhG (Forschungsschranke) – gilt für Zwecke der wissenschaftlichen Forschung. Berechtigt sind Forschungsorganisationen, Kulturerbe-Einrichtungen und einzelne Forscher, die nicht kommerziell arbeiten. Eine Forschungsorganisation darf nicht kommerzielle Zwecke verfolgen, muss ihre Gewinne reinvestieren oder im staatlich anerkannten öffentlichen Auftrag tätig sein.

Ausgeschlossen sind Einrichtungen, auf die ein privates Unternehmen bestimmenden Einfluss hat und die ihm bevorzugten Zugang zu den Ergebnissen geben.

Begriffsgeschichte

Die DSM-Richtlinie vom 17. April 2019 definiert Text und Data Mining in Art. 2 Nr. 2 als Technik für die automatisierte Analyse von Texten und Daten in digitaler Form, mit der sich unter anderem Informationen über Muster, Trends und Korrelationen gewinnen lassen.

Art. 3 verpflichtet die Mitgliedstaaten zu einer Ausnahme für Forschungsorganisationen und Einrichtungen des Kulturerbes. Art. 4 verpflichtet sie zu einer allgemeinen Ausnahme für rechtmäßig zugängliche Werke, die Rechteinhaber durch einen Nutzungsvorbehalt abbedingen können.

Erwägungsgrund 18 nennt den Zweck: Das Mining werde auch von privaten Einrichtungen für neue Anwendungen und Technologien eingesetzt, und die Ausnahme solle Rechtssicherheit schaffen und Innovation anregen. Rechteinhaber sollten weiterhin Lizenzen erteilen können. Vertragsklauseln, die der Forschungsausnahme des Art. 3 zuwiderlaufen, sind nach Art. 7 Abs. 1 nicht durchsetzbar. Für Art. 4 sieht die Richtlinie das nicht vor.

Die Richtlinie selbst nennt künstliche Intelligenz nicht. Nach dem Landgericht München I führte aber schon die deutsche Gesetzesbegründung das maschinelle Lernen als Basistechnologie für KI im Anwendungsbereich auf. Die KI-Verordnung von 2024 knüpft ausdrücklich an Art. 4 Abs. 3 der Richtlinie an.

Anwendungsfelder

Datensätze für das KI-Training. Im Verfahren Kneschke gegen LAION hatte ein gemeinnütziger Verein Bilder aus dem Netz geladen, um sie mit ihren Beschreibungen abzugleichen.

Das Oberlandesgericht Hamburg sah darin eine Vervielfältigung, die § 44b und § 60d UrhG rechtfertigten. Schon der Abgleich von Bild und Beschreibung sei eine Analyse zur Gewinnung von Informationen. Ob auch das spätere Training generativer Modelle Text und Data Mining sei, brauche das Gericht deshalb nicht zu entscheiden.

Den Vorbehalt der Bildagentur ließ das Gericht nicht genügen. Er war in natürlicher Sprache verfasst, und der Kläger habe nicht dargelegt, dass er in der zweiten Jahreshälfte 2021 maschinenlesbar war. Eine allgemeine Aussage, ob natürliche Sprache je genügt, geht aus der Zusammenfassung des Bundesgerichtshofs nicht hervor.

Training des Modells selbst. Das Landgericht München I (11. November 2025) wandte § 44b UrhG im Verfahren GEMA gegen OpenAI auf Sprachmodelle grundsätzlich an. Die Vorschrift decke die Vervielfältigungen beim Zusammenstellen des Trainingskorpus. Nicht gedeckt seien Vervielfältigungen im Modell, wenn es Werke memorisiert: Das sei keine bloße Auswertung von Informationen mehr, sondern greife in die Verwertungsinteressen der Urheber ein.

Pflichten nach der KI-Verordnung. Anbieter von KI-Modellen mit allgemeinem Verwendungszweck müssen nach Art. 53 Abs. 1 Buchstabe c der Verordnung eine Strategie zur Einhaltung des Urheberrechts einführen. Sie muss insbesondere einen Vorbehalt nach Art. 4 Abs. 3 der DSM-Richtlinie erkennen und beachten, auch mit modernster Technologie. Nach Buchstabe d müssen sie zudem eine hinreichend detaillierte Zusammenfassung der Trainingsdaten veröffentlichen.

Die Befreiung für quelloffene Modelle in Art. 53 Abs. 2 gilt nur für die Buchstaben a und b, nicht für diese beiden Pflichten. Erwägungsgrund 106 verlangt die Einhaltung unabhängig davon, wo das Training stattfindet. Die Pflichten gelten seit dem 2. August 2025. Für Modelle, die vorher auf den Markt kamen, setzt Art. 111 Abs. 3 eine Frist bis zum 2. August 2027. Die Verordnung (EU) 2026/1744 vom Juli 2026 ändert diese Vorschriften nicht.

Praxis der Vorbehalte. Der GPAI Code of Practice konkretisiert die Pflicht freiwillig.

Unterzeichner verpflichten sich in Maßnahme 1.3, Crawler einzusetzen, die robots.txt nach RFC 9309 befolgen, und weitere geeignete maschinenlesbare Protokolle zu beachten. Außerdem sollen sie Informationen über ihre Crawler veröffentlichen und eine Anlaufstelle für Beschwerden benennen. Für Website-Betreiber ist deshalb die robots.txt das praktische Mittel, einen Vorbehalt zu erklären.

Kontroversen und Kritik

Was ist „maschinenlesbar“? Das deutsche Gesetz erklärt den Vorbehalt bei online zugänglichen Werken nur dann für wirksam, wenn er maschinenlesbar ist.

Die Richtlinie nennt maschinenlesbare Mittel in Art. 4 Abs. 3 nur als Beispiel („etwa“). Erwägungsgrund 18 führt neben Metadaten auch die Geschäftsbedingungen einer Website auf. Was die Maschinenlesbarkeit verlangt, bestimmt das Gesetz nicht. Der Berufsverband bff kritiziert, dass Urheber:innen deshalb eine Form treffen müssten, die niemand benennen könne.

Reicht der Begriff? Offen ist, ob jede Auswertung zu KI-Zwecken eine „Analyse zur Gewinnung von Informationen“ ist. Das Landgericht München I zieht die Grenze bei der Memorisierung. Nach seiner Begründung wäre das Training mit geschützten Werken nicht gedeckt, wenn sich Memorisierung nach dem Stand der Technik nicht verhindern ließe. Das Gericht stützt sich dafür auf eine Kommentarstimme und hält fest, dass die Schranke keine Vergütung vorsieht.

Forschungsschranke als Einfallstor. Der Vorbehalt wirkt nur gegen § 44b, nicht gegen § 60d. Kritiker wenden ein, ein Forschungsverein könne Datensätze erstellen, die kommerzielle Anbieter anschließend nutzen. Das Oberlandesgericht Hamburg sah darin keinen Widerspruch zur Gemeinnützigkeit und verwies auf den Open-Source-Ansatz.

Stand 2025/2026

Am 3. September 2026 verhandelte der Bundesgerichtshof die Revision gegen das Hamburger Urteil (I ZR 281/25). Der Verkündungstermin ist der 17. Dezember 2026. Nach Angaben des bff, der die Verhandlung beobachtete, ließ der Senat erkennen, dass er dem Europäischen Gerichtshof Auslegungsfragen vorlegen wird.

Beim Gerichtshof ist seit dem 3. April 2025 das Vorabentscheidungsersuchen C-250/25 (Like Company gegen Google Ireland) anhängig. Frage 3 lautet, ob die Vervielfältigung rechtmäßig zugänglicher Werke beim Training eines Chatbots unter die Ausnahme des Art. 4 der Richtlinie fällt.

Am 10. März 2026 fand dazu die mündliche Verhandlung statt, die erste des Gerichtshofs zu generativer KI und Urheberrecht. Der Generalanwalt sollte nach Angaben des IP Helpdesk der Europäischen Kommission am 3. September 2026 seine Schlussanträge vortragen. Deren Inhalt und ein Urteil sind hier nicht belegt.

Verwandte Begriffe

Quellenangaben

  1. Europäisches Parlament und Rat, 2019. Richtlinie (EU) 2019/790 über das Urheberrecht und die verwandten Schutzrechte im digitalen Binnenmarkt, Art. 2 Nr. 2, Art. 3, 4 und 7 sowie Erwägungsgrund 18. Amtsblatt der Europäischen Union L 130, 17. April 2019.
  2. Bundesrepublik Deutschland. Gesetz über Urheberrecht und verwandte Schutzrechte (UrhG), § 44b und § 60d. gesetze-im-internet.de.
  3. Europäisches Parlament und Rat, 2024. Verordnung (EU) 2024/1689 (KI-Verordnung), Art. 53, 111 und 113 sowie Erwägungsgründe 105 bis 107. Amtsblatt der Europäischen Union L, 12. Juli 2024. Art. 53 und 111 sind durch die Verordnung (EU) 2026/1744 nicht geändert (Textabgleich am 1. Oktober 2026).
  4. Bundesgerichtshof, 2026. Verkündungstermin am 17. Dezember 2026 in Sachen I ZR 281/25 (Erstellen eines Datensatzes für KI-Training). Terminhinweis, bundesgerichtshof.de, mit Zusammenfassung der Urteile von Landgericht und Oberlandesgericht Hamburg.
  5. Landgericht München I, 2025. Urteil vom 11. November 2025 – 42 O 14139/24. gesetze-bayern.de.
  6. Europäische Kommission, 2025. General-Purpose AI Code of Practice, Copyright Chapter, Maßnahmen 1.2 und 1.3. Endfassung vom Juli 2025, gelesen im Volltext auf code-of-practice.ai (inoffizielle Wiedergabe).
  7. Gerichtshof der Europäischen Union, 2025. Rechtssache C-250/25, Like Company. Zusammenfassung des Vorabentscheidungsersuchens. Eingereicht am 3. April 2025.
  8. Europäische Kommission, IP Helpdesk, 2026. First CJEU hearing on generative AI and copyright. intellectual-property-helpdesk.ec.europa.eu, April 2026.
  9. BFF – Berufsverband Freie Fotografen und Filmgestalter, 2026. Kneschke ./. LAION e.V.: Was die Verhandlung vor dem BGH gezeigt hat. bff.de, 9. September 2026. Stellungnahme eines Verbands, nicht neutral.

← Zurück zur Lexikon-Übersicht