
News
KI füttert KI: Warum synthetische Daten zur Qualitätsfrage werden
News
Künstlich erzeugte Trainingsdaten können Sprachmodelle verbessern – oder ihre Schwächen über Generationen verstärken. Für Unternehmen entscheidet deshalb nicht die produzierte Datenmenge, sondern die Fähigkeit, wertvolle Beispiele von überzeugendem Ausschuss zu unterscheiden.
Expert in the Loop · Fachlich geprüft von Viktor Hettich, Founder & CEO
07. Oktober 2026 · 6 Min Lesezeit
Management Summary
Künstlich erzeugte Trainingsdaten können Sprachmodelle verbessern – oder ihre Schwächen über Generationen verstärken. Für Unternehmen entscheidet deshalb nicht die produzierte Datenmenge, sondern die Fähigkeit, wertvolle Beispiele von überzeugendem Ausschuss zu unterscheiden.
Am 24. Juli 2024 veröffentlicht das Fachjournal Nature eine Untersuchung mit einer unbequemen Botschaft: Wer künstliche Intelligenz immer wieder mit den Ausgaben ihrer Vorgänger trainiert, kann deren Fähigkeiten systematisch beschädigen. Der vermeintliche Kreislauf des Wissens wird unter bestimmten Bedingungen zur Abwärtsspirale.
Das ist die überraschende Kehrseite eines verlockenden Versprechens. Wenn lernende Systeme ihre eigenen Übungsaufgaben schreiben können, scheint ein zentraler Produktionsfaktor plötzlich beliebig vermehrbar. Keine aufwendige Erhebung, keine endlosen Warteschlangen beim Annotieren, also beim menschlichen Beschriften von Beispielen. Einfach mehr erzeugen.
Doch ein Kopierer ist noch keine Universität. Die strategische Frage lautet nicht, ob Maschinen Trainingsmaterial herstellen können. Sondern: Wer garantiert, dass darin etwas Lernenswertes steckt?
Redaktioneller Stand: 7. Oktober 2026. Ohne Live-Nachrichtenzugriff lässt sich das wichtigste Ereignis dieses Tages nicht verifizieren. Diese Trendanalyse stützt sich auf die verlinkten Primärquellen; sie ist kein bestätigtes Tagesranking.
Synthetische Daten: Die Fabrik braucht einen Qualitätsmaßstab
Synthetische Daten sind künstlich erzeugte Beispiele, die für Training oder Tests eingesetzt werden. Dazu zählen formulierte Kundendialoge, programmierte Fehlerszenarien oder mathematische Aufgaben mit überprüfbaren Lösungen. Nicht jedes solche Beispiel stammt aus einem Sprachmodell; auch Simulationen und regelbasierte Verfahren kommen infrage.
Ihr wirtschaftlicher Reiz ist offensichtlich: Ein Unternehmen kann gezielt Situationen erzeugen, die im vorhandenen Material fehlen. Statt auf den nächsten seltenen Reklamationsfall zu warten, lässt sich eine ganze Familie ähnlicher Konstellationen entwerfen. Personenbezogene Originaldaten müssen dabei nicht zwangsläufig übernommen werden.
Aber die entscheidende Trennung verläuft zwischen Vielfalt auf dem Papier und zusätzlicher Information. Tausend anders formulierte Antworten können denselben Irrtum transportieren. Ein größeres Archiv ist dann lediglich ein größeres Echo.
Meine These: Der strategische Engpass liegt deshalb nicht allein in der Erzeugung, sondern in der Bewertung. Wer verlässlich unterscheiden kann, welche Beispiele stimmen, relevant sind und tatsächlich Neues abdecken, kontrolliert die wertvollere Stufe dieser Produktionskette. Die Druckerpresse liefert Seiten. Noch keine Bildung.
Model Collapse: Wenn das Echo die Wirklichkeit verdrängt
Die Nature-Arbeit von Ilia Shumailov und weiteren Forschenden untersucht den sogenannten Model Collapse, den schrittweisen Verlust von Qualität beim wiederholten Lernen aus modellgenerierten Inhalten. In den untersuchten rekursiven Verfahren fließen Ausgaben einer Generation in das Training der nächsten ein.
Dabei können zunächst seltene Bereiche der ursprünglichen Datenverteilung verloren gehen. Vereinfacht: Das Gewöhnliche bleibt sichtbar, die Ausnahmen verschwinden. Später können stärkere Verzerrungen folgen. Die Autoren beschreiben diesen Mechanismus in „AI models collapse when trained on recursively generated data“.
Für die Wirtschaft ist gerade der Verlust seltener Fälle brisant. Ein Supportsystem kann bei Standardfragen glänzen und ausgerechnet bei ungewöhnlichen Vertragskonstellationen schwächeln. Der Durchschnitt wirkt ordentlich, während die schwierigen Ränder ausfransen.
Wichtig ist die Grenze des Befunds: Die Studie beweist nicht, dass jedes künstlich erzeugte Trainingsbeispiel schädlich ist. Auswahl, Mischung, Rückkopplung und der Erhalt ursprünglicher Informationen zählen. Aus „unter bestimmten Bedingungen gefährlich“ wird nicht „grundsätzlich unbrauchbar“.
Der eigentliche Warnruf lautet: Eine Lernpipeline darf ihre Verbindung zur Wirklichkeit nicht unbemerkt kappen. Sonst misst jede Generation sich zunehmend am eigenen Spiegelbild.
AlphaGeometry: Der Gegenbeweis kommt aus der Mathematik
Wie produktiv künstlich erzeugtes Lernmaterial sein kann, zeigt eine andere Nature-Veröffentlichung. Am 17. Januar 2024 stellen Trieu H. Trinh und Mitautoren AlphaGeometry vor: ein System, das ein neuronales Sprachmodell mit einer symbolischen Deduktionsmaschine verbindet. Letztere arbeitet mit expliziten Regeln, um geometrische Schlussfolgerungen abzuleiten.
Die Forschenden erzeugten einen synthetischen Trainingsbestand mit 100 Millionen Beispielen. Bei einem Test mit 30 Geometrieaufgaben aus Mathematik-Olympiaden löste das System 25 innerhalb des vorgesehenen Zeitlimits. Die Originalarbeit dokumentiert Verfahren und Ergebnisse.
Der entscheidende Unterschied zum unkontrollierten Echo: Hier existiert eine formale Struktur, an der sich Schlussfolgerungen prüfen lassen. Eine elegant klingende Begründung reicht nicht. Die Geometrie verhandelt nicht über Plausibilität.
Genau darin steckt der Wow-Moment: Künstlich erzeugte Beispiele müssen nicht bloß vorhandene Texte imitieren. In geeigneten Aufgabenräumen können sie systematisch überprüfbare Lerngelegenheiten erschließen.
Das lässt sich allerdings nicht pauschal auf Beratung, Personalentscheidungen oder Marktprognosen übertragen. Dort fehlt häufig ein eindeutiger Prüfer. Ein bewiesener Winkel ist etwas anderes als eine überzeugend formulierte Geschäftsstrategie.
Kleine Sprachmodelle: Gute Lehrpläne statt bloßer Datenmasse
Auch Microsofts Phi-3-Bericht macht deutlich, welche Rolle die Auswahl des Materials spielen kann. Das im April 2024 vorgestellte Phi-3-mini umfasst 3,8 Milliarden Parameter – numerische Größen, die ein Modell während des Trainings anpasst. Laut technischem Bericht wurde es mit 3,3 Billionen Tokens trainiert, also verarbeiteten Texteinheiten, die nicht mit ganzen Wörtern gleichzusetzen sind.
Zum Datenmix gehörten sorgfältig gefilterte öffentlich verfügbare Webinhalte und synthetisch erzeugtes Material. Die Autoren betonen dessen Qualität und die Ausrichtung auf schlussfolgerndes Arbeiten.
Das ist kein isolierter Kausalnachweis dafür, wie viel Leistungsgewinn genau auf den künstlich erzeugten Anteil entfällt. Architektur, Auswahlverfahren und weitere Trainingsentscheidungen wirken zusammen. Zudem stammt die Bewertung zunächst vom Entwicklerteam selbst.
Trotzdem liefert der Ansatz einen wichtigen Perspektivwechsel: Ein Lehrplan kann ebenso strategisch sein wie die Größe des Schülers. Für betriebliche Anwendungen bedeutet das nicht automatisch, das kleinste Modell zu kaufen. Es bedeutet, die Passung zwischen Aufgabe, Lernstoff und Prüfung ernst zu nehmen.
Was bedeutet das für Unternehmen?
Die falsche Einkaufsfrage lautet: „Wie viele zusätzliche Beispiele bekommen wir?“ Die bessere: „Welche nachweisbare Schwäche verschwindet dadurch?“ Daraus ergeben sich fünf praktische Anforderungen.
Erstens: einen unabhängigen Prüfbestand sichern. Reale, rechtmäßig nutzbare und fachlich geprüfte Fälle sollten getrennt von der Trainingspipeline bleiben. Werden Prüfaufgaben indirekt zum Lernstoff, sehen Ergebnisse besser aus, als sie im Einsatz sind.
Zweitens: gezielt erzeugen. Zusätzliche Dialoge sollten konkrete Lücken adressieren: seltene Produktkombinationen, sprachliche Varianten oder schwierige Ausnahmeprozesse. Masse ohne Fehleranalyse ist Datenproduktion im Blindflug.
Drittens: Prüfer passend zur Aufgabe wählen. Programmcode lässt sich teilweise durch Tests kontrollieren, Rechnungen durch Rechenregeln. Eine medizinische oder juristische Antwort benötigt andere Sicherungen. Ein weiteres Sprachmodell kann vorsortieren, ersetzt aber keinen unabhängigen Wahrheitsmaßstab.
Viertens: Datenschutz nicht voraussetzen. „Synthetisch“ ist kein Synonym für „anonym“. Je nach Erzeugungsverfahren können vertrauliche Inhalte reproduziert oder Rückschlüsse ermöglicht werden. Herkunft, Zugriffsrechte und Prüfungen gehören deshalb in die Beschaffung.
Fünftens: Gesamtkosten messen. Erzeugung, Filterung, fachliche Kontrolle und erneute Evaluation verursachen Aufwand. Der sinnvolle Nenner lautet nicht Preis pro Datensatz, sondern Kosten pro nachweisbarer Verbesserung.
Daraus folgt meine Position: Unternehmen sollten ihre belastbaren Prüfkriterien mindestens so sorgfältig schützen wie ihre Modellzugänge. Wer die Abnahme beherrscht, bleibt beim Lieferantenwechsel handlungsfähiger.
Fazit: Die Wahrheit wird nicht mitproduziert
Die drei Forschungsarbeiten markieren keinen einfachen Sieg und keine pauschale Niederlage synthetischer Trainingsdaten. Sie zeigen einen Zielkonflikt: Künstliche Erzeugung erweitert die Lernmöglichkeiten, kann ohne geeignete Sicherungen aber Fehler verstärken und wichtige Unterschiede auslöschen.
Für Entscheider liegt darin eine nüchterne Chance. Nicht jedes Unternehmen muss ein Spitzenmodell entwickeln. Es kann jedoch wissen, wie eine korrekte Leistung in seinem Geschäft aussieht – und dieses Wissen in überprüfbare Aufgaben übersetzen.
Die nächste wertvolle Datenfabrik braucht deshalb mehr als schnelle Generatoren. Sie braucht eine Abnahme, die auch Nein sagen kann. Denn Antworten lassen sich vervielfältigen. Verlässlichkeit muss man verdienen.
Häufige Fragen
Sind synthetische Daten grundsätzlich schlechter als echte?
Nein. In überprüfbaren Aufgabenräumen können sie ausgesprochen nützlich sein. Entscheidend sind Erzeugungsverfahren, fachliche Richtigkeit, Vielfalt und der Nachweis, dass das trainierte System auch außerhalb seiner Übungswelt funktioniert.
Verursacht das Training mit Modellantworten immer Model Collapse?
Nein. Das Risiko hängt vom konkreten Verfahren ab. Die zitierte Forschung warnt vor bestimmten rekursiven Lernprozessen; daraus folgt kein allgemeines Verbot künstlich erzeugten Materials.
Was sollte ein Unternehmen zuerst investieren?
In einen unabhängigen, repräsentativen Prüfbestand und klare Erfolgskriterien. Ohne diese Grundlage lässt sich kaum belastbar unterscheiden, ob zusätzliche Beispiele echte Fortschritte bringen oder lediglich bekannte Schwächen neu verpacken.
