Google beschreibt einen kleinen synthetischen Textdatensatz, der generative Modelle wirksam trainieren und für Menschen lesbar bleiben soll. Solche künstlichen Daten könnten große Originalbestände verdichten und sensible Beispiele ersetzen.
Die am 3. September veröffentlichte Anmeldung US 2026/0260109 A1 optimiert beides gemeinsam: Ein auf den Kunst-Daten trainiertes Modell soll auf realen Daten gut abschneiden; jeder erzeugte Text muss zugleich einen Lesbarkeitswert erreichen.
Gradienten werden angeglichen
Das Verfahren vergleicht Trainingsgradienten echter und synthetischer Beispiele. Es verändert zunächst kontinuierliche Worteinbettungen und projiziert sie anschließend auf gültige Vokabeln. Schwache Beispiele können herausgefiltert werden. Optional lässt sich Rauschen für formalen Differential-Privacy-Schutz hinzufügen.
Der künstliche Datensatz darf laut Ansprüchen auch ein anderes Modell trainieren als jenes, das ihn erzeugt. Das macht die Methode für kleinere Zielmodelle interessant.
Bewertung: Lesbar bedeutet nicht korrekt
Weniger Trainingsdaten können Kosten, Prüfung und Weitergabe vereinfachen. Ein guter Perplexity-Wert beweist jedoch weder verständliche Aussagen noch faktische Richtigkeit. Auch der Datenschutz ist nur eine optionale Variante und kein Bestandteil des Hauptanspruchs. Die in der Schrift genannten Leistungsgewinne stammen von den Anmeldern; eine unabhängige Prüfung fehlt. Die Veröffentlichung belegt weder eine Patenterteilung noch den Einsatz in einem Google-Produkt.