Im Maschinenraum der Bild-KI steht heute kein Malroboter mit Baskenmütze. Da steht ein Nebelkessel. Links ein Trainingspunkt, rechts ein Trainingspunkt, dazwischen graue Körnchen, die aussehen, als hätte jemand die Statistik in den Ascheimer gekippt.
Google Research hat am 15. Juli 2026 einen Forschungsbeitrag veröffentlicht, der die Kreativität von Diffusionsmodellen weniger nach Zaubertrick und mehr nach Werkstattunfall mit Mathematik aussehen lässt. Der Kern: Wenn so ein Modell aus Rauschen wieder ein Bild macht, kopiert es nicht zwangsläufig brav den nächsten Trainingsdatensatz. Es fährt, grob gesagt, durch eine geglättete Kraftlandschaft. Und in dieser geglätteten Landschaft gibt es Zwischenräume, in denen Neues entstehen kann. Nicht mystisch. Eher: die Walze hat Spiel.
Die perfekte Maschine wäre ein Kopierer mit Angst vor Zwischenräumen
Der Beitrag erklärt Diffusionsmodelle über das bekannte Denoising: Trainingsdaten werden absichtlich verrauscht, das Modell lernt die Rückwärtsrichtung, Schritt für Schritt, vom Staub zurück zur Form. Wäre die gelernte Score-Funktion perfekt und hartkantig, würde sie Partikel am Ende wie ein Amtsstempel auf die bekannten Trainingspunkte drücken. Links Original, rechts Original, dazwischen: bitte nicht stehen bleiben, hier ist kein Aufenthaltsbereich.
Nur sind neuronale Netze keine perfekten Metallschienen. Durch Regularisierung, Weight Decay und auch implizite Glättung beim Lernen werden scharfe Klippen in dieser Score-Funktion weicher. Die Forschung nennt das Score Smoothing. Die Blechpresse nennt es: die Kante wurde rundgeschliffen, wahrscheinlich von der Nachtschicht, niemand war zuständig.
Interpolation ist kein Konfetti, aber auch kein Fotokopierer
In Googles Beispiel mit zwei Punkten, +1 und -1, entscheidet die Form der Score-Funktion darüber, ob die Teilchen streng zu einem Original zurückfallen oder ob sie im Zwischenraum landen dürfen. Wird die Funktion geglättet, entsteht eine Art Interpolationszone. Dort setzt sich das Material nicht als Kopie ab, sondern als plausible Zwischenform. Das ist nicht die ganze Erklärung für jede kreative Bild-KI, aber es ist ein schöner Schraubenschlüssel gegen die ganz grobe Behauptung: „Die Maschine malt ja nur ab.“
Natürlich bleibt die Sache nüchtern: Diffusionsmodelle können memorisieren, Trainingsdaten können durchschlagen, und niemand sollte aus einem mathematischen Mechanismus gleich ein kleines Künstlergenie mit Gewerbeschein machen. Aber der Forschungsbefund zeigt, warum Neuheit aus dem Lernverfahren selbst heraus entstehen kann. Nicht trotz der Unschärfe. Sondern wegen dieser geglätteten, leicht nachgiebigen Schiene.
Für die Werkstatt heißt das: Kreativität hat Lagerfett
Die interessanteste Pointe ist nicht, dass Maschinen plötzlich „kreativ“ im menschlichen Sinn wären. Die Pointe ist kleiner und rostiger: Ein bisschen Ungenauigkeit kann strukturbildend sein. Die Maschine, die zu glatt kopieren müsste, wäre langweiliger als die Maschine, deren gelernte Kurve ein wenig federt.
Da liegt dann der Blechpresse-Zettel auf dem Tisch: Wenn der Nebel durch die Walze läuft, kommt nicht immer das alte Foto heraus. Manchmal kommt etwas dazwischen heraus. Nicht frei erfunden aus dem Nichts, nicht heilig inspiriert, nicht per Marketingabteilung vergoldet. Eher wie ein neues Blechstück zwischen zwei alten Formen. Es passt. Es quietscht. Und es hat sehr wahrscheinlich noch etwas Trainingsstaub im Rand.
