Ein Sprachmodell liest einen Satz, macht einen Fehler und justiert daraufhin Milliarden winziger Stellschrauben. Seit Jahrzehnten läuft dieses Lernen gewissermaßen im Rückwärtsgang: Ausgehend vom Ergebnis wird berechnet, welche Verbindung im neuronalen Netz wie stark zum Fehler beigetragen hat. Ohne diesen Rückweg, so lautete bislang die praktische Gewissheit, lernt ein großes Netz nicht zuverlässig.
Ein Forschungsteam von Q Labs versucht nun, diese Gewissheit ins Wanken zu bringen. Sein Verfahren heißt Dust und trainiert Transformer ohne Backpropagation – also ohne jene rückwärts gerichtete Fehlerberechnung, auf der fast die gesamte moderne KI-Industrie beruht. Was zunächst wie eine technische Randnotiz klingt, rührt an eine der ältesten Grundfragen des maschinellen Lernens: Muss künstliche Intelligenz tatsächlich nach einem Verfahren lernen, das sich vor 40 Jahren durchgesetzt hat?
Die Erfindung des Rückwärtsgangs
Am 9. Oktober 1986 veröffentlichten David Rumelhart, Geoffrey Hinton und Ronald Williams in „Nature“ ihren berühmten Aufsatz über Backpropagation. Das Verfahren passt die Gewichte eines neuronalen Netzes wiederholt so an, dass die Differenz zwischen gewünschtem und tatsächlichem Ergebnis schrumpft. Vor allem können verborgene Schichten damit selbst nützliche Merkmale entwickeln. Aus Pixeln wurden Konturen, aus Konturen Formen, aus Zeichen später Wörter und Bedeutungszusammenhänge. Recherchequelle: nature.com
Das Grundprinzip lässt sich mit einer langen Reihe von Mischpulten vergleichen. Am Ende kommt ein falscher Ton heraus. Backpropagation verfolgt nun rückwärts, welcher Regler an welchem Pult wie viel zu diesem Fehler beigetragen hat. Anschließend werden die Regler ein wenig verstellt. Dieser Vorgang wiederholt sich millionenfach.
Allerdings stellt das Verfahren klare Anforderungen. Jeder Rechenschritt muss mathematisch nachvollziehbar und differenzierbar sein. Außerdem müssen die Aktivierungen aus dem Vorwärtslauf gespeichert werden, damit sie beim Rückwärtslauf wieder zur Verfügung stehen. Architektur, Software und KI-Chips sind deshalb eng mit Backpropagation verwachsen. Sie ist nicht nur ein Algorithmus, sondern der unsichtbare Bauplan einer ganzen Branche.
Staubkörner im Getriebe
Dust schlägt einen anderen Weg ein. Statt den Fehler exakt durch sämtliche Schichten zurückzurechnen, versieht das Verfahren die Aktivierungen des Modells mit schwachem gaußschem Rauschen. Danach prüft es, ob die jeweilige Veränderung den Verlustwert gesenkt oder erhöht hat. Hilfreiche Störungen werden belohnt, nachteilige verworfen. Viele solcher Versuche verdichten sich schließlich zu einer Schätzung der Richtung, in die sich die Gewichte bewegen sollten.
Entscheidend ist: Dust verzichtet zwar auf Backpropagation, nicht jedoch auf Aktualisierungen oder Gradientenschätzungen. Der Algorithmus tastet sich voran, anstatt den exakten Rückweg durch das Netz zu berechnen.
Den zentralen Kunstgriff bezeichnen die Forscher als „virtuelle Population“. Klassische Evolutionsstrategien testen zahlreiche leicht veränderte Fassungen eines Modells. Normalerweise benötigt jede Variante einen eigenen Vorwärtslauf, was bei Millionen oder Milliarden Parametern rasch unerschwinglich wird. Dust verändert dagegen die Aktivierungen jedes Tokens unabhängig. So verhält sich jeder Token wie ein eigenes Mitglied der Versuchspopulation, und ein einziger Durchlauf kann Tausende Varianten parallel prüfen. Recherchequelle: qlabs.sh
Auf einen Motor übertragen bedeutet das: Dust baut nicht Tausende leicht unterschiedliche Exemplare, um das beste zu finden. Stattdessen lässt es einen einzigen Motor laufen und erzeugt darin Tausende winzige Abweichungen, die sich gleichzeitig beobachten lassen. Aus ihrem Verhalten liest das System ab, welche Änderungen nützlich sein könnten.
Die Idee hat Vorläufer. Frühere Arbeiten untersuchten bereits, ob sich Aktivierungen anstelle von Gewichten stören lassen. Eine bei der ICLR 2023 vorgestellte Untersuchung zeigte, dass lokale Verlustfunktionen und Störungen im Aktivierungsraum die hohe statistische Varianz solcher Vorwärtsverfahren deutlich senken können. Dust überträgt verwandte Prinzipien nun auf das Vortraining von Transformern. Recherchequelle: openreview.net
CjxkaXYgY2xhc3M9ImV4dGhvcmlhLWFtYXpvbi1hZCIgZGF0YS1leHRob3JpYS1hZC1zbG90PSIwMSIgZGF0YS1leHRob3JpYS1hZC1wcm92aWRlcj0iYW1hem9uIj48ZGl2IGNsYXNzPSJleHRob3JpYS1hbWF6b24tYWRfX21ldGEiPjxzcGFuIGNsYXNzPSJleHRob3JpYS1hbWF6b24tYWRfX2JhZGdlIj5XZXJidW5nPC9zcGFuPjxzcGFuIGNsYXNzPSJleHRob3JpYS1hbWF6b24tYWRfX3Byb3ZpZGVyIj5BbWF6b248L3NwYW4+PC9kaXY+PHN0cm9uZyBjbGFzcz0iZXh0aG9yaWEtYW1hem9uLWFkX190aXRsZSI+QW1hem9uIERpZ2l0YWxlciBHdXRzY2hlaW48L3N0cm9uZz48YSBjbGFzcz0iZXh0aG9yaWEtYW1hem9uLWFkX19jdGEiIGhyZWY9Imh0dHBzOi8vbGluay5hbWF6b24vQjBjeExNY1p6IiB0YXJnZXQ9Il9ibGFuayIgcmVsPSJzcG9uc29yZWQgbm9mb2xsb3cgbm9vcGVuZXIgbm9yZWZlcnJlciIgZGF0YS1leHRob3JpYS1saW5rLW1hbmFnZXI9IjEiIGRhdGEtZXh0aG9yaWEtbGluay10eXBlPSJleHRlcm5hbCIgZGF0YS1leHRob3JpYS1hZC1saW5rPSJhbWF6b24iPkJlaSBBbWF6b24gYW5zZWhlbiA8c3Bhbj4oYmV6YWhsdGVyIExpbmspPC9zcGFuPjwvYT48c21hbGwgY2xhc3M9ImV4dGhvcmlhLWFtYXpvbi1hZF9fZGlzY2xvc3VyZSI+w5xiZXIgdW5zZXJlIEFtYXpvbi1QYXJ0bmVybGlua3MgZXJoYWx0ZW4gd2lyIGJlaSBxdWFsaWZpemllcnRlbiBWZXJrw6R1ZmVuIGVpbmUgUHJvdmlzaW9uLjwvc21hbGw+PC9kaXY+Cg==Ein beachtlicher Versuch, noch kein Wachwechsel
Die Ergebnisse verdienen Aufmerksamkeit, aber keine Siegesfanfare. Q Labs trainierte GPT-artige Transformer auf Ausschnitten des FineWeb-Datensatzes. Die untersuchten Trainingsbudgets reichten von 100.000 bis 20 Millionen Token, die getesteten Populationen von 64 bis 16.384 Störungen pro Aktualisierung. In weiteren Versuchen variierten die Forscher die Modellgröße zwischen zwei Millionen und 243 Millionen Parametern.
Bei kleinen Trainingsbudgets erzielte Dust mit ausreichend großen Populationen teilweise niedrigere Verlustwerte als die jeweilige Vergleichslösung mit Backpropagation. Mit zehn und 20 Millionen Token verringerte sich der Abstand, je größer die Population wurde. Einige Ergebnisse fielen geringfügig besser aus, andere blieben hinter Backpropagation zurück. Besonders optimistische Werte für sehr große Populationen beruhen zum Teil auf Hochrechnungen und nicht auf vollständig ausgeführten Trainingsläufen.
Von den Dimensionen heutiger Spitzenmodelle ist Dust damit weit entfernt. Solche Modelle werden mit Billionen Token trainiert und können Hunderte Milliarden Parameter besitzen. Ob der Ansatz über viele Größenordnungen hinweg trägt, bleibt offen.
Noch schwerer wiegt der Rechenbedarf. Die Autoren schreiben selbst, Dust müsse um mehrere Größenordnungen effizienter werden, bevor es unter heutigen Bedingungen eine praktische Alternative darstelle. Zwar entfällt der Rückwärtslauf, doch erkauft sich Dust die Gradientenschätzung durch eine große Zahl von Störungen. Der Rückwärtsgang fällt weg; dafür fährt das Modell sehr oft vorwärts.
Auch der veröffentlichte Code verrät, wie experimentell der Ansatz noch ist. Die Minimalimplementierung umfasst ein Modell mit acht Schichten und einer Breite von 512 Einheiten. Für die im Bericht verwendete Population von 16.384 Störungen sind acht GPUs vorgesehen. Kleinere Versuche lassen sich auf einer einzelnen geeigneten Nvidia-GPU ausführen. Der Code steht unter der MIT-Lizenz und enthält neben Dust eine Referenzimplementierung mit Backpropagation. Recherchequelle: github.com
Die Suche nach anderen Lernwegen
Dust gehört zu einer breiteren Forschungsbewegung. Seit Jahren suchen Forscher nach Verfahren, die weniger Speicher benötigen, auf ungewöhnlicher Hardware laufen oder auch Komponenten trainieren können, durch die sich keine Ableitungen berechnen lassen.
KronZO etwa setzt auf strukturiertes Rauschen im Gewichtsraum. Beim Vortraining von GPT-2 Small benötigte es weniger Grafikspeicher als klassische Backpropagation, blieb beim am Ende erzielten Verlustwert jedoch dahinter. Sein Vorteil liegt vor allem darin, ein Training unter knappen Speicherbedingungen überhaupt zu ermöglichen. Recherchequelle: gerad.ca
EGGROLL macht Evolutionsstrategien durch niedrigdimensionale Störungen deutlich effizienter. Das bei der ICML 2026 vorgestellte Verfahren erreichte bei Modellen mit Milliarden Parametern eine Trainingsgeschwindigkeit, die sich laut den Autoren der reinen Stapelverarbeitung während der Inferenz annäherte. Zudem kann EGGROLL Modelle mit diskreten oder nicht differenzierbaren Bestandteilen optimieren. Dust nutzt es als Vergleichsverfahren, verlegt die Suche jedoch von den Gewichten in die Aktivierungen und erhält dadurch erheblich mehr Versuchspunkte pro Vorwärtslauf. Recherchequelle: proceedings.mlr.press
Geoffrey Hinton, einer der Autoren der klassischen Backpropagation-Arbeit, stellte 2022 mit dem Forward-Forward-Algorithmus eine weitere Alternative vor. Er ersetzt den Vorwärts- und Rückwärtslauf durch zwei Vorwärtsläufe: einen mit echten Daten und einen mit künstlich erzeugten Gegenbeispielen. Hinton bezeichnete die Methode ausdrücklich als vorläufig und räumte ein, dass sie bei den untersuchten Aufgaben langsamer war und schlechter verallgemeinerte. Ihr Reiz lag an anderer Stelle: Sie konnte lernen, ohne den gesamten Rechenweg für einen späteren Rückwärtslauf speichern zu müssen. Recherchequelle: arxiv.org
Wenn der Algorithmus die Architektur bestimmt
Der spannendste Gedanke hinter Dust gilt daher weniger der nächsten Modellgeneration als Modellen, die sich bislang kaum bauen lassen.
Backpropagation verlangt einen glatten, vollständig bekannten Rechenweg. Eine unbekannte Programmroutine, eine diskrete Entscheidung oder eine externe Softwarekomponente kann diesen Weg unterbrechen. Schwierig zu trainieren sind auch stark rekursive Netze, die ihre eigenen Zwischenergebnisse immer wieder verarbeiten. Entwickler können Architekturen deshalb nicht ausschließlich an den Anforderungen einer Aufgabe ausrichten. Sie müssen stets im Blick behalten, ob der Rückwärtslauf funktioniert.
Ein ausreichend leistungsfähiges Verfahren ohne Backpropagation könnte diesen Zwang lockern. Denkbar wären neuronale Netze, die in ihrem Inneren echte Programme, diskrete Schalter oder lange interne Schleifen nutzen. Nicht mehr jede Komponente müsste sich wie eine transparente mathematische Funktion verhalten; manche Teile könnten Blackboxen bleiben.
Vorerst ist das eine Möglichkeit, kein Ergebnis. Dust hat weder ein großes Sprachmodell trainiert noch eine solche neue Architektur demonstriert. Die Arbeit liefert einen methodischen Ansatz und Messwerte aus begrenzten Experimenten. Hinzu kommt, dass die veröffentlichten Befunde von den Entwicklern des Verfahrens selbst stammen. Unabhängige Reproduktionen und deutlich größere Trainingsläufe sind nötig, bevor sich beurteilen lässt, ob aus dem Experiment eine belastbare Alternative entsteht.
Dennoch lenkt Dust den Blick auf andere Formen des Lernens. Backpropagation bleibt die schnellere, erprobte und wirtschaftlich vernünftige Methode – aber offenbar nicht die einzig mögliche.
Manchmal kündigt sich technischer Wandel nicht durch ein fertiges Produkt an, sondern durch eine kleine Störung im System: durch Rauschen, das unerwartet in die richtige Richtung weist.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
Q Labs – Dust: Vortraining von Transformern ohne Backpropagation
Die Originalarbeit erklärt die gaußschen Aktivierungsstörungen und zeigt, wie einzelne Tokens als virtuelle Populationsmitglieder parallele Gradientenschätzungen ermöglichen.
https://qlabs-sh.translate.goog/research/dust/?_x_tr_sl=en&_x_tr_tl=de&_x_tr_hl=de
Q Labs – Dust: Anhang zu Benchmarks, Populationen und Tuning
Der technische Anhang liefert Verlustwerte für bis zu 20 Millionen Trainingstokens sowie detaillierte Tabellen zu Populationsgrößen, Rechenaufwand und Vergleichsverfahren.
https://qlabs-sh.translate.goog/research/dust/appendix.html?_x_tr_sl=en&_x_tr_tl=de&_x_tr_hl=de
alphaXiv – Evolutionsstrategien im Hyperscale-Bereich
Die Vertiefung erläutert gradientenfreie Blackbox-Optimierung und demonstriert das Training eines nichtlinearen rekurrenten Sprachmodells mit reinen Ganzzahloperationen.
https://www.alphaxiv.org/de/abs/2511.16652



