Der Fehler, der rückwärts lernt: Backpropagation, die Kettenregel und der Algorithmus hinter dem Deep Learning
🎧 Listen to this article
KI · 2026-09-15
Vollständig KI-generierter Artikel (ohne Vorabprüfung).
Der Aufhänger: Eine Milliarde Stellschrauben und niemand, der sie dreht
Stell dir eine Maschine mit einer Milliarde winziger Regler vor. Jeder Regler beeinflusst das Verhalten der Maschine ein kleines bisschen, und alle wirken auf verschlungene Weise zusammen. Die Maschine soll eine Aufgabe lernen – etwa, auf einem Foto eine Katze von einem Hund zu unterscheiden. Anfangs stehen alle Regler zufällig, und die Maschine rät blind. Du siehst nur das Endergebnis und weißt, wie falsch es ist. Deine Aufgabe: Finde heraus, wie du jeden einzelnen der Milliarde Regler ein wenig verstellen musst, damit der Fehler kleiner wird.
Das klingt hoffnungslos. Wollte man jeden Regler einzeln testen – ein bisschen drehen, schauen, ob es besser wird, zurückdrehen, den nächsten probieren –, bräuchte man für einen einzigen Lernschritt eine Milliarde Testläufe. Bei modernen Sprachmodellen mit hunderten Milliarden Parametern und Millionen von Lernschritten wäre das selbst mit allen Rechenzentren der Welt bis zum Wärmetod des Universums nicht zu schaffen.
Und doch lernen genau solche Maschinen – neuronale Netze – heute Sprache, Bilder und Spiele auf übermenschlichem Niveau. Der Grund ist ein einziger, überraschend eleganter Algorithmus, der das scheinbar Unmögliche schafft: Er berechnet die richtige Verstellrichtung für alle Milliarde Regler gleichzeitig, und zwar zu ungefähr denselben Kosten wie ein einziger Testlauf der Maschine. Dieser Algorithmus heißt Backpropagation (Fehlerrückführung), und man kann ohne Übertreibung sagen: Ohne ihn gäbe es kein Deep Learning, keine Sprachmodelle, keine Bildgeneratoren. Er ist nicht das Gehirn der KI, aber ihr Stoffwechsel – der stille Prozess, durch den aus zufälligen Zahlen Wissen wird.
Dieser Artikel erzählt, wie Backpropagation funktioniert, warum es so unverschämt effizient ist, wer es (mehrfach und unabhängig) erfunden hat, woran es beinahe gescheitert wäre und warum es bis heute umstritten ist, ob das Gehirn etwas Ähnliches tut.
Teil 1: Das Grundproblem – die Schuldzuweisung
Lernen als Optimierung
Ein neuronales Netz ist im Kern eine sehr große mathematische Funktion. Sie nimmt eine Eingabe (die Pixel eines Bildes, die Token eines Satzes) und erzeugt eine Ausgabe (eine Klassifikation, das nächste Wort). Zwischen Eingabe und Ausgabe liegen viele Parameter – die „Regler" aus dem Aufhänger, technisch die Gewichte und Verzerrungen (biases) der einzelnen Neuronen. Lernen bedeutet: diese Parameter so einzustellen, dass die Funktion auf möglichst vielen Beispielen das Richtige tut.
Um „richtig" messbar zu machen, definiert man eine Verlustfunktion (loss function). Sie ist eine einzige Zahl, die angibt, wie weit die aktuelle Ausgabe des Netzes vom gewünschten Ergebnis entfernt ist – null wäre perfekt, große Werte bedeuten großen Fehler. Das Training wird damit zu einem Optimierungsproblem: Finde die Parameterwerte, die den Verlust minimieren. Man kann sich den Verlust als eine gigantische, hügelige Landschaft vorstellen, aufgespannt über den Millionen oder Milliarden Parameterdimensionen. Jeder Punkt in dieser Landschaft ist eine bestimmte Einstellung aller Regler, die Höhe an diesem Punkt ist der Fehler. Gesucht ist ein möglichst tiefes Tal.
Warum die Schuld so schwer zuzuweisen ist
Das Kernproblem hat einen Namen, der aus der Geschichte der KI stammt: das Credit-Assignment-Problem, das Problem der Schuld- oder Verdienstzuweisung. Wenn das Netz am Ende einen Fehler macht, welche der vielen internen Gewichte tragen dazu bei – und wie stark? Ein Neuron tief in der Mitte des Netzes beeinflusst die Ausgabe nur über viele Zwischenschichten hinweg. Seine „Schuld" am Endfehler ist durch ein dichtes Geflecht von Abhängigkeiten hindurch verschmiert. Genau diese verschachtelte Verantwortung macht die naive Lösung – jeden Parameter einzeln durchprobieren – so aussichtslos teuer.
Die entscheidende Einsicht der Optimierung lautet: Wir müssen nicht raten, in welche Richtung ein Parameter verstellt werden soll. Wenn die Verlustlandschaft glatt (differenzierbar) ist, verrät uns die Ableitung an der aktuellen Stelle exakt, wie sich der Verlust ändert, wenn wir einen Parameter ein winziges bisschen erhöhen. Die Sammlung all dieser partiellen Ableitungen – für jeden Parameter eine – heißt Gradient. Der Gradient ist ein Vektor, der in die Richtung des steilsten Anstiegs des Verlusts zeigt. Wollen wir den Verlust senken, gehen wir einen kleinen Schritt in die Gegenrichtung. Das ist der Gradientenabstieg (gradient descent), und er ist das Herzstück des Trainings: Berechne den Gradienten, mache einen kleinen Schritt bergab, wiederhole.
Der Gradientenabstieg ist der einfache Teil. Die eigentliche Frage ist: Wie berechnet man den Gradienten einer Funktion mit einer Milliarde Eingängen, ohne eine Milliarde mal zu rechnen? Genau hier setzt Backpropagation an.
Teil 2: Die Kettenregel – das mathematische Fundament
Verschachtelte Funktionen
Ein neuronales Netz ist eine Komposition von Funktionen: Die Ausgabe der ersten Schicht wird zur Eingabe der zweiten, deren Ausgabe zur Eingabe der dritten, und so weiter bis zum Verlust ganz am Ende. Schematisch: Der Verlust L hängt von der letzten Schicht ab, die von der vorletzten, die von der davor – eine tief geschachtelte Kette.
Für die Ableitung solcher verschachtelter Funktionen kennt die Analysis seit Leibniz ein einfaches, mächtiges Werkzeug: die Kettenregel. Sie besagt, dass sich die Ableitung einer zusammengesetzten Funktion als Produkt der Ableitungen ihrer Bestandteile ergibt. Wenn y von u abhängt und u von x, dann ist die Änderungsrate von y nach x das Produkt der beiden lokalen Änderungsraten: „wie stark y auf u reagiert" mal „wie stark u auf x reagiert". Anschaulich pflanzt sich eine kleine Störung am Eingang durch die Kette fort, und jede Stufe multipliziert sie mit ihrem lokalen Verstärkungsfaktor.
Backpropagation ist im Kern nichts anderes als die systematische, organisierte Anwendung der Kettenregel auf den Rechengraphen eines neuronalen Netzes. Das ist die vielleicht wichtigste Entzauberung dieses Artikels: Hinter dem geheimnisvoll klingenden Namen steckt keine exotische Mathematik, sondern eine Buchhaltungstechnik für die Kettenregel, die jede Zwischenableitung genau einmal berechnet und clever wiederverwendet.
Der Rechengraph
Um diese Buchhaltung sauber zu führen, stellt man die Berechnung als Rechengraphen dar: einen gerichteten Graphen, in dem jeder Knoten eine elementare Operation ist (eine Addition, eine Multiplikation, eine Aktivierungsfunktion) und die Kanten den Fluss der Zahlen anzeigen. Ganz links stehen die Eingaben und Parameter, ganz rechts steht der eine skalare Verlust. Jede noch so komplexe neuronale Architektur – ein Transformer, ein Faltungsnetz – lässt sich in einen solchen Graphen aus elementaren, jeweils leicht ableitbaren Bausteinen zerlegen.
Der Rechengraph ist die zentrale Datenstruktur. Auf ihm laufen zwei Durchgänge ab, und ihr Zusammenspiel ist der ganze Algorithmus.
Teil 3: Wie Backpropagation rechnet – Vorwärts- und Rückwärtspass
Der Vorwärtspass
Zuerst der Vorwärtspass (forward pass): Man schiebt eine Eingabe in den Graphen und rechnet Knoten für Knoten von links nach rechts, bis am Ende der Verlust herauskommt. Das ist einfach die normale Auswertung des Netzes – das, was auch bei der späteren Nutzung passiert. Entscheidend ist aber: Während des Vorwärtspasses merkt man sich die Zwischenergebnisse an jedem Knoten (die sogenannten Aktivierungen). Diese werden gleich gebraucht.
Der Rückwärtspass
Dann der Rückwärtspass (backward pass), das eigentliche „Backprop". Er beginnt ganz rechts, beim Verlust, und wandert nach links zurück. Am Ausgang ist die Sache trivial: Die Ableitung des Verlusts nach sich selbst ist eins. Von dort aus wird an jedem Knoten die Kettenregel angewandt: Der Knoten empfängt von seinem rechten Nachbarn eine Zahl – wie stark der Verlust auf die Ausgabe dieses Knotens reagiert – und multipliziert sie mit seiner eigenen lokalen Ableitung (die er dank der gemerkten Aktivierungen sofort ausrechnen kann). Das Ergebnis reicht er an seine linken Nachbarn weiter. So fließt das Fehlersignal Schicht für Schicht zurück, und jeder Parameter erfährt unterwegs, wie sehr er zum Endfehler beigetragen hat – seine partielle Ableitung, seinen Anteil am Gradienten.
Man kann es sich wie eine Verantwortungskaskade in einer Organisation vorstellen: Ganz oben steht das Gesamtergebnis fest („der Fehler beträgt so viel"). Jede Führungsebene bekommt ihren Anteil an der Verantwortung zugeteilt und verteilt ihn nach unten weiter, gewichtet danach, wie stark jeder Untergebene das eigene Ergebnis beeinflusst hat. Am Ende weiß jeder einzelne Mitarbeiter – jedes einzelne Gewicht –, wie viel er beitragen muss, um es beim nächsten Mal besser zu machen.
Der eine Trainingsschritt
Ein vollständiger Trainingsschritt besteht damit aus vier Teilen: erstens Vorwärtspass (Ausgabe und Verlust berechnen), zweitens Rückwärtspass (Gradienten für alle Parameter berechnen), drittens ein kleiner Schritt bergab (jeden Parameter um seinen negativen Gradienten mal einer Lernrate verschieben), viertens: von vorn, mit dem nächsten Datenbatch. In der Praxis rechnet man nicht den Gradienten über den gesamten Datensatz, sondern über kleine Stichproben (Mini-Batches) – das ist der stochastische Gradientenabstieg (SGD), oft verfeinert durch Optimierer wie Momentum oder Adam, die aus der Geschichte der bisherigen Gradienten schlauere Schrittweiten ableiten. Der Kern aber bleibt: Backpropagation liefert den Gradienten, der Optimierer nutzt ihn.
Teil 4: Warum rückwärts? Die eigentliche Effizienz-Magie
Vorwärts- versus Rückwärtsmodus
Hier liegt der Punkt, der Backpropagation von einer bloßen Buchhaltungstechnik zu einem der folgenreichsten Algorithmen des Jahrhunderts macht. Die Kettenregel könnte man nämlich auch in die andere Richtung anwenden – von den Eingängen nach vorn zum Ausgang. Diese beiden Wege heißen in der Theorie der automatischen Differentiation (AD) der Vorwärtsmodus (forward mode) und der Rückwärtsmodus (reverse mode). Backpropagation ist exakt der Rückwärtsmodus, angewandt auf neuronale Netze.
Der Unterschied ist keine Geschmacksfrage, sondern entscheidet über die Rechenkosten – und zwar dramatisch, sobald die Zahl der Eingänge und Ausgänge stark verschieden ist. Und genau das ist beim Training der Fall: Wir haben eine Milliarde Eingänge (die Parameter), aber nur einen einzigen Ausgang (den skalaren Verlust).
- Der Vorwärtsmodus berechnet in einem Durchgang, wie alle Ausgänge auf einen Eingang reagieren. Bei einer Milliarde Parametern bräuchte man also eine Milliarde Vorwärtsdurchläufe, um den vollen Gradienten zu bekommen – genauso teuer wie die naive Reglermethode aus dem Aufhänger.
- Der Rückwärtsmodus berechnet in einem Durchgang, wie ein Ausgang auf alle Eingänge reagiert. Genau das brauchen wir: die Empfindlichkeit des einen Verlusts gegenüber allen Milliarde Parametern – in einem einzigen Rückwärtspass.
Das Prinzip vom billigen Gradienten
Die Kosten eines Rückwärtspasses liegen in derselben Größenordnung wie die eines Vorwärtspasses – grob gesagt ein kleines konstantes Vielfaches (oft nennt man Faktoren zwischen zwei und fünf, je nach Architektur). Dieses bemerkenswerte Ergebnis ist als Baur-Strassen-Theorem oder als „cheap gradient principle" bekannt: Der Gradient einer skalaren Funktion nach beliebig vielen Eingängen kostet nur konstant mehr als die Funktion selbst – unabhängig davon, ob es zehn oder zehn Milliarden Eingänge sind.
Das ist die eigentliche Sensation. Wir bekommen die Verstellrichtung für eine Milliarde Regler nicht für eine Milliarde Testläufe, sondern für den Preis von etwa zwei bis fünf. Der Haken, den man ehrlich benennen muss: Der Rückwärtsmodus muss sich die Zwischenergebnisse des Vorwärtspasses merken, um die lokalen Ableitungen bilden zu können. Er tauscht also Speicher gegen Rechenzeit. Genau dieser Speicherhunger für die Aktivierungen ist einer der Gründe, warum das Training großer Netze so gewaltige Mengen an GPU-Speicher verschlingt – und warum Techniken wie „gradient checkpointing" (bewusstes Verwerfen und Neuberechnen von Aktivierungen) erfunden wurden, um ihn zu zähmen.
Ich bin der Meinung, dass gerade diese Asymmetrie – viele Eingänge, ein Ausgang – der am häufigsten übersehene Grund für den Erfolg des Deep Learning ist. Nicht die Netze allein sind der Durchbruch, sondern der glückliche Umstand, dass ihre Trainingsaufgabe exakt die Form hat, für die der Rückwärtsmodus optimal ist.
Teil 5: Die Geschichte – mehrfach erfunden, lange übersehen
Die Geschichte der Backpropagation ist ein Lehrstück darüber, wie Ideen unabhängig, verstreut und oft zu früh entstehen – und erst dann zünden, wenn Rechenkraft und Kontext stimmen.
Wurzeln in der Regelungstechnik
Die Grundidee – Gradienten durch verkettete Systeme rückwärts zu propagieren – tauchte zuerst nicht in der KI auf, sondern in der Regelungs- und Steuerungstheorie. Henry J. Kelley (1960) und Arthur E. Bryson (Anfang der 1960er) leiteten im Kontext der optimalen Steuerung von Flugbahnen Verfahren her, die im Kern der Rückwärtsanwendung der Kettenregel entsprechen. Auch Stuart Dreyfus formulierte 1962 eine Herleitung mit der Kettenregel. Diese Arbeiten kannten weder „neuronale Netze" noch den Begriff Backpropagation, enthielten aber die mathematische Substanz.
Linnainmaa 1970: der Rückwärtsmodus wird geboren
Als eigenständiges, allgemeines Verfahren wurde der Rückwärtsmodus der automatischen Differentiation 1970 vom finnischen Mathematiker Seppo Linnainmaa in seiner Masterarbeit beschrieben – zunächst ganz ohne Bezug zu neuronalen Netzen. Sein Ziel war ein anderes: Er wollte den akkumulierten Rundungsfehler einer aus vielen elementaren Operationen zusammengesetzten Rechnung effizient abschätzen. Dafür entwickelte er die Methode, die Ableitungen eines aus einem Graphen darstellbaren, differenzierbaren Ausdrucks durch rekursive Rückwärtsanwendung der Kettenregel zu berechnen. Das ist, in moderner Sprache, exakt der Algorithmus hinter jedem heutigen Deep-Learning-Framework. Jürgen Schmidhuber, der die Geschichtsschreibung des Feldes akribisch betreibt, nennt Linnainmaa daher den Urheber der Backpropagation im technischen Sinn.
Werbos 1974: die Brücke zu neuronalen Netzen
Den Bogen zu lernenden Netzen schlug 1974 Paul Werbos in seiner Doktorarbeit an der Harvard University. Er erkannte, dass sich das Verfahren nutzen ließ, um die Gewichte mehrschichtiger Netze aus Fehlern zu lernen. Doch die Zeit war ungünstig: Der erste KI-Winter hatte das Feld nach der ernüchternden Kritik an einfachen Perzeptronen (Minsky & Papert, 1969) in Verruf gebracht. Werbos veröffentlichte die Anwendung auf Netze erst Jahre später breiter (unter anderem 1982). Die Idee lag da, aber sie fand kaum Widerhall.
Rumelhart, Hinton & Williams 1986: der Durchbruch in die Sichtbarkeit
Zur allgemein bekannten Methode wurde Backpropagation erst durch eine Arbeit, die 1986 in Nature erschien: David Rumelhart, Geoffrey Hinton und Ronald Williams, „Learning representations by back-propagating errors" (Nature 323, S. 533–536). Ihr Verdienst war weniger die Erstentdeckung – ähnliche Herleitungen hatten etwa David Parker und Yann LeCun um 1985 unabhängig gefunden – als der überzeugende Nachweis, dass ein mit Backpropagation trainiertes mehrschichtiges Netz in seinen verborgenen Schichten nützliche interne Repräsentationen der Aufgabe entwickelt. Damit war der alte Einwand entkräftet, dass mehrschichtige Netze zwar mächtig, aber nicht trainierbar seien. Der Aufsatz gilt als eine der Geburtsurkunden des modernen Konnektionismus.
Es folgte gleichwohl ein zweiter, langer Winter: In den 1990ern und 2000ern galten tiefe Netze als kaum trainierbar. Erst das Zusammentreffen von großen Datenmengen, leistungsfähigen GPUs und einigen technischen Kniffen (siehe Teil 6) verhalf Backpropagation ab etwa 2012 zum endgültigen Durchbruch. Dass Geoffrey Hinton 2018 den Turing Award (mit Yann LeCun und Yoshua Bengio) und 2024 sogar den Physik-Nobelpreis erhielt, spiegelt, wie zentral diese Linie für die heutige KI geworden ist.
| Jahr | Person(en) | Beitrag |
|---|---|---|
| ~1960–62 | Kelley, Bryson, Dreyfus | Rückwärts-Gradienten in der optimalen Steuerung |
| 1970 | Linnainmaa | Rückwärtsmodus der AD (allgemein, für Rundungsfehler) |
| 1974/1982 | Werbos | Anwendung auf mehrschichtige neuronale Netze |
| ~1985 | Parker, LeCun | unabhängige Wiederentdeckungen |
| 1986 | Rumelhart, Hinton, Williams | Nature-Aufsatz, Nachweis gelernter Repräsentationen, Popularisierung |
Teil 6: Wenn das Signal verhungert – verschwindende und explodierende Gradienten
Das Problem
Backpropagation ist mathematisch korrekt, aber diese Korrektheit garantiert kein erfolgreiches Training. In den frühen 1990ern stieß man auf ein tückisches Hindernis, das jahrelang die Grenze der erreichbaren Netztiefe setzte. Erinnern wir uns: Im Rückwärtspass wird das Fehlersignal an jeder Schicht mit einer lokalen Ableitung multipliziert. Über viele Schichten hinweg ist der Gradient also ein Produkt vieler Faktoren. Sind diese Faktoren im Schnitt kleiner als eins, schrumpft das Produkt exponentiell und das Signal ist nach wenigen Schichten praktisch null – der verschwindende Gradient (vanishing gradient). Sind sie größer als eins, explodiert es – der explodierende Gradient. Im ersten Fall lernen die frühen Schichten kaum noch etwas, im zweiten wird das Training instabil.
Formal analysiert und benannt wurde dieses Problem 1991 von Sepp Hochreiter in seiner Diplomarbeit, kurz darauf vertieft von Yoshua Bengio und Kollegen (1994). Es war lange der Grund, warum „tiefe" Netze in der Praxis flach blieben. Besonders bitter traf es rekurrente Netze, die Sequenzen verarbeiten: Dort entspricht jeder Zeitschritt einer weiteren Multiplikation, sodass sich das Netz nur an sehr Kurzfristiges „erinnern" konnte.
Die Lösungen
Die Geschichte des Deep Learning der letzten zwanzig Jahre ist zu einem guten Teil die Geschichte der Werkzeuge gegen dieses eine Problem:
- Bessere Aktivierungsfunktionen. Die klassischen sigmoiden Funktionen (tanh, logistische Funktion) haben Ableitungen, die für große Eingaben gegen null gehen – ein Verstärker des Problems. Die ReLU (Rectified Linear Unit, verbreitet ab 2010/2011 durch Nair, Hinton, Glorot u. a.) hat für positive Eingaben eine Ableitung von exakt eins und dämpft das Signal daher nicht. Sie wurde zu einer der wichtigsten Einzelursachen dafür, dass tiefe Netze plötzlich trainierbar wurden.
- Durchdachte Initialisierung. Setzt man die Anfangsgewichte so, dass die Varianz der Signale von Schicht zu Schicht ungefähr erhalten bleibt (Xavier/Glorot-Initialisierung 2010, He-Initialisierung 2015 für ReLU), startet das Netz nahe dem Gleichgewicht zwischen Schrumpfen und Explodieren.
- Residualverbindungen. Die ResNets (He et al., 2015) fügen „Abkürzungen" ein, die den Gradienten unverfälscht an tiefen Stellen vorbei nach hinten durchreichen. Erst dadurch wurden Netze mit hunderten Schichten praktikabel – ein direkter Vorläufer der Tiefe heutiger Modelle.
- Torgesteuerte Speicher. Für Sequenzen erfanden Hochreiter und Schmidhuber 1997 das LSTM (Long Short-Term Memory), dessen „Zellzustand" das Signal durch gesteuerte Tore nahezu ungehindert über viele Zeitschritte trägt und so den verschwindenden Gradienten in der Zeit umgeht.
- Normierung. Verfahren wie Batch Normalization (Ioffe & Szegedy, 2015) und Layer Normalization halten die Statistik der Zwischenwerte stabil und glätten die Verlustlandschaft, was das Training tiefer Netze robuster macht.
- Gradient Clipping. Gegen die explodierende Variante hilft simples Kappen: Überschreitet der Gradient eine Schwelle, wird er auf sie zurückskaliert.
Erst dieses Bündel an Techniken – zusammen mit GPUs und großen Datensätzen – verwandelte Backpropagation von einem hübschen Prinzip in den Motor einer technologischen Revolution.
Teil 7: Backpropagation heute – die unsichtbare Infrastruktur
Automatische Differentiation in jedem Framework
Kaum ein Praktiker programmiert Backpropagation heute noch von Hand. Moderne Frameworks wie PyTorch, JAX oder TensorFlow bauen den Rechengraphen automatisch auf – bei PyTorch dynamisch während der Ausführung, bei JAX durch Nachverfolgung und Transformation der Funktionen – und leiten den Rückwärtspass daraus selbstständig ab. Man schreibt nur noch den Vorwärtspass (die eigentliche Berechnung), ruft eine Funktion wie backward() oder grad() auf, und das System liefert den Gradienten. Diese automatische Differentiation ist die vielleicht unterschätzteste Zutat des KI-Booms: Sie hat das Experimentieren mit neuen Architekturen von einer fehleranfälligen Handrechnung zu einer Sache weniger Zeilen Code gemacht.
Wichtig ist die begriffliche Einordnung: Automatische Differentiation ist weder numerische Differentiation (Approximation der Ableitung durch winzige Differenzenquotienten – ungenau und teuer) noch symbolische Differentiation (das Umformen von Formeln wie im Mathematikunterricht – explodiert bei großen Ausdrücken). AD berechnet den Gradienten exakt (bis auf Maschinengenauigkeit) und effizient, indem sie den Rechengraphen der konkreten Berechnung ausnutzt. Backpropagation ist schlicht der Name, den der Rückwärtsmodus der AD in der Welt der neuronalen Netze trägt.
Derselbe Algorithmus überall
Ob ein Transformer für Sprache, ein Diffusionsmodell für Bilder oder ein Netz, das ein Spiel lernt: Unter der Haube berechnen sie alle den Gradienten ihres Verlusts per Backpropagation und steigen damit die Verlustlandschaft hinab. Die Architekturen ändern sich rasant, die Aufgaben auch – aber der Lernmechanismus im Maschinenraum ist seit 1986 im Kern derselbe geblieben. Das ist eine seltene Konstanz in einem sonst so schnelllebigen Feld.
Die offene Flanke: Lernt das Gehirn so?
Backpropagation ist der erfolgreichste Lernalgorithmus der Technikgeschichte – aber ist er auch biologisch plausibel? Hier gibt es ernste Zweifel. Der schwerwiegendste heißt weight-transport-Problem: Der Rückwärtspass müsste exakt dieselben Gewichte verwenden wie der Vorwärtspass, nur in umgekehrter Richtung. Echte Synapsen aber sind einseitige Bauteile; ein Neuron „kennt" die Gewichte seiner nachgeschalteten Verbindungen nicht. Auch bräuchte das Gehirn einen präzise getrennten, global koordinierten Rückwärtspfad, für den es keinen klaren anatomischen Beleg gibt.
Die Forschung sucht daher nach biologisch plausibleren Näherungen. Der „feedback alignment"-Befund (Lillicrap et al., 2016) zeigte überraschend, dass sogar zufällige Rückkopplungsgewichte ein brauchbares Lernsignal liefern können – das exakte Rückwärts-Gewicht ist also nicht zwingend nötig. Andere Ansätze deuten Backpropagation als Grenzfall von Predictive-Coding-Modellen, in denen lokale Vorhersagefehler zwischen benachbarten Schichten das Lernen treiben – eine Brücke zur Theorie des vorhersagenden Gehirns. Ich bin der Meinung, dass die ehrlichste Position derzeit lautet: Backpropagation ist mit hoher Sicherheit nicht der Mechanismus des Gehirns im Detail, aber das Gehirn könnte etwas implementieren, das seine Wirkung annähert. Ob das Lernen im Kortex und das Lernen in einem GPU-Cluster am Ende demselben mathematischen Prinzip folgen, ist eine der spannendsten offenen Fragen an der Grenze von Neurowissenschaft und KI.
Erkenntnis zum Mitnehmen
Backpropagation ist der beste Beleg für eine unscheinbare Wahrheit: Manchmal ist der folgenreichste Fortschritt nicht eine neue Idee, sondern die effiziente Organisation einer alten. Die Kettenregel ist Schulmathematik; der Gradientenabstieg ist ein simpler Bergabstieg. Die ganze Kunst liegt darin, die Kettenregel rückwärts durch den Rechengraphen zu führen – und damit die Empfindlichkeit eines einzelnen Fehlermaßes gegenüber Milliarden Parametern zum Preis einer knappen Handvoll Auswertungen zu bekommen. Diese Asymmetrie zwischen vielen Eingängen und einem Ausgang ist der eigentliche Hebel des Deep Learning.
Für die eigene Praxis lohnt sich zweierlei. Erstens: Wenn du ein System debuggst, in dem „nichts lernt", denke zuerst an die Gradienten – verschwinden sie (dann helfen ReLU, bessere Initialisierung, Residualverbindungen, Normierung) oder explodieren sie (dann hilft Clipping)? Das Problem sitzt fast nie im Optimierer, sondern im Signalfluss durch den Graphen. Zweitens, allgemeiner: Frage bei jedem teuren Ableitungs- oder Sensitivitätsproblem, ob du es als Rückwärtsmodus formulieren kannst – überall dort, wo eine skalare Zielgröße von sehr vielen Parametern abhängt (Optimierung, Kalibrierung, Sensitivitätsanalyse), ist derselbe Trick anwendbar, nicht nur im maschinellen Lernen.
Eine Frage zum Nachdenken
Wenn ein einziger, seit 1970 bekannter Algorithmus – die rückwärts angewandte Kettenregel – ausreicht, um Maschinen Sprache und Bilder beizubringen, was sagt das über die Rolle von „Intelligenz" in diesen Systemen? Steckt das Bemerkenswerte im Lernmechanismus (der verblüffend einfach ist) oder in der schieren Menge an Daten und Parametern, auf die er losgelassen wird? Und falls das Gehirn nicht per Backpropagation lernt: Wäre ein biologisch plausiblerer Algorithmus dann bloß eine wissenschaftliche Fußnote – oder der Schlüssel zu einer effizienteren, datensparsameren KI?
Querverweise im Vault
- Aufmerksamkeit ist alles: Der Transformer, Self-Attention und die Architektur moderner KI – die Architektur, die per Backpropagation trainiert wird.
- Der Geist in der Maschine: Wie man ein neuronales Netz von innen liest – was in den Gewichten steckt, die Backpropagation einstellt.
- Wie groß ist groß genug? Skalierungsgesetze, Chinchilla und die Vermessung der KI – wie viele Parameter und Daten der Gradientenabstieg verkraftet.
- Versuch und Irrtum in Vollendung: Reinforcement Learning von TD-Gammon über AlphaGo zu AlphaZero – ein anderes Lernparadigma, das dennoch auf Backpropagation als Bausteinen ruht.
- Lob und Tadel für die Maschine: RLHF und die Kunst, der KI beizubringen, was wir wollen – wie das Gradientensignal aus menschlichem Feedback entsteht.
- Vom Rauschen zum Bild: Diffusionsmodelle und die Physik der generativen KI – ein Generatortyp, ebenfalls per Backpropagation trainiert.
- Das vorhersagende Gehirn: Predictive Processing und die Illusion der Wahrnehmung – die neurowissenschaftliche Brücke zur Frage der biologischen Plausibilität.
- Das chinesische Zimmer: Searle und die Frage, ob Maschinen verstehen können – ob das durch Backpropagation Gelernte „Verstehen" ist.
Quellen
- Rumelhart, Hinton, Williams: Learning representations by back-propagating errors, Nature 323, S. 533–536 (1986): https://www.nature.com/articles/323533a0
- Schmidhuber: Who Invented Backpropagation? (Historische Aufarbeitung mit Verweisen auf Kelley, Bryson, Linnainmaa, Werbos): https://people.idsia.ch/~juergen/who-invented-backpropagation.html
- Seppo Linnainmaa (Wikipedia) – Masterarbeit 1970, Rückwärtsmodus der automatischen Differentiation: https://en.wikipedia.org/wiki/Seppo_Linnainmaa
- Paul Werbos (Wikipedia) – Dissertation 1974, Anwendung auf neuronale Netze: https://en.wikipedia.org/wiki/Paul_Werbos
- Baydin, Pearlmutter, Radul, Siskind: Automatic differentiation in machine learning: a survey, JMLR (2018): https://arxiv.org/pdf/1502.05767
- Schmidhuber: Deep Learning in Neural Networks: An Overview (2015) – zur Geschichte und zum Problem verschwindender Gradienten (Hochreiter 1991, Bengio 1994): https://arxiv.org/pdf/1404.7828
- Lillicrap et al.: Random synaptic feedback weights support error backpropagation for deep learning, Nature Communications 7 (2016) – zur biologischen Plausibilität (feedback alignment): https://www.nature.com/articles/ncomms13276