Der Ball fällt. Zunächst langsam, dann immer schneller – genauso, wie es sein soll. Die Bewegung wirkt weich, die Beleuchtung stimmt, selbst der Schatten gleitet über den Boden. Trotzdem ist etwas nicht ganz richtig. Vielleicht nimmt die Geschwindigkeit im falschen Maß zu. Vielleicht verliert der Ball zwischen zwei Bildern Energie, ohne sie an seine Umgebung abzugeben. Für das Auge bleibt der Fehler beinahe unsichtbar. Newton hätte ihn sofort bemerkt.
Solchen Abweichungen geht Morpheus nach, ein neuer Benchmark für generative Videomodelle. Die maßgebliche Fassung der Studie wurde am 29. Juni 2026 veröffentlicht und für die International Conference on Machine Learning 2026 angenommen. Im Zentrum steht eine Frage, die angesichts immer eindrucksvollerer KI-Videos leicht aus dem Blick gerät: Bildet eine Video-KI tatsächlich physikalische Vorgänge ab – oder erzeugt sie lediglich Bilderfolgen, die danach aussehen?
Die Forscher der Universitäten Amsterdam und Trient prüften unter anderem Veo 3, Kling, Wan 2.1, Nvidia Cosmos, CogVideoX, PyramidalFlow und LTX-Video. Das Ergebnis ist deutlich: Moderne Modelle produzieren ästhetisch überzeugende Videos, halten sich dabei aber nicht zuverlässig an die zugrunde liegende newtonsche Mechanik. Recherchequelle: arxiv.org
Der Unterschied zwischen Bewegung und Physik
Generierte Videos wurden lange vor allem danach beurteilt, ob sie scharf aussehen, einem Prompt folgen und ihre Figuren über mehrere Sekunden hinweg wiedererkennbar halten. Das leuchtet ein. Ein deformiertes Gesicht oder eine Hand mit wandernden Fingern springt sofort ins Auge. Fehler bei Beschleunigung, Impuls oder Energieerhaltung sind unauffälliger. Sie verbergen sich im Fluss der Bilder.
Plausibel ist eben nicht dasselbe wie physikalisch richtig. Ein geworfener Gegenstand kann eine elegante Kurve beschreiben und dennoch gegen die Bewegungsgleichungen verstoßen. Dasselbe gilt für ein Pendel, das sanft schwingt, während seine Länge zwischen den Bildern schwankt oder seine Energie auf unerklärliche Weise zunimmt.
Deshalb vergleicht Morpheus ein KI-Video nicht einfach mit einer einzigen vorab aufgenommenen Musterbewegung. Zwei echte Würfe desselben Balls können unterschiedlich verlaufen, weil Anfangsgeschwindigkeit, Winkel, Luftwiderstand und andere Bedingungen nie vollkommen identisch sind. Stattdessen prüfen die Forscher, ob die gezeigte Bewegung unter den Bedingungen des jeweiligen Experiments grundsätzlich mit den physikalischen Gesetzen vereinbar ist.
Dafür filmten sie rund 130 reale Versuche: Bälle fielen und prallten auf, Gegenstände rollten oder rutschten, Federn schwangen, Pendel bewegten sich, Körper kollidierten. Die Aufnahmen lieferten Ausgangssituationen, die den Videomodellen als einzelne Bilder oder kurze Bildsequenzen vorgelegt wurden. Von diesem Punkt an mussten die Systeme übernehmen und den weiteren Verlauf erzeugen. Recherchequelle: physics-from-video.github.io
Wenn der Gegenstand plötzlich aufgibt
Noch bevor Morpheus Energie oder Impuls berechnet, stellt der Benchmark eine überraschend einfache Frage: Ist der Gegenstand während des gesamten Videos überhaupt noch da?
Nicht immer. Manche Modelle lassen einen Ball verschwinden, andere verdoppeln ein Objekt oder verändern unbemerkt dessen Form. Wieder andere finden für eine schwierige Bewegung eine besonders sichere Lösung: Sie zeigen gar keine. Ein Buch, das eine Schräge hinabrutschen soll, bleibt einfach liegen; ein Pendel verharrt in der Luft, als hätte die Zeit kurz angehalten.
Bei PyramidalFlow und LTX-Video mussten in bestimmten Versuchsanordnungen mehr als 45 Prozent der erzeugten Videos verworfen werden. Häufig fehlte jede Bewegung, verschwanden Objekte oder tauchten plötzlich Kopien auf. Veo 3 und Kling zeigten zwar öfter sichtbare Dynamik, verloren dafür gelegentlich die sogenannte Objektpermanenz – also die Fähigkeit, einen Gegenstand über die gesamte Sequenz hinweg als ein und dasselbe Objekt zu behandeln.
Nur die danach noch verwertbaren Videos wurden genauer vermessen. Morpheus verfolgt dazu die Position der Gegenstände von Bild zu Bild, leitet daraus Geschwindigkeiten und Beschleunigungen ab und gleicht den Verlauf mit den passenden Bewegungsgleichungen ab. Zusätzlich prüft das Verfahren Größen, die innerhalb eines idealisierten Systems konstant bleiben sollten, etwa Energie, Impuls, Pendellänge und Schwingungsdauer.
Der Abstand zu realen Aufnahmen ist beträchtlich. Diese erreichten in der Dynamikbewertung Werte zwischen 0,96 und 0,99; bei der Erhaltung physikalischer Größen lagen sie bei mindestens 0,90. Das beste generative Verfahren kam auf einen kombinierten Wert von 0,66. Allerdings waren ihm sowohl das erste als auch das letzte Bild der Bewegung vorgegeben. Die Aufgabe bestand also eher darin, einen plausiblen Weg zwischen zwei feststehenden Punkten zu finden. Recherchequelle: arxiv.org
Mehr Bilder ersetzen kein Weltverständnis
Dieser Unterschied hat Gewicht. Wer nur ein Foto eines Balls sieht, kann dessen Geschwindigkeit nicht erkennen. Der Ball könnte stillstehen, nach oben fliegen oder bereits fallen. Erst mehrere aufeinanderfolgende Bilder verraten Richtung und Tempo. Ist dem Modell zusätzlich das Endbild bekannt, schrumpft die Zahl möglicher Abläufe weiter.
Der zeitliche Kontext verbessert entsprechend die Ergebnisse. Bei Morpheus stieg der beste aggregierte Wert mit mehreren Ausgangsbildern von 0,50 auf 0,59. Waren Anfangs- und Endbild vorgegeben, erreichte er 0,66. Das ist ein Fortschritt, aber noch kein Beweis für ein inneres Physikmodell. Ein System kann überzeugend interpolieren, ohne selbstständig vorherzusagen, was aus einer Ausgangslage ohne vorgegebenes Ende folgen müsste.
Hier verläuft die entscheidende Grenze zwischen Videogenerator und Weltsimulator. OpenAI bezeichnete Videogeneratoren bereits 2024 als möglichen Weg zu allgemeinen Simulatoren der physischen Welt, räumte jedoch zugleich Fehler bei einfachen Wechselwirkungen wie zerbrechendem Glas ein. Auch später hielt OpenAI an dem Versprechen fest, aus Videodaten Systeme zu entwickeln, die Realität nicht nur darstellen, sondern simulieren. Recherchequelle: openai.com
Morpheus trennt schärfer zwischen diesen beiden Fähigkeiten. Ein Generator kann gelernt haben, wie ein Aufprall gewöhnlich aussieht: die Bewegungsrichtung, den Schatten, ein kurzes Zittern der Kamera. Das bedeutet jedoch nicht zwangsläufig, dass er die Beziehungen zwischen Masse, Kraft und Impuls erfasst. Möglicherweise setzt er lediglich visuelle Muster fort, die in ähnlicher Form in seinen Trainingsdaten vorkamen. Das Bild stimmt, doch die Regeln dahinter fehlen.
Selbst der KI-Schiedsrichter irrt
Doch selbst ein spezialisierter KI-Prüfer erkennt solche Fehler nicht zuverlässig. Die Forscher ließen reale und generierte Aufnahmen von VideoPhy-2-AutoEval beurteilen, einem Vision-Language-Modell für physikalische Plausibilität. Ein verlässliches Prüfmodell müsste die echten Experimente nahezu vollständig akzeptieren.
Tatsächlich bestand nur knapp ein Viertel der realen Videos den strengen Gesamttest. Bei echten Wurfbewegungen, Kollisionen, springenden Bällen und rollenden Dosen bewertete der Prüfer teilweise kein einziges Video als bestanden. In einzelnen Kategorien hielt er künstliche Bewegungen sogar häufiger für regelkonform als reale.
Das menschliche Auge und ein KI-Prüfer, der Bild und Sprache verarbeitet, teilen offenbar eine Schwäche: Beide lassen sich von einer vertrauten Oberfläche beeindrucken. Energieerhaltung besitzt schließlich keine Textur. Impuls wirft keinen Schatten.
Andere Benchmarks mit einem breiteren physikalischen Spektrum kommen zu ähnlichen Befunden. Physics-IQ untersucht neben Festkörpermechanik auch Flüssigkeiten, Optik, Thermodynamik und Magnetismus. Auch dort zeigte sich, dass visueller Realismus nicht mit physikalischem Verständnis gleichgesetzt werden kann. Recherchequelle: physics-iq.github.io
VideoPhy-2 testete Tausende Alltagsszenen. Besondere Schwierigkeiten traten bei der Erhaltung von Masse und Impuls auf. Selbst das beste Modell bewältigte im anspruchsvollen Teil des Benchmarks weniger als die Hälfte der Aufgaben zugleich semantisch und physikalisch überzeugend. Recherchequelle: proceedings.iclr.cc
Ein Test unter Laborbedingungen
Morpheus misst nicht die gesamte physikalische Intelligenz einer Video-KI. Die Versuche sind kurz, die Kamera bleibt unbewegt, und im Mittelpunkt stehen kontrollierte Systeme der newtonschen Mechanik. Flüssigkeiten, Rauch, Wärme und komplexe Materialverformungen gehören nicht zum Kern des Tests. Zudem ist die Wirklichkeit weniger sauber als eine Formel: Reibung, Luftwiderstand und Messfehler lassen sich nie vollständig ausblenden.
Die Beschränkung auf einfache, kontrollierte Abläufe verschärft den Befund jedoch. Wenn Videomodelle schon bei fallenden Körpern, Pendeln und einfachen Kollisionen deutlich hinter realen Aufnahmen zurückbleiben, sollte man ihre glänzenden Bilder nicht vorschnell als Beleg für ein umfassendes Weltverständnis betrachten.
In Film und Werbung führt falsche Physik zunächst zu zusätzlichem Kontrollaufwand. In der Robotik, beim autonomen Fahren oder in wissenschaftlichen Simulationen steht dagegen mehr auf dem Spiel. Ein Roboter kann sich nicht darauf verlassen, dass eine Kiste nur ungefähr so fällt wie in der Wirklichkeit. Dort genügt der schöne Schein nicht.
Der Ball muss wirklich fallen. Und zwar jedes Mal nach denselben Gesetzen.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
Universität Amsterdam und Universität Trient – Morpheus: Benchmarking des physikalischen Denkvermögens von Videogenerierungsmodellen mit realen physikalischen Experimenten
Die Studienaufbereitung erläutert Morpheus, seine realen Mechanikversuche sowie die Prüfung von Bewegung, Objektpermanenz und Erhaltungsgrößen.
https://www.alphaxiv.org/de/abs/2504.02918v2
Shanghai AI Laboratory – Eine Definition und Roadmap für Weltmodelle
Die technische Vertiefung grenzt visuell plausible Renderer von Simulatoren ab, die verborgene Zustände fortschreiben und zukünftige Entwicklungen vorhersagen.
https://www.alphaxiv.org/de/abs/2607.06401
Universität Amsterdam und Universität Trient – Evaluierung der Newtonschen Mechanik in videogenerativen Modellen mit realen physikalischen Systemen
Die aktualisierte Studienaufbereitung zeigt konkret, dass VideoPhy-2 reale Physik teils verwirft und fehlerhafte generierte Videos dennoch hoch bewertet.
https://www.alphaxiv.org/de/abs/2504.02918



