Auf dem Bildschirm: eine Tabelle. In den Spalten stehen Vertragsdauer, Zahlungsverhalten, Kundendienstkontakte und letzter Einkauf. Einige Zeilen verraten bereits das Ergebnis – Kunde geblieben oder Kunde gegangen. Bei anderen ist es noch offen. Bislang begann hier oft ein eigenes Machine-Learning-Projekt: Daten bereinigen, Merkmale auswählen, verschiedene Verfahren testen, Einstellungen optimieren, Ergebnisse prüfen.
Nvidias neues Modell Kumo Tabular verspricht einen kürzeren Weg. Es soll die beschrifteten Zeilen als Beispiele auswerten und daraus direkt Vorhersagen für die übrigen Datensätze ableiten. Kein neues Training, keine Suche nach geeigneten Hyperparametern, keine von Hand entworfenen Merkmale. Eine Tabelle hinein, Wahrscheinlichkeiten oder Zahlenwerte heraus.
Veröffentlicht wurde Kumo Tabular am 29. September 2026. Das Modell beherrscht Klassifikation und Regression: Es kann etwa Kunden einer Risikogruppe zuordnen oder einen künftigen Zahlenwert schätzen. Nvidia bietet drei Größen mit 28 Millionen bis 215 Millionen Parametern an. Die Gewichte sind öffentlich verfügbar und nach Angaben des Unternehmens auch kommerziell nutzbar. Recherchequelle: NVIDIA
Auf den ersten Blick ist das eine Fachmeldung für Datenexperten. Doch ihre wirtschaftliche Bedeutung reicht weit darüber hinaus. Während generative KI Texte formuliert, Bilder malt und Stimmen nachahmt, schlummern die wertvollsten Informationen vieler Unternehmen noch immer in nüchternen Zeilen und Spalten.
Die leise Macht der Tabelle
Bestellungen, Rechnungen, Versicherungsfälle, Messwerte, Lagerbestände und Kreditanträge besitzen kaum die mediale Strahlkraft eines Videogenerators. Dennoch bilden sie das Gedächtnis von Unternehmen. Wer daraus verlässliche Prognosen ableiten kann, erkennt womöglich früher, welche Maschine auszufallen droht, wo neue Nachfrage entsteht oder bei welchem Geschäft ein erhöhtes Risiko besteht.
Rund zwei Jahrzehnte lang dominierten in diesem Bereich Verfahren wie Gradient Boosting und Random Forests. Sie sind schnell, robust und auf strukturierte Daten zugeschnitten. Vor allem XGBoost, LightGBM und CatBoost gehören bis heute zum Standardrepertoire vieler Datenabteilungen. Ihre Stärke hat allerdings einen Preis: Für jede weitere Aufgabe muss gewöhnlich ein eigenes Modell angepasst werden.
Grundlagenmodelle drehen diese Logik um. Statt für jede Tabelle bei null anzufangen, werden sie vorab mit einer großen Zahl unterschiedlicher Aufgaben vertraut gemacht. Beim Einsatz erhalten sie einige gelöste Beispiele und schließen daraus, welches Muster sich in den neuen Daten verbirgt. In der Sprachverarbeitung ist dieses Lernen aus dem Kontext längst üblich. Dort vermittelt ein Nutzer dem Modell anhand von Anweisungen und Beispielen, welche Art von Antwort er erwartet. Kumo Tabular überträgt dieses Prinzip auf strukturierte Daten.
Völlig neu ist die Idee nicht. TabPFN zeigte bereits, dass ein vortrainiertes Modell bei kleinen und mittelgroßen Tabellen klassische Methoden schlagen kann. Die 2025 in „Nature“ vorgestellte Version war für Datensätze mit bis zu 10.000 Beispielen ausgelegt und benötigte deutlich weniger Trainingszeit als viele herkömmliche Verfahren. Recherchequelle: Nature
Im Juni 2026 folgte Google mit TabFM. Auch dieses Modell interpretiert eine neue Tabelle mitsamt bekannten Zielwerten als eine Art Aufgabenbeschreibung. Historische Zeilen und noch unbekannte Fälle werden gemeinsam verarbeitet, ohne die Modellgewichte an den jeweiligen Datensatz anzupassen. Recherchequelle: Google Research
Kumo Tabular ist deshalb weniger ein isolierter Durchbruch als ein weiteres Zeichen dafür, dass aus einem Forschungsgebiet allmählich ein Wettbewerb um praxistaugliche Werkzeuge wird.
Millionen Tabellen, kein einziger echter Kunde
Der ungewöhnlichste Aspekt von Kumo Tabular liegt in seiner Vorgeschichte. Nach Angaben von Nvidia wurde das Modell ausschließlich mit künstlich erzeugten Tabellen vortrainiert. Echte Kundenkonten, reale Versicherungsakten oder vertrauliche Unternehmensdaten bekam es dabei nicht zu sehen.
Stattdessen ließ Nvidia mithilfe sogenannter struktureller Kausalmodelle immer neue statistische Welten entstehen. Verborgene und sichtbare Variablen wurden darin durch zufällig erzeugte Abhängigkeiten miteinander verknüpft. Manche Spalten enthielten Zahlen, andere Kategorien. Werte fehlten, Ausreißer tauchten auf, Zielgrößen wiesen gelegentlich Verteilungen mit schweren Rändern auf. So entstanden künstliche Tabellen, die viele typische Unregelmäßigkeiten realer Daten abbildeten.
Die kleine Modellvariante wurde mit etwa 35 Millionen synthetischen Tabellen trainiert, die mittlere mit rund 71 Millionen und die große mit ungefähr 137 Millionen. In der letzten Trainingsstufe umfassten die Beispiele bis zu 60.000 Zeilen und 100 Spalten.
Synthetische Trainingsdaten bieten dabei einen entscheidenden Vorteil. Ein Sprachmodell braucht gewaltige Mengen menschlicher Texte und übernimmt zwangsläufig Spuren ihrer Herkunft. Für Tabellenmodelle hingegen lässt sich die Trainingswelt programmatisch erzeugen. Das Modell soll nicht lernen, wie ein bestimmtes Unternehmen seine Kunden erfasst. Es soll statistische Zusammenhänge in sehr unterschiedlichen Tabellen aufspüren.
Kumo Tabular arbeitet dazu mit mehreren Aufmerksamkeitsebenen. Zunächst untersucht das Modell Werte innerhalb einer Spalte, dann die Beziehungen zwischen den Merkmalen einer Zeile und schließlich die Verbindung zwischen bekannten Beispielen und unbekannten Fällen. Ein Wert wie 42 besitzt für sich genommen noch keine eindeutige Bedeutung. Er kann ein Alter bezeichnen, eine Temperatur, eine Vertragsdauer oder die Zahl verspäteter Zahlungen. Erst der Kontext macht aus der Zahl eine Information.
Auch fehlende Werte behandelt das Modell gesondert. Bei Regressionen erzeugt es nicht bloß einen einzelnen Schätzwert, sondern eine durch 999 Quantile beschriebene Verteilung. Daraus lassen sich sowohl eine Prognose als auch ein Maß für ihre Unsicherheit ableiten.
Die Rangliste ist noch nicht das Urteil
Nvidia meldet eindrucksvolle Ergebnisse. Kumo Tabular erreiche im TabArena-Vergleich einen Elo-Wert von 1950 und liege damit an der Spitze. Gegenüber dem Modell LimiX-2 soll es bei der Ausführung auf derselben RTX 6000 Pro zugleich 17-mal schneller arbeiten. Auch in den Benchmarks BeyondArena, TALENT und ScoringBench beansprucht Nvidia führende Positionen.
Die Zahlen lassen aufhorchen. Eine unabhängige Prüfung ersetzen sie jedoch nicht.
TabArena wurde als laufend aktualisierter Vergleich für Modelle auf strukturierten Daten entwickelt. Unterschiedliche Verfahren werden dort unter möglichst einheitlichen Bedingungen getestet – mit abgestimmten Suchräumen, Kreuzvalidierung, Ensembles und dokumentiertem Ressourcenverbrauch. Das ist wichtig, denn schon kleine Änderungen an der Auswertung können die Rangfolge verschieben. Recherchequelle: TabArena
Am 30. September waren die von TabArena selbst durchgeführten Tests von Kumo Tabular noch nicht abgeschlossen. Der Antrag zur Aufnahme der kleinen, mittleren und großen Variante war weiterhin offen; im Projektverlauf hieß es ausdrücklich, die Läufe der Betreuer seien noch im Gange. Nvidias Spitzenwert stammt somit zunächst aus der eigenen Auswertung des Unternehmens. Recherchequelle: TabArena GitHub
Das entwertet die Ergebnisse nicht, ordnet sie aber vorerst als Herstellerangaben ein. Ein Anbieter kann einen etablierten Benchmark korrekt ausführen und dennoch andere Bedingungen wählen als dessen Betreuer. Wie stabil der Vorsprung tatsächlich ist, zeigt erst eine reproduzierte Prüfung.
Auch bisherige Untersuchungen zeigen, wie stark die Ergebnisse vom jeweiligen Einsatzfall abhängen. TabICLv2, an dessen Konzepten sich Kumo Tabular orientiert, konnte sorgfältig abgestimmte klassische Verfahren häufig übertreffen. Der praktische Nutzen solcher Grundlagenmodelle hängt jedoch erheblich von der Tabellengröße, der Datenstruktur, der Rechenumgebung und der gewünschten Vorhersagegeschwindigkeit ab. Recherchequelle: PMLR
Weniger Modellbau, nicht weniger Verantwortung
Kumo Tabular kann unmittelbar nur numerische und kategoriale Spalten verarbeiten. Texte, Bilder und Zeitangaben müssen zuvor in geeignete Merkmale umgewandelt werden. In einem einzelnen Durchlauf unterstützt das Modell höchstens zehn Klassen; bei Aufgaben mit mehr Klassen nutzt die Bibliothek zusätzliche Ausgabecodes. Nvidia warnt außerdem davor, dass die Genauigkeit sinken kann, wenn die Dimensionen einer Tabelle weit außerhalb der im Training verwendeten Größenordnungen liegen oder neue Datensätze deutlich von den bekannten Beispielen abweichen.
Die Arbeit des Datenexperten verschwindet damit nicht. Sie verlagert sich.
Die Suche nach einer passenden Modellarchitektur könnte weniger Zeit beanspruchen. Dafür rücken die Qualität der Ausgangsdaten und die Prüfung der Ergebnisse stärker in den Vordergrund: Sind die Daten aussagekräftig? Enthalten sie systematische Verzerrungen? Misst das Ziel überhaupt das, was das Unternehmen wissen möchte? Und bleibt die Prognose stabil, wenn sich Kundenverhalten, Preise oder Produktionsbedingungen ändern?
Der veröffentlichte Programmcode zeigt zudem, dass Kumo Tabular noch deutlich näher an einem technischen Werkzeugkasten als an einer fertigen Büroanwendung liegt. Die Bibliothek ist auf GPU-Verarbeitung mit PyTorch ausgerichtet. Zugleich bietet sie Beispiele, Schnittstellen und Programme zur Reproduktion der Benchmarks. Recherchequelle: NVIDIA GitHub
Der praktische Fortschritt liegt vor allem in der niedrigeren Einstiegshürde. Kumo Tabular ersetzt weder eine Statistikabteilung noch verwandelt es eine beliebige Excel-Datei zuverlässig in eine Geschäftsentscheidung. Wohl aber senkt es die Schwelle zu einer ersten leistungsfähigen Prognose.
Die Tabelle, lange das graue Arbeitstier der Digitalisierung, bekommt damit ihr eigenes Grundlagenmodell. Sie beginnt nicht zu sprechen. Aber sie könnte schneller antworten.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
ToolNavs – NVIDIA veröffentlicht Kumo Tabular als Open Source
Der Artikel erläutert Kumo Tabular als Foundation-Modell in drei Größen für Klassifikation und Regression ohne aufgabenspezifisches Training.
https://toolnavs.com/de/article/2195-nvidia-ver%C3%B6ffentlicht-kumo-tabular-als-open-source-tabellenvorhersagen-ohne-trai
HyperAI – NVIDIA Kumo Tabular führt bei tabellarischer Vorhersage
Die technische Darstellung erklärt das Vortraining mit synthetischen Tabellen aus strukturellen Kausalmodellen sowie den Umgang mit fehlenden Werten, Ausreißern und verrauschten Daten.
https://hyper.ai/de/stories/6af8dd1a3e49b29c06bd66ff6b430840
AI Brainer – NVIDIA Kumo Tabular: Neuer Maßstab für tabellarische Vorhersage
Der Artikel ordnet den gemeldeten TabArena-Elo-Wert von 1950 und den Geschwindigkeitsvergleich mit LimiX-2 kritisch ein und fordert eine unabhängige Validierung.
https://ai-brainer.com/de/news/nvidia-kumo-tabular-neuer-massstab-fuer-tabellarische-vorhersage-2026-09-29



