Lange wurde über künstliche Intelligenz gesprochen, als ließe sie sich auf eine einzige Komponente reduzieren: das Modell, ein mathematisches Gehirn aus Parametern, Trainingsdaten und Rechenleistung. Wer das stärkste besaß, so schien es, führte das Feld an. Doch Nvidias Agentensystem AVO zeichnet ein anderes Bild. Selbst ein leistungsfähiges Gehirn lernt erst mit Gedächtnis, Werkzeugen und klaren Kontrollmechanismen, über längere Strecken zuverlässig zu handeln.
Das bemerkenswerte Ergebnis: Claude Opus 5 erreichte beim interaktiven Benchmark ARC-AGI-3 als eigenständiges Modell rund 30 Prozent. Eingebettet in Nvidias AVO-Architektur stieg die Leistung nach Angaben des Unternehmens auf 100 Prozent. Das grundlegende Modell blieb gleich, doch das Resultat veränderte sich völlig. Entscheidend ist also weniger eine neue KI als das Gerüst, das sie trägt. Recherchequelle: developer.nvidia.com
183 Aufgaben ohne Gebrauchsanweisung
ARC-AGI-3 ist kein gewöhnlicher Wissenstest. Die KI soll weder historische Jahreszahlen nennen noch Programmierfragen beantworten oder bekannte Textmuster fortsetzen. Stattdessen findet sie sich in neuartigen, abstrakten und interaktiven Umgebungen wieder – ohne Anleitung. Durch Beobachtung und eigenes Handeln muss sie herausfinden, welche Regeln gelten, welches Ziel sich aus der Umgebung ableiten lässt und welche Schritte dorthin führen.
Damit prüft der Benchmark vier Fähigkeiten: Erkundung, Modellierung der Umgebung, eigenständige Zielbestimmung sowie Planung und Ausführung. Die KI muss experimentieren, aus Rückmeldungen lernen und ihre Strategie anpassen. Das erinnert an den Gang durch ein dunkles Haus: Niemand erklärt, wo die Türen sind. Nur wer sich vortastet, lauscht und jeden Schritt im Gedächtnis behält, findet den Ausgang. Recherchequelle: arcprize.org
Nvidias AVO-System bewältigte nach Unternehmensangaben alle 183 Aufgaben in den 25 öffentlichen Testumgebungen und benötigte dafür 6.624 Aktionen. Das waren rund zwölf Prozent weniger als bei dem von Nvidia zuvor herangezogenen VISTA-System. AVO steht für „Agentic Variation Operators“. Hinter dem sperrigen Namen verbirgt sich eine Architektur, die ein Sprachmodell nicht bloß antworten lässt, sondern in einen längerfristigen Arbeitsprozess einbindet. Recherchequelle: developer.nvidia.com
Das Gehirn bekommt ein Gedächtnis
Ein Sprachmodell allein ist meist stark auf den Augenblick beschränkt. Es erhält eine Eingabe, verarbeitet den verfügbaren Kontext und formuliert eine Antwort. Für langwierige Aufgaben genügt das häufig nicht. Fehler pflanzen sich fort, frühere Erkenntnisse geraten aus dem Blick, und ein einmal eingeschlagener Irrweg zieht sich womöglich durch viele weitere Schritte.
An diesem Punkt kommt der sogenannte Harness ins Spiel, ein technisches Steuer- und Kontrollgerüst rund um das Modell. Er legt fest, welche Informationen gespeichert werden, auf welche Werkzeuge die KI zugreifen darf und wie sich Ergebnisse überprüfen lassen. Außerdem regelt er, was geschieht, wenn ein Versuch scheitert. So wird aus einem Modell, das vor allem reagiert, ein Agent, der über viele Schritte hinweg zielgerichtet handeln kann.
Dafür verbindet AVO unter anderem persistentes Gedächtnis und Werkzeugzugriff mit Rückmeldungen aus Testläufen und einem überwachenden Agenten. Dieser Supervisor fungiert nicht als allwissender Lehrer, sondern als aufmerksame Kontrollinstanz. Die Aufgabe löst er nicht selbst. Er kann jedoch erkennen, wenn sich der Hauptagent festgefahren hat, einen bereits verworfenen Weg erneut einschlägt oder in eine Sackgasse läuft. Dann gibt er den Anstoß zu einem Richtungswechsel. Recherchequelle: developer.nvidia.com
Nicht für den Benchmark geboren
AVO hat einen unerwarteten Ursprung. Das System wurde nicht speziell für ARC-AGI-3 entwickelt, sondern hat seine Wurzeln in der Optimierung von GPU-Kernels – kleinen, hochspezialisierten Rechenprogrammen, deren Geschwindigkeit für KI-Anwendungen wichtig ist.
In der dazugehörigen Arbeit beschreibt das Nvidia-Team AVO als eine Form autonomer evolutionärer Suche. Der Agent entwirft Änderungen, setzt sie um, misst ihre Wirkung, verwirft schlechte Varianten und entwickelt erfolgreiche Ansätze weiter. Bei siebentägigen Versuchen entstanden auf diese Weise Kernel, die in den getesteten Konfigurationen bis zu 3,5 Prozent schneller als cuDNN und bis zu 10,5 Prozent schneller als FlashAttention-4 waren. Menschliche Entwicklerinnen und Entwickler müssen damit nicht länger jede einzelne Optimierung vorgeben. Recherchequelle: arxiv.org
Für den ARC-Benchmark tauschte Nvidia die Werkzeuge aus, behielt das Grundprinzip jedoch bei. Der Agent beobachtete und experimentierte, bewertete seine Ergebnisse und folgte den Spuren früherer Versuche. Genau dieser Werkzeugwechsel ist entscheidend: Er soll zeigen, dass AVO nicht auf eine einzelne Aufgabe beschränkt ist, sondern als allgemeine Methode für lang andauernde, mehrstufige Arbeiten taugt.
Ein perfektes Ergebnis mit Fußnoten
Die 100 Prozent wirken zunächst endgültiger, als das Ergebnis tatsächlich ist. Sie bedeuten nicht, dass Claude oder AVO nun über allgemeine Intelligenz verfügten. Das Resultat bezieht sich auf die 25 öffentlichen Umgebungen von ARC-AGI-3. Zudem handelt es sich um eine von Nvidia veröffentlichte Messung, nicht um den abschließenden privaten Wettbewerbstest.
Für den offiziellen Wettbewerb gelten eigene Bedingungen. Bewertete Systeme dürfen während der Prüfung keinen Internetzugang nutzen. Die Lösungen müssen reproduzierbar und für die Preisberechtigung öffentlich zugänglich sein. API-basierte Systeme wie ein über eine externe API aufgerufenes Claude-Modell können daher nicht ohne Weiteres als offizielle Wettbewerbseinreichung behandelt werden. Der öffentliche Bestwert und der Gewinn des ARC-Preises sind nicht gleichzusetzen. Recherchequelle: arcprize.org
Aus einem einzelnen Benchmark lässt sich ohnehin keine allgemeine Zuverlässigkeit ableiten. Ein Agent kann in abstrakten Spielumgebungen hervorragend abschneiden und dennoch an unübersichtlichen Unternehmensdaten, widersprüchlichen Anweisungen oder unerwarteten menschlichen Reaktionen scheitern. Der Test zeigt eine Fähigkeit unter bestimmten Bedingungen – keinen digitalen Universalverstand.
Der Wettbewerb wandert eine Ebene höher
Wichtiger als der reine Spitzenwert ist deshalb der damit verbundene Perspektivwechsel. Bislang vergleichen Unternehmen vor allem, welches Modell besser schreibt, schneller programmiert oder genauer argumentiert. Künftig könnte eine andere Frage entscheidender werden: In welchem System arbeitet ein Modell?
Das hätte wirtschaftliche Folgen. Wenn Architektur, Gedächtnis, Werkzeuge und Kontrollschleifen einen derart großen Leistungsunterschied bewirken können, muss nicht jede Verbesserung von einem größeren und teureren Modell ausgehen. Ein sorgfältig konstruiertes Agentensystem könnte aus einem vorhandenen Modell mehr herausholen. Zugleich ließe sich besser nachvollziehen, wie das System handelt, wo es scheitert und wann ein Mensch eingreifen sollte.
Der Harness wird damit zum eigentlichen Arbeitsplatz der KI. Er bewahrt ihre Notizen auf, stellt Instrumente bereit und ermöglicht es ihr, Zwischenergebnisse zu prüfen. Zugleich setzt er Grenzen, damit aus Selbstständigkeit kein Kontrollverlust wird.
Die künstliche Intelligenz der nächsten Phase wird deshalb vielleicht weniger einem einzelnen, alles überragenden Modell als einem Orchester gleichen. Das Modell spielt die erste Stimme, doch Gedächtnis, Werkzeuge, Kontrolle und Infrastruktur entscheiden darüber, ob daraus Musik entsteht. Nvidias AVO-Ergebnis ist noch kein Beweis für eine neue Ära. Aber es setzt einen hörbaren Auftakt.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
Pasquale Pillitteri – NVIDIA AVO erreicht 100% bei ARC-AGI-3 mit demselben Claude Opus 5, der für sich allein bei 30% bleibt
Der Beitrag erläutert den Leistungssprung auf 100 RHAE sowie die 183 gelösten Aufgaben in 25 öffentlichen Umgebungen mit insgesamt 6.624 Aktionen.
https://pasqualepillitteri.it/de/news/12280/nvidia-avo-claude-opus-5-arc-agi-3-100
Glama – AVO: Agentische Variationsoperatoren
Die offene AVO-Reproduktion zeigt technisch, wie persistenter Zustand, Bewertungswerkzeuge und ein bei Stagnation eingreifender Supervisor langfristige Suchläufe steuern.
https://glama.ai/mcp/servers/gatordevin/avo?locale=de-DE
Mindverse – Neue Ansätze zur autonomen Optimierung von GPU-Kernels durch Agentic Variation Operators
Der Fachbeitrag vertieft die evolutionäre Kernel-Suche auf Nvidia-B200-GPUs und die gemessenen Vorteile von bis zu 3,5 Prozent gegenüber cuDNN und 10,5 Prozent gegenüber FlashAttention-4.
https://www.mind-verse.de/news/autonome-optimierung-gpu-kernels-agentic-variation-operators



