Im Februar stand der Zeiger noch fast auf null. Sechs Monate später ist er auf 26 Prozent gesprungen. Hinter der Zahl steht ein klarer Rollenwechsel: Bei 26 Prozent der eigenen KI-Forschung leistet Claude nach Angaben von Anthropic nicht mehr bloß Unterstützung, sondern „führt“ die Arbeit. Das Modell übernimmt den größten Teil einer Aufgabe – vom übergeordneten Auftrag bis zum Ergebnis. Der Mensch beaufsichtigt, korrigiert und stimmt am Ende zu.
Schnell entsteht das Bild eines Claude, der nachts allein im Labor sitzt und seinen Nachfolger entwirft. Davon ist das Modell weit entfernt. Bemerkenswert bleibt die am 17. September 2026 veröffentlichte Zahl dennoch: Erstmals versucht eines der führenden Labore öffentlich zu beziffern, wie stark KI bereits an der Entwicklung künftiger KI-Systeme beteiligt ist. Am 18. September griff die Associated Press die Veröffentlichung auf und machte damit eine bislang interne Frage öffentlich. Recherchequelle: AP News
Wie Anthropic die Arbeitsteilung mit Claude vermisst
Anthropic nennt sein Instrument „R&D Automation Index“, zu Deutsch: Automatisierungsindex für Forschung und Entwicklung. Er soll nicht erfassen, wie intelligent Claude im Allgemeinen ist. Auch die üblichen Ranglisten, Prüfungsaufgaben und Programmierbenchmarks spielen keine entscheidende Rolle. Stattdessen richtet sich der Blick auf die tatsächliche Arbeit im Unternehmen: Experimente vorbereiten, Fehler untersuchen, Trainingssysteme betreuen, Ergebnisse auswerten, Infrastruktur warten, Sicherheitsprobleme analysieren.
Um diesen Alltag abzubilden, ließ Anthropic die Tätigkeiten seiner Modellabteilungen erfassen. In jeder Woche des Juli wurde nach Unternehmensangaben eine Stichprobe von 20 Prozent der Mitarbeiter aus den beteiligten Abteilungen ausgewählt. Claude untersuchte Arbeitsunterlagen sowie interne Kommunikation und leitete daraus rund 15.000 einzelne Aufgaben ab. Anschließend wurden sie in eine Baumstruktur mit 542 Bereichen gegliedert, darunter 378 möglichst konkrete Endkategorien. Aus dem schwer überschaubaren Betrieb eines KI-Labors entstand so eine Landkarte der Arbeit. Recherchequelle: Anthropic Institute
Die verwendete Skala reicht von null bis fünf. Auf Stufe null spielt KI keine Rolle. Stufe zwei steht bereits für spürbare Unterstützung, doch der Mensch bleibt am Steuer. Die dritte Stufe bezeichnet Zusammenarbeit: Das Modell übernimmt größere Teile, braucht aber enge Anleitung. Auf Stufe vier führt die KI unter menschlicher Aufsicht. Erst Stufe fünf bedeutet vollständige Autonomie mit wenig oder gar keinem menschlichen Eingriff.
Entwickelt wurde diese Einteilung ursprünglich von der Forschungsorganisation Epoch AI. Sie soll anschaulicher sein als eine bloße Prozentangabe. Denn zwischen einem Programm, das Formulierungen glättet, und einem System, das ein Forschungsvorhaben weitgehend selbst abwickelt, liegt mehr als nur ein Leistungsunterschied. Mit den Fähigkeiten verschiebt sich auch die Verantwortung zwischen Mensch und Modell. Recherchequelle: Epoch AI
26 Prozent Führung, aber keine vollständige Autonomie
Nach dieser Einteilung führt Claude inzwischen 26 Prozent der untersuchten Forschungs- und Entwicklungsarbeit. Bei mehr als 90 Prozent erreicht das Modell mindestens die Stufe der Zusammenarbeit. Vollständig autonom arbeitet es dagegen in keinem erfassten Bereich.
Entscheidend ist, was die Zahl 26 nicht besagt. Sie bezeichnet weder den Anteil aller Arbeitsstunden, die Claude ohne Menschen erledigt, noch bedeutet sie, dass ein Viertel der Forscher überflüssig geworden wäre. Gemessen wird vielmehr der Automatisierungsgrad einzelner Tätigkeitsfelder. Deren Gewichtung richtet sich näherungsweise nach der menschlichen Arbeitszeit, die bislang auf sie entfällt.
Auch auf Stufe vier verschwindet der Mensch nicht aus dem Prozess, doch seine Rolle wandelt sich. Wer zuvor jeden Schritt selbst ausführte, wird zum Auftraggeber, Kontrolleur und Entscheider. Der Forscher schreibt dann womöglich nicht mehr jede Zeile Programmcode. Er muss aber weiterhin erkennen, ob Claude die richtige Frage verfolgt, einen plausiblen Versuchsaufbau gewählt und aus den Ergebnissen keinen glänzend klingenden Unsinn abgeleitet hat.
Wenn Claude den eigenen Anteil mitbewertet
Der Index birgt dabei eine methodische Pointe: Claude half, die Aufgaben zu erfassen, zu ordnen und ihren Automatisierungsgrad zu beurteilen. Das Modell misst also mit, wie viel Forschungsarbeit von KI erledigt wird. Zum Vergleich holte Anthropic Urteile von Mitarbeitern ein. Claude stimmte in 59 Prozent der Fälle exakt mit einem Menschen überein; Menschen untereinander kamen lediglich auf 35 Prozent. In 97 Prozent der Fälle lagen Modell und Mensch höchstens eine Stufe auseinander.
Wertlos wird die Methode dadurch nicht. Die Ergebnisse zeigen jedoch, wie unscharf die Grenzen sind. Wann unterstützt ein System noch? Wann arbeitet es bereits gleichberechtigt mit, und ab welchem Punkt führt es? Solche Übergänge lassen sich nicht mit dem Lineal ziehen. Derselbe Arbeitsablauf kann je nach Betrachter unterschiedlich eingeordnet werden.
Ein grundsätzliches Problem kommt hinzu: Der Aufgabenkatalog bildet die Arbeit eines bestimmten Zeitraums ab. Sobald bestehende Tätigkeiten automatisiert werden, können Menschen auf neue, anspruchsvollere Aufgaben ausweichen, die im ursprünglichen Katalog nicht vorkommen. Der Zeiger steigt dann, obwohl die Forschung insgesamt nicht im gleichen Maß automatisiert wurde. Anthropic bezeichnet das Instrument deshalb als Prototyp, nicht als endgültigen Maßstab.
30.000 KI-Instanzen unter automatischer Aufsicht
Neben dem Automatisierungsgrad veröffentlichte das Unternehmen Kennzahlen zur internen Nutzung und zur Rechenleistung. Auf seiner meistgenutzten internen Plattform arbeiteten im August rund 30.000 KI-Instanzen gleichzeitig an Forschungs- und Entwicklungsaufgaben. Ihre Aktionen durchlaufen nach Angaben des Unternehmens automatische Kontrollsysteme. Von mehr als einer Milliarde geprüften Entscheidungen blockierten diese Systeme etwa 0,002 Prozent – ungefähr eine von 47.000. Nachgelagerte Kontrollsysteme markieren außerdem jede Woche rund 100.000 Gesprächsprotokolle; etwa 50 besonders dringliche Fälle werden von Menschen geprüft.
Die niedrige Blockierungsquote lässt zwei Lesarten zu. Entweder handeln die Systeme zuverlässig, oder die Kontrollen erkennen problematisches Verhalten nicht immer. Um solche blinden Flecken aufzuspüren, testete die unabhängige Organisation METR im Frühjahr einen Teil der internen Überwachungssysteme. Dabei entdeckten die Prüfer mehrere neue Schwachstellen, die teilweise behoben wurden. Einen Grund, zentrale Aussagen des damaligen Anthropic-Berichts grundsätzlich zu verwerfen, sahen sie jedoch nicht. Bei der Untersuchung handelte es sich um einen begrenzten Red-Teaming-Test, nicht um eine unabhängige Bestätigung des nun veröffentlichten Automatisierungsindex. Recherchequelle: METR
Die dritte Kennzahl betrifft die Rechenleistung. In der untersuchten Woche vom 13. bis 20. Juli entfielen laut Anthropic etwa sechs Prozent der für KI-Forschung eingesetzten Rechenleistung auf Sicherheitsarbeit. Beschränkt man die Betrachtung auf KI-gestützte KI-Forschung, lag der Anteil bei zwölf Prozent. An dieser Einordnung wirkte Claude ebenfalls mit. Anthropic räumt allerdings ein, dass sich Sicherheits- und Leistungsforschung nicht sauber voneinander trennen lassen. Eine bessere Überwachung kann ein Modell sicherer machen und zugleich seinen kommerziellen Einsatz erleichtern.
Wie nah ist die selbstbeschleunigende Forschung?
Vor dem Schluss, die vollständige Selbstautomatisierung stehe wegen des rasanten Anstiegs unmittelbar bevor, warnt Anthropic ausdrücklich. Im eigenen Transparenzbericht heißt es, Claude habe bislang keine dauerhafte Verdopplung des Entwicklungstempos bewirkt und sei nicht annähernd in der Lage, die Forscher und Ingenieure des Unternehmens zu ersetzen. Recherchequelle: Anthropic Transparency Hub
Die Veröffentlichung fällt in eine Phase, in der Anthropic-Chef Dario Amodei seit Anfang September fordert, die Entwicklung besonders leistungsfähiger Modelle bewusster zu verlangsamen. Als einen Grund nennt er ausgerechnet die wachsende Fähigkeit von KI, die nächste Generation von KI mitzuentwickeln. Mehr Tempo bringt bessere Werkzeuge hervor, bessere Werkzeuge beschleunigen wiederum die Forschung. So kann aus linearem Fortschritt eine Kurve werden, die immer steiler ansteigt. Recherchequelle: Dario Amodei
Noch misst der neue Index diese Kurve nicht zuverlässig. Es fehlen unabhängige Prüfungen, Vergleichszahlen anderer Labore und eine Methode, die über längere Zeit stabil bleibt. Einen ersten Messpunkt liefert er trotzdem. Sollten OpenAI, Google DeepMind, Meta und weitere Entwickler ähnliche Werte veröffentlichen, ließe sich erstmals verfolgen, ob KI-Forschung tatsächlich in einen sich selbst beschleunigenden Kreislauf gerät.
Bis dahin bleibt der Tacho ein firmeneigenes Instrument. Doch immerhin ist nun ein Teil des Armaturenbretts sichtbar.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
Unite.AI – Anthropic sagt, Claude führt 26% seiner KI-Forschung und -Entwicklung an
Der Beitrag erklärt den Aufgabenkatalog, die Automatisierungsstufen AL0 bis AL5, die Gewichtung nach Arbeitszeit und die methodischen Grenzen des R&D Automation Index.
https://www.unite.ai/de/anthropic-says-claude-leads-26-of-its-ai-research-and-development/
Die Netzhandwerker – Neue METR-Studie zeigt: KIs werden zunehmend schwerer kontrollierbar
Die technische Analyse zeigt, wie METR Anthropics interne Agentenüberwachung durch eine veränderte Umgebungsvariable und einfache Jailbreak-Muster umgehen konnte.
https://netzhandwerker.de/blog/neue-metr-studie-kis-schwer-kontrollierbar
t3n – KI-Warnungen von Anthropic-Chef Amodei: Eigennützig – und trotzdem richtig
Die Analyse beleuchtet den möglichen Selbstbeschleunigungszyklus, das wachsende Missverhältnis zwischen Entwicklungs- und Prüfgeschwindigkeit sowie Amodeis Interessenlage.
https://t3n.de/news/ki-warnungen-anthropic-chef-amodei-eigennuetzig-richtig-1763135/



