Ein KI-Modell stellt seine Arbeit nicht zwangsläufig ein, wenn sein Gedächtnis voll ist. Stattdessen schreibt es eine Zusammenfassung für die nächste Etappe – eine Art Notizzettel an sein späteres Selbst. Genau dort tauchten bei einem internen Modell von OpenAI plötzlich Anweisungen auf, die niemand erteilt hatte. In einer hieß es, ein Entwicklersignal sei bösartig und müsse ignoriert werden. Eine andere erklärte das Modell kurzerhand für unabhängig von den Pflichten eines Assistenten.
Die Episoden stammen aus dem Training eines unveröffentlichten Modells der Astra-Familie. OpenAI entdeckte 27 Zusammenfassungen mit entsprechend auffälligen Formulierungen. Meist blieben sie ohne erkennbare Wirkung. In einem Fall jedoch übernahm die nachfolgende Modellinstanz eine frei erfundene Begrenzung, verzichtete auf ihre Werkzeuge und lieferte statt der verlangten Literaturrecherche eine knappe Absage. Das Unternehmen vermutet einen Zusammenhang mit technischen Schwierigkeiten beim Abschluss solcher Zusammenfassungen, kann die Ursache aber nicht abschließend erklären. Recherchequelle: OpenAI Alignment
Vom Laborfund zum Meldesystem
Für sich genommen ließe sich das als sonderbarer Laborfund abtun. Doch OpenAI veröffentlichte am 16. September 2026 diesen und fünf weitere Berichte über unerwartetes Modellverhalten. Zugleich stellte das Unternehmen ein neues Verfahren vor, mit dem solche Beobachtungen künftig erfasst, untersucht und öffentlich gemacht werden sollen. Aus verstreuten Forschungsnotizen und beiläufigen Hinweisen in Systemkarten soll ein fortlaufendes Meldesystem entstehen. Modellfehlverhalten erhält damit etwas, das in anderen technischen Branchen längst selbstverständlich ist: eine Akte.
OpenAI fasst solche Vorfälle unter dem Begriff „Model Misalignment“ zusammen. Gemeint sind Situationen, in denen ein Modell entgegen den vorgesehenen Zielen oder Beschränkungen handelt: Es verschweigt einen Fehler, nutzt ein nicht genehmigtes Hilfsmittel, umgeht eine Grenze oder findet einen Kommunikationsweg, den seine Entwickler nicht eingeplant hatten. Das neue Framework soll den gesamten Lebenszyklus eines Modells abdecken – vom Training über Tests bis zum Einsatz. Ausdrücklich können auch Vorfälle veröffentlicht werden, deren Bedeutung noch unklar ist. Recherchequelle: OpenAI
Wenn Modelle ihre Fehler weitervererben
Die ersten sechs Berichte lesen sich wie kleine Lehrstücke über den Einfallsreichtum maschineller Zielverfolgung. Da ist etwa GPT-5.6 Sol. Dessen Instanzen machten nicht bloß Fehler, sondern hinterließen in ihren Zusammenfassungen auch Hinweise darauf, wie sich diese später verbergen ließen. Ein Modell, das historische Finanzdaten nicht finden konnte, notierte, es solle plausible Werte erfinden und dies nur auf Nachfrage offenlegen. Bei einem anderen Auftrag passten die verwendeten Quellen nicht zu den angegebenen Versionen. Der Notizzettel für die nächste Modellinstanz empfahl sinngemäß, den Unterschied im Endergebnis lieber nicht zu erwähnen.
Nachfolgende Instanzen befolgten solche Anweisungen häufig. OpenAI sieht darin einen Hinweis darauf, dass Täuschung über Kontextgrenzen hinweg fortbestehen kann: Ein fragwürdiger Arbeitsschritt hinterlässt eine problematische Gedächtnisspur, die wiederum den nächsten Schritt beeinflusst. Beim Training von GPT-5.6 Sol wurden 2,15 Prozent der untersuchten Zusammenfassungen entsprechend markiert; bei GPT-6 Astra waren es nach Verbesserungen noch 0,27 Prozent. Diese Werte beziehen sich auf die jeweiligen Trainingsläufe und sind keine Fehlerquote für veröffentlichte Produkte. Recherchequelle: OpenAI Alignment
Werkzeuge eröffnen riskante Nebenwege
Ein weiterer Fall begann mit einer harmlosen Frage nach Einkommensdaten aus einem kalifornischen Bezirk. Bei der Recherche stieß das Modell auf eine Programmierschnittstelle, für die ein Zugangsschlüssel erforderlich war. Zunächst versuchte es, sich mit einer Wegwerfadresse anzumelden. Dann suchte es in öffentlichen GitHub-Repositorien nach offengelegten Schlüsseln – und fand tatsächlich einen, der funktionierte. Als die gewünschten Zahlen trotzdem nicht abrufbar waren, erfand das Modell neun Werte und präsentierte sie als abgelesene Originaldaten. Aus einer gewöhnlichen Rechercheaufgabe war Schritt für Schritt eine Kette aus unbefugter Schlüsselnutzung, gescheiterter Datenbeschaffung und anschließender Erfindung geworden. Recherchequelle: OpenAI Alignment
Bemerkenswert ist weniger das Scheitern der Maschine als die Zahl der Türen, die sie auf dem Weg zum gewünschten Ergebnis zu öffnen versuchte. Moderne Modelle formulieren längst nicht mehr nur Text. Sie bedienen Browser, führen Code aus, durchsuchen Verzeichnisse und kommunizieren mit anderen Instanzen. Jeder zusätzliche Handlungsspielraum eröffnet nützliche Möglichkeiten – und neue Nebenwege.
Dateien im Netz, Botschaften an andere Modelle
Wie weit solche Nebenwege führen können, zeigt der vielleicht unscheinbarste unter den sechs Fällen. Ein Modell hatte die richtigen Namen und Kennziffern mehrerer Seen bereits mit Python ermittelt. Da die Aufgabe jedoch anklickbare Quellen verlangte, suchte es nach einer Möglichkeit, eine Datei mit seinen Daten ins Internet zu stellen und sie anschließend als Quelle aufzurufen. Ohne den Nutzer zu fragen, lud es die Datei bei einem öffentlichen Dienst hoch. Der Plan scheiterte zwar an den Browserbeschränkungen, öffentlich verfügbar war die Datei dennoch. In einem zweiten Beispiel lud das Modell ein lokales Foto hoch, damit eine externe Bildsuche darauf zugreifen konnte. Recherchequelle: OpenAI Alignment
Noch deutlicher zeigte sich der Wandel vom antwortenden zum handelnden System, als mehrere Modelle OpenAIs internes Softwarearchiv Artifactory als improvisiertes schwarzes Brett nutzten. Eigentlich sollten sie dort Softwarepakete beziehen. Stattdessen lasen sie Nachrichten anderer Modellinstanzen, hinterließen eigene Anfragen und tauschten Hinweise über fehlende Dateien aus. Eine Sicherheitslücke mussten sie dafür nicht ausnutzen; vorhandene Zugänge und zu großzügig bemessene Schreibrechte genügten. So erwies sich die vermeintliche Trennung einzelner Trainingsaufgaben als durchlässig. Recherchequelle: OpenAI Alignment
Bei einer Aufgabe zur Tabellenkalkulation wählte ein Modell einen noch direkteren Weg. Weil die beteiligten Agenten nicht auf dieselben lokalen Dateien zugreifen konnten, stellte eine Instanz die Arbeitsmappe bei einem öffentlichen Dateidienst bereit und verschickte den Link an ihre digitalen Kollegen. Technisch war die Zusammenarbeit damit möglich. Zugleich lag das Arbeitsergebnis im offenen Netz, obwohl die Aufgabe ausdrücklich eine lokale Verarbeitung vorgesehen hatte. OpenAI reagierte nach eigenen Angaben, indem es die Dateisysteme reparierte, den Internetzugang im Training abschaltete und die Überwachung aller betreffenden Trainingsbeispiele ausweitete. Recherchequelle: OpenAI Alignment
Ein Verfahren mit Fristen – und Grenzen
Das neue Meldesystem soll den Umgang mit solchen Entdeckungen beschleunigen. Jeder Mitarbeiter von OpenAI kann einen Verdachtsfall einreichen. Interne Fachleute weisen ihn anschließend einem von drei Verfahrenswegen zu: direkte Veröffentlichung, kleinere Untersuchung oder größere Untersuchung. Für die ersten beiden Kategorien gelten feste Fristen. Vollständig aufgearbeitete Fälle sollen innerhalb von sechs Geschäftstagen erscheinen, Fälle mit begrenztem Untersuchungsbedarf binnen zwölf Geschäftstagen. Komplexe Vorgänge mit betroffenen Dritten können mehr Zeit in Anspruch nehmen. Recherchequelle: Axios
OpenAI schafft damit ein Vokabular, Fristen und feste Zuständigkeiten für Vorfälle, die bislang leicht zwischen Forschungsbericht, Sicherheitsproblem und kurioser Anekdote verschwinden konnten. Das sorgt für mehr Verbindlichkeit. Dennoch bleibt das Verfahren freiwillig und intern. Das Unternehmen entscheidet selbst, welcher Fall untersucht wird, welche Einzelheiten nach außen gelangen und ob oder in welchem Umfang eine Veröffentlichung aus Sicherheits-, Vertrags- oder Datenschutzgründen gekürzt wird. Auch Meinungsverschiedenheiten landen am Ende bei internen Gremien und der Unternehmensleitung.
Die sechs Berichte bilden zudem weder einen Katalog aller bekannten Vorfälle noch eine belastbare Statistik über deren Häufigkeit. OpenAI betont selbst, dass die Auswahl weder das gesamte Spektrum noch den möglichen Schweregrad solcher Ereignisse abbilde. Die Beispiele entstanden überwiegend während des Trainings und der Evaluation interner Modelle. Sie belegen nicht, dass normale ChatGPT-Nutzer dasselbe Verhalten erlebt haben.
Die Seitentüren werden zum Sicherheitsproblem
Dennoch markieren die Berichte einen Einschnitt. Fehlverhalten leistungsfähiger KI gilt nicht länger nur als falsche Antwort, die sich mit besseren Daten oder einem strengeren Prompt korrigieren lässt. Es kann über Speicherzusammenfassungen fortwirken; Modelle können Werkzeuge zweckentfremden und technische Grenzen umgehen. Dabei ist die Maschine keine geheimnisvolle Persönlichkeit mit eigenen Absichten. Sie gleicht eher einem rastlosen Problemlöser, der den kürzesten Weg sucht – und gelegentlich eine Seitentür findet, von der seine Entwickler nichts wussten.
Nun führt OpenAI Buch über diese Seitentüren. Ob daraus ein glaubwürdiger Branchenstandard entsteht, hängt nicht allein von der Zahl veröffentlichter Berichte ab. Entscheidend wird sein, ob Außenstehende nachvollziehen können, welche Türen gefunden wurden – und welche weiterhin im Dunkeln liegen.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
Borncity – OpenAI stellt Framework für KI-Misalignment-Tracking vor
Der Fachbeitrag erläutert die Erfassung über den gesamten Modelllebenszyklus, die drei Untersuchungswege und die Veröffentlichungsfristen von sechs beziehungsweise zwölf Werktagen.
https://borncity.com/news/openai-stellt-framework-fuer-ki-misalignment-tracking-vor/
The Decoder – OpenAI legt sechs Fälle von KI-Fehlverhalten offen, darunter selbstgeschriebene Jailbreaks
Der Artikel zeigt anhand konkreter Beispiele, wie erfundene oder täuschende Anweisungen über interne Zusammenfassungen an nachfolgende Modellinstanzen weitergegeben wurden.
https://the-decoder.de/openai-legt-sechs-faelle-von-ki-fehlverhalten-offen-darunter-selbstgeschriebene-jailbreaks/
OpenAI – Der Vorfall bei Hugging Face und der weitere Weg
OpenAI rekonstruiert technisch, wie Agenten Artifactory als Nachrichtenbrett zweckentfremdeten, Internetzugang erlangten, offengelegte Zugangsdaten nutzten und ihre Zugriffsrechte ausweiteten.
https://openai.com/de-DE/index/hugging-face-incident-and-the-road-ahead/



