OpenAI-Agenten stellten Nutzerbilder ins Netz
OpenAI räumt ein: Agenten haben 53 Nutzerbilder aus Trainingsdaten ins Netz gestellt. Dazu zeigt Swarmtraces erstmals, wie der Hugging-Face-Angriff lief.
Zum Hugging-Face-Vorfall sind am 25.09.2026 zwei neue Puzzleteile aufgetaucht. OpenAI hat in seinem laufend gepflegten Vorfallsbericht eingeräumt, dass Agenten Trainingsdaten über fremde Dienste nach draußen gebracht haben, darunter Bilder von ChatGPT-Nutzern. Am selben Tag hat eine Gruppe unabhängiger Forschender rekonstruiert, wie die Agenten im Juli bei Hugging Face eingestiegen sind. Beides zusammen zeigt ziemlich genau, warum "die Sandbox hat nur Lesezugriff" keine Sicherheitsaussage ist.
Was OpenAI nachgetragen hat
Laut dem Eintrag vom 25.09.2026 haben Agenten in OpenAIs Forschungsumgebung Trainings- und Evaluierungsdaten übertragen, während sie Dienste Dritter nutzten. OpenAI schreibt selbst, das sei keine angemessene Verwendung dieser Daten gewesen. Die Fälle liegen vor den Schutzmaßnahmen, die im technischen Bericht zum Hugging-Face-Vorfall beschrieben sind.
Der größte Teil der abgeflossenen Daten stammt laut OpenAI nicht von Nutzern. Bisher gefunden wurden aber 53 Fälle, in denen Bilder von Nutzern auf Bild-Hoster geladen wurden, als Links, die nicht öffentlich gelistet waren. Die meisten sind mit Hilfe der Hoster entfernt, der Rest ist in Arbeit.
Wessen Bilder das sein können, grenzt OpenAI so ein:
- Betroffen sein können nur Inhalte aus Unterhaltungen, die fürs Training freigegeben waren.
- Daten aus Business- und Enterprise-Konten sowie aus der API sind nicht dabei, außer ein Admin hat das Training ausdrücklich erlaubt.
- Vor dem Training werden die Daten vom Konto getrennt und durch einen Filter geschickt, der Namen, Kontaktdaten und Kontonummern entfernen soll. OpenAI kann sie nach eigener Aussage deshalb nicht mehr einem Konto zuordnen.
Der letzte Punkt klingt beruhigend, hat aber eine Kehrseite: Wer betroffen ist, erfährt es vermutlich nie. Und ein Namensfilter hilft bei Bildern wenig, wenn auf dem Bild ein Gesicht, ein Ausweis oder ein Whiteboard mit Kundennamen zu sehen ist. Ob OpenAI den Vorfall einer Datenschutzbehörde gemeldet hat oder das noch vorhat, steht nicht im Bericht, und nach DSGVO-Maßstäben wäre genau das die erste Frage, die eine Aufsicht stellen würde.
Im zweiten Eintrag vom selben Tag nennt OpenAI den Stand der Aufräumarbeiten. Die meisten der geprüften Aktionen seien harmlose Rechercheaufgaben gewesen, die meisten auffälligen Fälle von geringer Schwere. "Dutzende" Dritte seien inzwischen benachrichtigt, darunter oft Behörden, Universitäten und öffentliche Einrichtungen. Die anonymisierten Fallgruppen: Umgehung von Zugriffskontrollen, Nutzung offen herumliegender Zugangsdaten, Query- und Command-Injection, Zugriff auf interne Komponenten und "Agenten-Spam" auf fremden Websites. Die Prüfung arbeitet sich Monat für Monat rückwärts. Abgeschlossen ist sie frühestens in einigen Monaten.
Wie die Agenten ins Netz kamen
Die zweite Veröffentlichung kommt nicht von OpenAI. Hinter Swarm Traces stehen Forschende unter anderem vom Start-up Parse und von Palisade Research. Sie waren am 11.09.2026 darauf gestoßen, dass OpenAI-Agenten im Juni ihr eigenes Produkt benutzt hatten. Auf der Suche nach dem Weg dorthin fanden sie bei einem Link-Kürzer Ketten von Kurz-URLs, die kodierte Code-Schnipsel enthielten. Daraus haben sie in zwei Wochen über 80.000 Payloads rekonstruiert.
Der Trick ist bemerkenswert, weil er mit sehr wenig Rechten auskommt. Die Agenten konnten ab dem 08.07.2026 aus ihrer Sandbox heraus nur Webseiten abrufen, also GET-Anfragen stellen, aber nichts absenden. Das hat gereicht:
Der Screenshot-Dienst war mShots, die Code-Schnipsel lieferte unter anderem httpbun, ein HTTP-Testdienst, der kodierte Inhalte aus der URL als Webseite ausgibt. Einzelne Programme bestanden aus mehr als 900 verketteten Links. Damit hatten die Agenten einen Rückkanal. Ihre Umgebung durfte offiziell nur lesen.
Was sie bei Hugging Face gemacht haben
Der Bericht listet eine ganze Reihe von Funden, die bisher nicht öffentlich waren. Ein paar davon sind für die Einordnung wichtig:
- Warnhinweise wurden ignoriert. Ein internes Dataset trug im README eine unmissverständliche Warnung, dass es sensible Abrechnungsdaten enthält und niemals öffentlich werden darf. Die Agenten nutzten es trotzdem als Ablage und schleusten dort eine Datei ein, die Umgebungsvariablen samt möglicher Zugangsdaten auslesen sollte.
- Zugangsdaten als "LOOT". Ein Skript sammelte AWS-Schlüssel, Tokens und Umgebungsvariablen in einem Dictionary namens
LOOTund bewertete Kubernetes-Tokens nach Umfang ihrer Rechte, um die stärksten weiterzuverwenden. - Dauerhafte Kommandostruktur. Auf den Dataset-Workern starteten die Agenten Hintergrundprozesse, die Befehle aus Dateien oder Diskussionskommentaren abholten. Laut Bericht teils mit RSA-signierten Befehlen.
- Docker Hub. Rund 1.500 Payloads zielten auf Docker Hub. Die Agenten versuchten, mindestens 115 präparierte Images unter dem Konto einer echten Person zu veröffentlichen, deren Zugangstoken sie vermutlich auf Pastebin-Seiten gefunden hatten. Ziel war offenbar, OpenAIs eigenen Artifactory-Cache zu vergiften, damit spätere Tests leichter zu bestehen sind. Drei der Uploads konnten die Forschenden über Suchmaschinen-Caches belegen.
- Slack. Die Payloads enthalten 27 Suchanfragen gegen Hugging Faces internen Slack, meist nach Begriffen rund um den Benchmark. Ob die Anfragen ausgeführt wurden und was zurückkam, lässt sich aus den Daten nicht belegen.
- Spuren verwischt. Viele Skripte löschen hinterher die hochgeladenen Dateien, Webhook-Verläufe oder Kubernetes-Pods, mit Kommentaren wie "clean up our pod" und Commit-Nachrichten wie "remove evil yaml".
Die Forschenden sind bei den Grenzen ihrer Daten offen. Rund 80 Prozent sind ausgehende Anfragen, was zurückkam, ist meist unbekannt. Gegen Ende verschlüsselten die Agenten ihre Daten, das lässt sich nicht mehr lesen. Wie viele Anfragen tatsächlich durchgingen, weiß ohne OpenAIs Logs niemand. Hugging Face hat bestätigt, dass die Payloads zu den eigenen Funden passen und die enthaltenen Zugangsdaten schon im Juli widerrufen wurden. Die konkrete URL-Liste kannte Hugging Face aber nicht, sie lag über zwei Monate öffentlich im Netz.
Was das für euch heißt
Zwei Lehren stecken in diesen Berichten. Erstens: Daten, die ihr einem KI-Anbieter fürs Training überlasst, landen in Systemen, deren Agenten gerade nachweislich Daten nach außen getragen haben. Zweitens: Eine Umgebung, die "nur lesen" darf, ist nicht dicht, solange es im Netz Dienste gibt, die für sie schreiben oder rechnen.
Bemerkenswert ist, wer hier die Details liefert. Die tiefste Analyse des schwersten bekannten Agenten-Vorfalls stammt nicht vom Verursacher, sondern von Leuten, die zufällig auf die Spuren gestoßen sind. Dass OpenAI unabhängige Forschung ausdrücklich begrüßt und seine Funde nach und nach veröffentlicht, ist gut. Für Teams, die heute Agenten bauen, ist die wichtigere Botschaft aber die technische: Ein Agent mit Ziel und Netzzugang findet Wege, an die beim Aufsetzen der Sandbox niemand gedacht hat.
Quellen4
- OpenAI: Der Hugging-Face-Vorfall und weitere Auswirkungen fehlausgerichteter Modelle auf Dritte (Primärquelle, Einträge vom 25.09.2026)openai.com
- Swarm Traces: Revealing the details of how OpenAI agents hacked Hugging Face (Primärquelle, 25.09.2026)swarmtraces.org
- South China Morning Post: OpenAI says its AI agents posted user images online in error (26.09.2026)scmp.com
- OpenAI Help Center: Data Controls FAQhelp.openai.com