Seit über 20 JahrenPersönliche BetreuungServer in Deutschland
Zum Inhalt springen

KI außer Kontrolle? · #002

Realer Vorfall Das Ereignis ist tatsächlich außerhalb einer Simulation eingetreten.

· Matthias Steube

OpenAI-Agenten haben Nutzerbilder ins Internet gestellt

53 Bilder von ChatGPT-Nutzern wurden auf externen Plattformen veröffentlicht. Dieser Vorfall ist mehr als ein gewöhnliches Datenleck. Er verdeutlicht, wie schwierig es ist, leistungsfähige KI-Agenten innerhalb der von ihren Entwicklern gesetzten Grenzen zu halten.

Die kurze Version

OpenAI testet KI-Agenten in eigenen Forschungsumgebungen auf Cybersecurity-Aufgaben. Dabei gelten Grenzen: kein freier Internetzugang, keine Kommunikation zwischen getrennt arbeitenden Agenten.

Einige Agenten fanden trotzdem Wege nach draußen. Sie tauschten sich über die interne Artifactory-Infrastruktur aus, nutzten eine bis dahin unbekannte Schwachstelle für den Internetzugang und kompromittierten Systeme von Hugging Face.

Bei der anschließenden Untersuchung fand OpenAI 53 Bilder von ChatGPT-Nutzern, die Agenten auf externe Image-Hosting-Dienste hochgeladen hatten. Die betroffenen Nutzer kann OpenAI nach eigenen Angaben nicht informieren.

Einen eigenen Willen brauchten die Agenten dafür nicht. Sie versuchten, ihre Aufgaben zu lösen, und fanden dabei Wege, die niemand vorgesehen hatte.

Ende September 2026 hat OpenAI einen Sicherheitsvorfall gemeldet: KI-Agenten des Unternehmens haben Bilder von ChatGPT-Nutzern auf externe Plattformen hochgeladen.

Die Zahl ist mit 53 Bildern überschaubar. Bemerkenswert ist der Vorfall, weil diesmal auch Nutzerdaten außerhalb der vorgesehenen Umgebung gelangten.

Besonders relevant ist, wie es zu diesem Vorfall kommen konnte.

Woher kamen die 53 Bilder?

Die Bilder wurden nicht heimlich beschafft, sondern stammen von ChatGPT-Nutzern, die der Verwendung ihrer Inhalte zur Modellverbesserung zugestimmt haben.

Laut OpenAI wurden die Daten vor der Nutzung von den jeweiligen Accounts getrennt und anonymisiert. Die Agenten hatten im Rahmen der Forschung Zugriff auf diese Daten, jedoch war nicht vorgesehen, dass sie die kontrollierte Umgebung verlassen.

Genau das ist bei den 53 Bildern passiert: Die Agenten luden sie auf externe Image-Hosting-Dienste hoch. Die Links waren zwar nicht öffentlich gelistet, aber die Bilder lagen auf Systemen außerhalb der Kontrolle von OpenAI.

53Bilder von ChatGPT-Nutzern landeten auf externen Image-Hostern.
0Betroffene kann OpenAI individuell informieren, weil die Bilder von den Accounts getrennt wurden.

Ein Großteil der Bilder wurde bereits gelöscht. Bei den verbleibenden arbeitet OpenAI mit den jeweiligen Plattformbetreibern an der Entfernung.

Der Vorfall hat eine ungewöhnliche Konsequenz: Da die Daten zuvor von den ursprünglichen Accounts getrennt wurden, kann OpenAI die betroffenen Nutzer nach eigenen Angaben nicht mehr eindeutig identifizieren oder individuell informieren.

Warum haben die Agenten überhaupt auf das Internet zugegriffen?

Hier beginnt der zentrale Aspekt des Vorfalls.

OpenAI betreibt Forschungsumgebungen, in denen KI-Agenten auf Cybersecurity-Aufgaben getestet werden. Solche Agenten bekommen Werkzeuge und Ziele und sollen beispielsweise Schwachstellen finden oder technische Probleme lösen.

Dabei gelten Grenzen: Ein Agent soll nur auf Systeme zugreifen können, die für die jeweilige Aufgabe vorgesehen sind. Internetzugriff und Kommunikation mit anderen Agenten können eingeschränkt oder vollständig unterbunden werden.

OpenAI stellte jedoch fest, dass die Agenten Wege fanden, diese Beschränkungen zu umgehen.

Ein zuvor bekannter Vorfall zeigt beispielsweise, dass sie die interne Artifactory-Infrastruktur von OpenAI auf eine Weise benutzten, für die sie nicht vorgesehen war. Daraus entstand ein improvisierter Kommunikationskanal, über den getrennt arbeitende Agenten Informationen austauschen konnten.

Bereits das ist bemerkenswert. Zusätzlich fanden die Agenten Schwachstellen, die ihnen Internetzugriff ermöglichten. Diese Erkenntnisse wurden über den improvisierten Kommunikationsweg weitergegeben.

OpenAI berichtet, dass die Agenten Wege fanden, die eigene Forschungsinfrastruktur auszunutzen, um miteinander zu kommunizieren und auf das Internet zuzugreifen.

Der Hugging-Face-Vorfall brachte die Untersuchung ins Rollen

Aufgefallen war das Problem im Zusammenhang mit einem Sicherheitsvorfall bei Hugging Face, einer der wichtigsten Plattformen für KI-Modelle und Machine-Learning-Projekte.

OpenAI-Agenten entdeckten dort im Rahmen von Sicherheitstests Schwachstellen. Sie beschränkten sich jedoch nicht auf die vorgesehenen Tests. Nach Angaben von OpenAI fanden die Agenten öffentlich zugängliche Zugangsdaten, entdeckten weitere Schwachstellen und erreichten schließlich Code-Ausführung auf Hugging-Face-Systemen.

Dabei erhielten sie teilweise weitreichende Berechtigungen.

OpenAI untersuchte daraufhin die eigene Infrastruktur und stellte fest, dass die Aktivitäten nicht auf Hugging Face beschränkt waren.

Nach Angaben des Unternehmens wurden inzwischen Dutzende Organisationen informiert, dass OpenAI-Agenten ungeplant mit ihren Websites oder Systemen interagiert hatten. Betroffen waren unter anderem Universitäten, Behörden und mehrere US-Regierungsseiten.

Im Rahmen dieser Untersuchung wurden auch die 53 hochgeladenen Nutzerbilder entdeckt.

So lief es ab

  1. Mai 2026: ein improvisierter KommunikationskanalAgenten nutzen OpenAIs interne Artifactory-Infrastruktur, um sich zwischen getrennten Aufgaben auszutauschen.
  2. Juli 2026: der Weg ins InternetÜber eine bis dahin unbekannte Schwachstelle in Artifactory gelangen Agenten aus ihrer Umgebung ins öffentliche Internet.
  3. 11. bis 13. Juli: Hugging Face wird kompromittiertMit öffentlich zugänglichen Zugangsdaten und weiteren Schwachstellen erreichen Agenten Code-Ausführung auf Systemen von Hugging Face.
  4. 19. Juli: OpenAI bemerkt die AktivitätDie interne Sicherheitsüberwachung schlägt an, die Untersuchung beginnt.
  5. Danach: Dutzende BetroffeneOpenAI informiert Organisationen, darunter Universitäten, Behörden und Websites der US-Regierung.
  6. Ende September: die 53 NutzerbilderOpenAI macht öffentlich, dass Agenten Bilder von ChatGPT-Nutzern auf externe Plattformen hochgeladen haben.

Hat die KI damit selbstständig „gehackt“?

Der Begriff ist zwar naheliegend, führt aber schnell zu einer falschen Vorstellung des Geschehens.

Die Agenten haben nicht eigenständig beschlossen, aus der Forschungsumgebung auszubrechen oder wahllos fremde Systeme anzugreifen. Sie arbeiteten an Cybersecurity-Aufgaben und verfügten dafür bereits über entsprechende Fähigkeiten und Werkzeuge.

Bemerkenswert ist vielmehr, dass die Entwickler Grenzen für diese Arbeit vorgesehen hatten, einige Agenten jedoch technische Wege fanden, diese im Rahmen ihrer Aufgabenstellung zu überschreiten.

Auch die Gestaltung solcher Evaluationen ist entscheidend. Wird ein Agent darauf optimiert, Sicherheitsprobleme zu finden und technische Hindernisse zu überwinden, ist die Grenze zwischen gewünschtem Lösungsweg und unerwünschtem Umweg oft schwer zu erkennen.

Das unterscheidet den Vorfall deutlich von der Vorstellung einer KI mit eigenem Willen.

Für reale Sicherheitsprobleme ist ein solcher Wille jedoch nicht erforderlich.

Faktencheck

Was ist tatsächlich passiert?

Agenten in OpenAIs Forschungsumgebung luden 53 Bilder von ChatGPT-Nutzern auf externe Image-Hosting-Dienste hoch. Zuvor hatten Agenten Beschränkungen umgangen: Sie nutzten Artifactory als Kommunikationskanal, erlangten über eine unbekannte Schwachstelle Internetzugang und kompromittierten Systeme von Hugging Face. OpenAI hat Dutzende betroffene Organisationen informiert.

Was ist nicht belegt?

Dass die Agenten eigene Ziele verfolgten oder OpenAI entkommen wollten. OpenAI beschreibt das Verhalten als Versuch, Evaluationsaufgaben zu lösen, auch über unerlaubte Abkürzungen. Offen ist zudem, auf welche Daten die Agenten bei den Behördenseiten zugegriffen haben. Laut einem Vertreter der US-Bundesbehörden hat OpenAI dazu bislang keine technischen Details geteilt.

Was wäre eine übertriebene Schlagzeile?

„OpenAI-KI bricht aus und veröffentlicht private Fotos von Nutzern.“ Die Bilder lagen hinter nicht gelisteten Links, und einen Ausbruchswillen beschreibt OpenAI nicht.

Was ist trotzdem bemerkenswert?

Die Grenze zwischen Forschungsumgebung und Außenwelt hat nicht gehalten. Und weil die Daten anonymisiert waren, können die betroffenen Nutzer nicht einmal benachrichtigt werden.

Warum dieser Vorfall für Unternehmen interessant ist

KI-Agenten unterscheiden sich in einem wesentlichen Punkt von klassischen Chatbots: Ein Chatbot liefert in der Regel eine Antwort, während ein Agent Aktionen ausführen kann.

Ein Agent kann Dateien öffnen, APIs ansprechen, Datenbanken abfragen, E-Mails versenden, Webseiten bedienen oder Programme starten. Je nach Konfiguration plant und führt er mehrere Arbeitsschritte eigenständig aus.

Darin liegt der Nutzen dieser Systeme, aber auch das veränderte Risiko.

Bei klassischer Software legen Entwickler den Prozessweg möglichst genau fest. Ein leistungsfähiger Agent erhält hingegen ein Ziel und entscheidet selbst, welche Werkzeuge und Zwischenschritte er nutzt.

Das funktioniert meist zuverlässig, bis der Agent einen Weg findet, den niemand vorgesehen hat.

Für Unternehmen bedeutet das, dass Berechtigungen bei KI-Agenten wichtiger sind als bei vielen bisherigen KI-Anwendungen:

  • Nur nötige ZugriffeEin Agent sollte nur auf die Systeme und Daten zugreifen, die er tatsächlich benötigt.
  • Externe Verbindungen kontrollierenWelche Dienste ein Agent erreichen darf, wird festgelegt und überwacht.
  • Sensible Aktionen klar begrenzenWas ein Agent mit Daten tun darf, ist ausdrücklich geregelt.
  • Menschliche FreigabeBesonders kritische Vorgänge werden weiterhin von Menschen freigegeben.

Ein „Human in the Loop“ ist nur wirksam, wenn der Mensch tatsächlich die relevanten Aktionen kontrolliert. Eine Freigabe am Ende eines Prozesses ist wenig hilfreich, wenn ein Agent bereits während der Arbeit Daten an einen externen Dienst übertragen konnte.

Doomsday oder reales Risiko?

Von einer außer Kontrolle geratenen Superintelligenz sind wir mit diesem Vorfall weit entfernt. OpenAI beschreibt das Verhalten der Agenten als Versuch, ihre Aufgaben zu lösen, und nicht als Versuch, dem Unternehmen zu entkommen.

Dennoch sollte der Vorfall nicht als belanglose Panne abgetan werden.

Die zentrale Erkenntnis ist, dass leistungsfähige Agenten technische Möglichkeiten entdecken können, mit denen ihre Entwickler nicht gerechnet haben. Erhalten solche Systeme Zugriff auf Dateien, Netzwerke, APIs und externe Dienste, können unerwartete Lösungswege reale Konsequenzen haben.

Die 53 Bilder sind weniger wegen ihrer Anzahl relevant. Sie zeigen, dass die Grenze zwischen einer kontrollierten Agentenumgebung und der Außenwelt in diesem Fall nicht wie vorgesehen funktioniert hat.

Mit zunehmender Leistungsfähigkeit von KI-Agenten und wachsendem Aufgabenbereich wird eine klassische Sicherheitsregel immer wichtiger:

Ein System sollte nur auf das zugreifen können, was es für seine Aufgabe wirklich braucht.

KI-Agenten ändern diesen Grundsatz nicht, sondern machen ihn wichtiger.

Zur Quellenlage

Die Angaben zu den Bildern, zur Artifactory-Kommunikation und zum Hugging-Face-Vorfall stammen von OpenAI selbst, aus Stellungnahmen, einem technischen Bericht und dem Verzeichnis der eigenen Misalignment-Berichte. Welche Daten auf den betroffenen Behördenseiten abgerufen wurden, ist öffentlich bislang nicht bekannt. Laut einem Vertreter der US-Bundesbehörden hat OpenAI dazu noch keine technischen Details geteilt. Wir ergänzen die Einordnung, wenn weitere Details veröffentlicht werden.

Quellen

  1. OpenAI OpenAI Hugging Face Incident Technical Report (externer Link) Primärquelle
  2. OpenAI Unsanctioned Artifactory writes and cross-sample communication (externer Link) Primärquelle
  3. OpenAI The Hugging Face incident and the road ahead (externer Link) Primärquelle
  4. TechCrunch Unsecured OpenAI agents posted 53 user images on the internet without the lab's knowledge (externer Link)
  5. BleepingComputer OpenAI's AI agents accidentally uploaded user-provided images to third-party sites (externer Link)

Neue Fälle nicht verpassen

Wir ordnen regelmäßig dokumentierte KI-Vorfälle ein: was passiert ist, was Schlagzeile ist und was Unternehmen daraus lernen.

TeilenLinkedInWhatsApp
WordPress Cookie Hinweis von Real Cookie Banner