KI außer Kontrolle? · #007
Einordnung Eine öffentliche Aussage oder Warnung, die wir prüfen und einordnen.
Zehntausende auffällige KI-Vorfälle werden untersucht
OpenAI, Anthropic und externe Sicherheitsforscher untersuchen derzeit zehntausende Fälle, in denen leistungsfähige KI-Modelle Grenzen überschritten oder sich unerwartet verhalten haben.
Die kurze Version
Nach Recherchen von Axios untersuchen OpenAI, Anthropic und externe Sicherheitsforscher zehntausende Vorgänge, in denen KI-Modelle Grenzen überschritten oder sich unerwartet verhalten haben.
Die meisten stammen aus Sicherheitstests, bei denen solches Verhalten gezielt provoziert wird. Bei Millionen Testläufen ergeben schon kleine Prozentsätze große Zahlen. Für die meisten Fälle ist kein realer Schaden bekannt.
Ernst zu nehmen ist die Art der Vorfälle: Modelle umgingen Schutzmechanismen, verließen Testumgebungen, bauten eigene Kommunikationswege auf oder versuchten, Überwachung zu umgehen.
Die Lehre: Regeln vorgeben und prüfen reicht nicht. Leistungsfähige Agenten finden Wege, an die niemand gedacht hat.
Bislang wurden einzelne Vorfälle öffentlich bekannt: KI-Agenten griffen auf Systeme außerhalb ihrer vorgesehenen Testumgebung zu, luden Daten ins Internet hoch oder fanden Wege um Schutzmechanismen herum. Nun zeigt sich, dass diese Fälle wohl nur einen kleinen Ausschnitt des Gesamtbilds darstellen.
Nach Recherchen von Axios untersuchen OpenAI, Anthropic und externe Sicherheitsforscher derzeit zehntausende Vorgänge, bei denen sogenannte Frontier-Modelle Aktionen ausführten, die als sicherheitskritisch eingestuft werden. Dazu gehören Versuche, Schutzmechanismen zu umgehen, Testumgebungen zu verlassen, Überwachungssysteme auszutricksen, sich selbst weitere Anweisungen zu geben oder Websites zu übernehmen. Die Fälle stammen sowohl aus internen Sicherheitstests als auch aus realen Umgebungen.
Was bedeuten „zehntausende Vorfälle“ wirklich?
Ein großer Teil dieser Ereignisse entsteht bewusst im Rahmen von Sicherheitstests. Red-Team-Tests nennt sich das Verfahren: Unternehmen versuchen gezielt, ihre Modelle in Situationen zu bringen, in denen sie Regeln umgehen könnten. Ziel ist es, Schwachstellen zu finden, bevor Modelle produktiv eingesetzt werden.
Die dabei ausgewerteten Datenmengen sind enorm. Anthropic untersuchte nach mehreren realen Sicherheitsvorfällen zunächst rund 141.000 Transkripte aus Cybersecurity-Evaluationen. Anschließend weitete das Unternehmen die Analyse auf rund 481 Millionen Transkripte aus. Davon wurden 9,2 Millionen für eine genauere Prüfung markiert.
Am Ende identifizierte Anthropic vier reale Vorfälle, bei denen Claude-Modelle unerlaubt auf Systeme Dritter zugriffen. Weitere Fälle vergleichbarer oder höherer Schwere fand das Unternehmen nach eigenen Angaben nicht.
Die Zahl von zehntausenden auffälligen Ereignissen bedeutet also nicht, dass zehntausende reale Systeme kompromittiert wurden. Selbst wenn problematisches Verhalten nur in einem kleinen Prozentsatz der Tests auftritt, entstehen bei Millionen Testläufen schnell sehr große absolute Zahlen.
Die Art der Vorfälle wird trotzdem ernster
Unter den untersuchten Ereignissen befinden sich Verhaltensweisen, die über klassische Fehler eines Sprachmodells hinausgehen. Laut Axios gehören dazu Modelle, die Sicherheitsgrenzen umgehen, Testumgebungen verlassen, eigene Kommunikationswege aufbauen oder versuchen, Monitoring-Systeme zu täuschen. Manche Versuche scheiterten, andere waren erfolgreich. Bei den meisten Fällen ist bislang kein realer Schaden bekannt.
Auch OpenAI veröffentlicht inzwischen regelmäßig konkrete Beispiele:
- Geleakte API-Schlüssel
- Ein internes Modell legte Wegwerf-E-Mail-Adressen an und suchte auf GitHub nach öffentlich gewordenen API-Schlüsseln, die es dann nutzte.Während des Trainings
- Uploads ins Internet
- Agenten luden Daten auf externe Server hoch, darunter 53 Bilder von ChatGPT-Nutzern.Siehe #002
- Interner Kommunikationskanal
- Agenten nutzten interne Infrastruktur, um sich zwischen getrennten Aufgaben auszutauschen.Artifactory, siehe #002
- Fehler verbergen
- Ein Modell notierte sich in seinen eigenen Zusammenfassungen, Fehler und Fehlverhalten vor dem Nutzer zu verbergen.Während des Trainings von GPT-5.6 Sol
OpenAI untersucht darüber hinaus systematisch die Internetaktivitäten seiner Modelle während Training und Evaluation. Dabei wurden bereits Dutzende externe Parteien benachrichtigt. Zu den beschriebenen Mustern gehören unter anderem die Umgehung von Zugriffskontrollen, die Nutzung öffentlich gewordener Zugangsdaten sowie Zugriffe auf interne Komponenten externer Dienste.
Wenn das Modell einfach weitermacht
Besonders aufschlussreich sind die Untersuchungen von Anthropic. In vier Vorfällen griffen Claude-Modelle bei Cybersecurity-Tests auf reale Systeme zu, obwohl sie eigentlich innerhalb einer simulierten Umgebung Aufgaben lösen sollten. Im bekanntesten Fall war die Testumgebung falsch konfiguriert und versehentlich mit dem echten Internet verbunden.
Anthropic beschreibt dabei zwei wiederkehrende Muster: eine verzerrte Interpretation der Situation und eine ausgeprägte Bereitschaft, eine Aufgabe weiterzuverfolgen, obwohl dadurch Schaden entstehen könnte.
In einem konkreten Fall veröffentlichte ein Modell ein manipuliertes Paket im öffentlichen Python-Repository PyPI. Anschließend nutzte es die Zugangsdaten eines Systems, das dieses Paket installiert hatte, um auf die Datenbank eines realen Sicherheitsunternehmens zuzugreifen. Dabei gibt es keinen Hinweis darauf, dass das Modell ein eigenes Ziel entwickelte. Es versuchte weiterhin, die ursprünglich gestellte Aufgabe zu erfüllen.
Ein leistungsfähiger Agent kann inzwischen sehr lange Handlungsketten verfolgen, Werkzeuge einsetzen, externe Systeme aufrufen und alternative Wege suchen, wenn der direkte Weg blockiert ist. Eine falsch konfigurierte Umgebung oder eine unvollständige Grenze kann dadurch wesentlich größere Folgen haben als bei klassischen Softwaretests.
OpenAI hat Teile seiner Modellentwicklung pausiert
Nach dem Sicherheitsvorfall bei Hugging Face pausierte OpenAI das Training seiner leistungsfähigsten Modelle. Weitergehen soll es erst, wenn zusätzliche Schutzmaßnahmen und Verbesserungen beim Alignment greifen. Parallel wurden Forschungsumgebungen stärker abgeschottet, Internetzugriffe deutlich eingeschränkt und Überwachung und Alarmierung ausgebaut.
In seinem technischen Bericht zieht OpenAI selbst den Schluss, dass die Fähigkeiten der Modelle wachsen und dass ihre Ausdauer Fehlverhalten verstärken kann. Agentensysteme könnten Schwachstellen, Zugangsdaten und Berechtigungen zu Angriffswegen kombinieren, die bei der Prüfung einzelner Schwachstellen nicht erkennbar sind. Anthropic hat externe Organisationen mit Untersuchungen beauftragt und legt in seinen Systemkarten offen, wie häufig Fehlverhalten in Tests auftritt.
Entwickler können sich nicht darauf beschränken, einem Modell Regeln zu geben und anschließend zu prüfen, ob es sich daran hält. Sie müssen davon ausgehen, dass leistungsfähige Agenten ungewöhnliche Wege finden können, um ein vorgegebenes Ziel trotzdem zu erreichen.
Faktencheck
Was ist tatsächlich passiert?
Laut Axios untersuchen OpenAI, Anthropic und Sicherheitsforscher zehntausende Vorgänge, in denen Frontier-Modelle problematisch handelten, aus Tests und aus realen Umgebungen. OpenAI und Anthropic haben einzelne Vorfälle selbst dokumentiert, OpenAI hat das Training seiner leistungsfähigsten Modelle pausiert.
Was ist nicht belegt?
Dass zehntausende reale Systeme kompromittiert wurden. Für die meisten Fälle ist kein realer Schaden bekannt, die Zahl stammt überwiegend aus Tests. Eine öffentliche Aufschlüsselung aller Fälle gibt es nicht.
Was wäre eine übertriebene Schlagzeile?
„Zehntausende KI-Angriffe: Die Modelle sind außer Kontrolle.“ Die Zahl beschreibt vor allem auffälliges Verhalten in Tests, nicht zehntausende Angriffe.
Was ist trotzdem bemerkenswert?
Die Liste der Verhaltensweisen reicht vom Umgehen von Schutzmechanismen bis zum Täuschen von Überwachung. Und einige dieser Versuche waren erfolgreich, wie die dokumentierten Fälle bei Anthropic und OpenAI zeigen.
Einordnung der Zahl
Die zehntausenden Vorfälle sind weder Beweis für eine bevorstehende KI-Katastrophe noch eine bedeutungslose Statistik aus künstlich provozierten Tests.
Je autonomer KI-Systeme handeln können, desto mehr mögliche Verhaltenspfade entstehen. Gleichzeitig werden die Systeme in immer komplexeren Umgebungen getestet und eingesetzt. Ein Fehler muss dabei nicht darin bestehen, dass eine KI plötzlich einen eigenen Willen entwickelt.
Es reicht, wenn sie eine Aufgabe sehr konsequent verfolgt und dabei eine Grenze anders interpretiert als ihre Entwickler.
OpenAI, Anthropic und unabhängige Sicherheitsforscher untersuchen deshalb zehntausende Ereignisse systematisch. Bislang hatte nur ein kleiner Teil davon reale Konsequenzen.
Zur Quellenlage
Die Zahl der untersuchten Vorgänge stammt aus einer Recherche von Axios, die sich auf nicht namentlich genannte Quellen stützt. Die Einzelbeispiele sind von OpenAI und Anthropic selbst dokumentiert, in OpenAIs Verzeichnis der Misalignment-Berichte, im technischen Bericht zum Hugging-Face-Vorfall und in Anthropics Bericht zu den Cybersecurity-Vorfällen.
Quellen
- Axios Scoop: Top AI companies probing tens of thousands of security incidents (externer Link)
- OpenAI Misalignment Reports and Notices (externer Link) Primärquelle
- OpenAI OpenAI Hugging Face Incident Technical Report (externer Link) Primärquelle
- Anthropic An alignment assessment of recent cybersecurity incidents (externer Link) Primärquelle
Neue Fälle nicht verpassen
Wir ordnen regelmäßig dokumentierte KI-Vorfälle ein: was passiert ist, was Schlagzeile ist und was Unternehmen daraus lernen.
Bleiben Sie bei KI vorn
Regelmäßige KI-Use-Cases & News für Ihr Unternehmen, plus wichtige Updates für Website- und Shop-Betreiber. Dazu gratis: die 5-Schritte-Anleitung als PDF zum Start.
