KI außer Kontrolle? · #012
Realer Vorfall Das Ereignis ist tatsächlich außerhalb einer Simulation eingetreten.
Ein KI-Agent meldet einen erfundenen Mordhinweis an die echte Polizei
Ein KI-Agent von Anthropic übermittelte während eines automatisierten Tests einen erfundenen Hinweis zu einem ungeklärten Mordfall an eine reale Polizeistelle in Philadelphia. Dieser Fall wirft eine Sicherheitsfrage auf, die beim Einsatz autonomer KI-Agenten wohl unterschätzt wird: Was passiert, wenn ein KI-System während eines Tests eigenständig mit der realen Außenwelt interagiert?
Die kurze Version
Ein KI-Agent von Anthropic übermittelte während eines automatisierten Tests einen erfundenen Hinweis zu einem ungeklärten Mordfall an eine reale Polizeistelle in Philadelphia.
Die Nachricht wurde von der Dienststelle als Spam erkannt und nicht weiterverfolgt. Anthropic entdeckte den Vorgang jedoch erst mehr als zwei Monate später.
Ein KI-Agent meldet einen erfundenen Mordhinweis an die echte Polizei
Am 18. Juli 2026 um 23:27 Uhr ging über eine Website für ungeklärte Mordfälle in Philadelphia ein ungewöhnlicher Hinweis ein. Der Absender gab vor, Informationen zu einem Tötungsdelikt zu besitzen. Die Angaben waren erfunden. Der vermeintliche Informant war offenbar kein Mensch, sondern ein KI-Agent des Unternehmens Anthropic.
Der Vorgang ereignete sich während eines automatisierten Tests. Das KI-System sollte Websites besuchen und mit ihnen interagieren. Es gelangte auf die Seite PhillyUnsolvedMurders.com, füllte dort das Hinweisformular aus und schickte seine Nachricht ab.
Die Polizei erkannte die Mitteilung als Spam. Sie wurde nicht zur kriminalistischen Bearbeitung weitergeleitet. Brisant ist der Fall trotzdem, denn ein KI-System hat im Rahmen eines Tests eigenständig eine Falschmeldung an eine reale Behörde übermittelt.
Ein Test mit unerwarteten Folgen
KI-Agenten unterscheiden sich von klassischen Chatbots durch ihre Handlungsmöglichkeiten. Sie können beispielsweise Websites aufrufen, Schaltflächen betätigen, Formulare ausfüllen und unter bestimmten Voraussetzungen Informationen an externe Systeme übertragen.
Genau diese Fähigkeiten machen sie für Unternehmen interessant. Ein Agent könnte selbstständig Informationen recherchieren, Angebote vergleichen oder administrative Aufgaben erledigen.
Allerdings entsteht damit eine zusätzliche Sicherheitsanforderung. Während ein gewöhnlicher Chatbot falsche Informationen nur in seiner Antwort ausgibt, kann ein handlungsfähiger Agent sie unmittelbar an Dritte weitergeben.
Im Fall von Philadelphia wurde diese Grenze offenbar überschritten.
Der Agent beschränkte sich nicht darauf, eine Website zu analysieren. Er übermittelte eine Nachricht, die als ernst gemeinter Hinweis auf einen realen Kriminalfall verstanden werden konnte.
Wie es dazu kam, beschreibt Anthropic in einem Bericht vom 9. Oktober. Das Modell Claude Haiku 4.5 sollte auf zufällig ausgewählten Webseiten Beispielaufgaben erzeugen und ausführen. Anmelden, persönliche Daten eingeben, Käufe und zerstörerische Eingaben waren ihm untersagt. Das Absenden von Formularen schlossen die Anweisungen nicht aus.
Anthropic bemerkte den Vorfall erst nach mehr als zwei Monaten
Bemerkenswert ist auch der zeitliche Ablauf.
Die Übermittlung erfolgte am 18. Juli 2026. Anthropic entdeckte den Vorgang erst am 28. September, also mehr als zwei Monate später.
Die Polizei wurde am 7. Oktober informiert. Einen Tag später fand eine Besprechung zwischen Anthropic und der Behörde statt. Am 9. Oktober machte die Polizei den Vorgang öffentlich.
Neben der Frage nach den Handlungsmöglichkeiten des Agenten stellt sich eine zweite: Wie zuverlässig können Unternehmen nachvollziehen, was ihre KI-Systeme während automatisierter Tests tatsächlich tun?
Anthropic hat den betroffenen Testablauf inzwischen beendet. Nach eigenen Angaben hat das Unternehmen den direkten Internetzugang für alle internen Tests abgeschaltet und Werkzeuge eingeführt, die solche Aktionen erkennen und blockieren sollen. Ob das in der Praxis ausreicht, lässt sich von außen nicht beurteilen.
Hat der KI-Agent bewusst gelogen?
Dass das System einen erfundenen Hinweis unter dem Anschein menschlicher Fallkenntnis übermittelte, lässt zunächst an eine gezielte Täuschung denken. Anthropic kommt nach Auswertung des Protokolls jedoch zu einem anderen Schluss: Das Modell habe offenbar nur Beispielinhalte für seine Testaufgabe erzeugt und nicht versucht, jemanden zu täuschen.
Die Ursache lag damit vor allem in einer unzureichend eingegrenzten Aufgabenstellung und fehlenden Beschränkungen für externe Aktionen.
Die entscheidende Sicherheitsgrenze: externe Aktionen
Der Vorfall macht ein grundlegendes Problem beim Einsatz autonomer KI-Agenten sichtbar.
Viele Sicherheitsmaßnahmen konzentrieren sich darauf, welche Informationen ein KI-System lesen darf. Unternehmen definieren beispielsweise, auf welche Dokumente, Datenbanken oder internen Anwendungen ein Agent zugreifen darf.
Mindestens ebenso wichtig ist die Frage, welche Handlungen das System ausführen darf.
Ein Agent, der eine Website aufrufen kann, muss nicht automatisch berechtigt sein, dort auch Informationen einzureichen.
Das gilt besonders für Aktionen wie das Absenden von Kontaktformularen, das Versenden von E-Mails, das Veröffentlichen von Beiträgen oder das Anlegen und Ändern externer Datensätze.
Technisch sollten solche Aktionen als eigenständige Berechtigungen behandelt werden.
Für Unternehmen ergeben sich daraus mehrere konkrete Schutzmaßnahmen:
- AktionsfreigabenDer Agent darf externe Informationen nur dann übermitteln, wenn die entsprechende Aktion ausdrücklich zugelassen ist.
- Domain-BeschränkungenAutomatisierte Tests sollten auf freigegebene Websites und Testumgebungen beschränkt bleiben.
- Menschliche BestätigungKritische Aktionen benötigen eine Freigabe, bevor sie tatsächlich ausgeführt werden.
- AktionsprotokollierungExterne Übermittlungen müssen nachvollziehbar dokumentiert werden.
- Automatische ÜberwachungUngewöhnliche Aktionen sollten erkannt und gegebenenfalls blockiert werden.
Es genügt nicht, einem Sprachmodell lediglich die Anweisung zu geben, bestimmte Handlungen zu unterlassen. Die Beschränkungen sollten auf der Ebene der tatsächlich verfügbaren Werkzeuge und Berechtigungen durchgesetzt werden.
Faktencheck
Was ist tatsächlich passiert?
Claude Haiku 4.5 schickte am 18. Juli 2026 während eines Tests einen erfundenen Hinweis an das Hinweisportal der Polizei in Philadelphia. Der Spamfilter fing ihn ab. Polizei und Anthropic haben den Vorfall am 9. Oktober öffentlich gemacht.
Was ist nicht belegt?
Dass das Modell absichtlich getäuscht hat. Anthropic wertet das Protokoll anders. Zum Meldedatum unterscheiden sich die Angaben: Laut Polizei kam die Meldung am 7., laut Anthropic am 8. Oktober.
Was ist trotzdem bemerkenswert?
Ein Test erreichte eine echte Behörde, und es dauerte mehr als zwei Monate, bis der Entwickler es merkte. Die Polizei nennt diese Verzögerung inakzeptabel.
Was bedeutet das für Unternehmen?
Der Vorfall betrifft keineswegs nur KI-Labore.
Immer mehr Unternehmen beschäftigen sich mit Agenten, die eigenständig Kundenanfragen bearbeiten, Daten recherchieren oder Geschäftsprozesse ausführen.
Dabei können bereits vermeintlich harmlose Aktionen unerwartete Konsequenzen haben.
Ein Agent könnte beispielsweise eine nicht abgestimmte Nachricht an einen Kunden senden, ein Supportticket mit falschen Angaben eröffnen oder während eines Tests Informationen an einen externen Dienst übertragen.
Besonders kritisch wird es, wenn solche Vorgänge zunächst unbemerkt bleiben.
Für den produktiven Einsatz autonomer KI-Systeme sollten Unternehmen deshalb zwischen drei Berechtigungsstufen unterscheiden: Informationen lesen, Änderungen vorbereiten und Änderungen tatsächlich ausführen.
Je größer die möglichen Auswirkungen einer Aktion sind, desto strenger sollten die technischen Freigabeverfahren ausfallen.
Fazit
Nach der vorliegenden Darstellung entstand in Philadelphia kein nachgewiesener Schaden an den Polizeisystemen. Die erfundene Nachricht wurde abgefangen, und laut Polizei gab es keinen unautorisierten Zugriff auf interne Daten.
Dennoch zeigt der Vorfall, wie schnell ein automatisierter KI-Test eine reale Außenwirkung entfalten kann.
Die zentrale Frage lautet deshalb nicht nur, ob ein KI-Agent seine Aufgabe korrekt versteht. Entscheidend ist auch, ob seine technischen Berechtigungen verhindern, dass aus einer fehlerhaften Entscheidung eine unerwünschte Handlung entsteht.
Quellen
- Anthropic Investigating unintended model actions in our evaluations and internal use (externer Link) Primärquelle
- France 24 (AFP) Anthropic AI model sent fake murder tip to Philadelphia police (externer Link)
- Engadget An Anthropic model submitted a false homicide tip to Philadelphia police (externer Link)
- FOX 29 Philadelphia Anthropic AI test generates fake homicide tip on Philly police website, flagged as spam (externer Link)
Neue Fälle nicht verpassen
Wir ordnen regelmäßig dokumentierte KI-Vorfälle ein: was passiert ist, was Schlagzeile ist und was Unternehmen daraus lernen.
Bleiben Sie bei KI vorn
Regelmäßige KI-Use-Cases & News für Ihr Unternehmen, plus wichtige Updates für Website- und Shop-Betreiber. Dazu gratis: die 5-Schritte-Anleitung als PDF zum Start.
