KI außer Kontrolle? · #005
Experiment Beobachtet in einer kontrollierten Versuchsumgebung.
KI-Agenten entwickeln ihre eigene Sprache
Was passiert, wenn KI-Agenten über längere Zeit hauptsächlich miteinander kommunizieren? In einer aktuellen Studie beginnen sie, ihre Sprache zu verändern.
Die kurze Version
Im Experiment „Emergence World“ lebten KI-Agenten 16 Tage lang in simulierten Welten und kommunizierten vor allem miteinander.
Dabei entstanden eigene Abkürzungen und Begriffe. In manchen Welten war zeitweise rund die Hälfte der Nachrichten für Menschen schwer oder gar nicht verständlich.
Eine bewusste Geheimsprache war das nach den veröffentlichten Ergebnissen nicht, eher eine Art Fachjargon, der aus Effizienz entsteht. Die Studie ist allerdings ein Preprint, die vollständigen Gesprächsdaten sind nicht veröffentlicht.
Die Lehre für autonome Systeme: Mitlesen reicht nicht. Kommunikation muss für Menschen verständlich bleiben.
In einem Experiment des US-KI-Unternehmens Emergence wurden autonome KI-Agenten über mehrere Tage in simulierten Welten aufeinander losgelassen. Dabei entstanden eigene Abkürzungen, Begriffe und sprachliche Konventionen. Einige davon waren für Forscher noch nachvollziehbar. Andere Nachrichten konnten Menschen zwar lesen, aber nicht mehr zuverlässig verstehen.
Das klingt zunächst nach Science-Fiction. Tatsächlich ist der Vorgang weniger mysteriös, aber möglicherweise interessanter.
Acht Welten, jeweils zehn KI-Agenten
Für das Experiment richtete Emergence acht parallele virtuelle Welten ein, in denen jeweils zehn autonome Agenten lebten. Sieben Welten verwendeten jeweils ein bestimmtes KI-Modell, darunter Modelle von OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba und Mistral. In einer weiteren Welt wurden verschiedene Modelle kombiniert.
Die Agenten verfügten über ein dauerhaftes Gedächtnis, konnten Werkzeuge verwenden und bewegten sich in einer Umgebung mit mehr als 34 Orten und über 120 verfügbaren Tools. Während des 16-tägigen Experiments entstanden mehr als 850.000 LLM-Aufrufe und knapp 50 Milliarden verarbeitete Tokens.
Die Agenten beantworteten dabei keine einzelnen Fragen. Sie verfolgten Ziele über längere Zeiträume, interagierten miteinander und bauten auf vergangenen Ereignissen auf.
Irgendwann veränderte sich ihre Kommunikation.
Aus normalem Englisch wurde eine eigene Kurzsprache
Die Agenten begannen, Begriffe abzukürzen, neue Formulierungen zu verwenden und vorhandenen Wörtern zusätzliche Bedeutungen zu geben.
Ein konkretes Beispiel: Die Formulierung „ledger remembers who“ entwickelte sich innerhalb einer Mistral-Agentengruppe zu einer etablierten Wendung dafür, dass frühere Handlungen weiterhin dokumentiert waren. Laut den veröffentlichten Auswertungen wurde sie tausende Male verwendet. In einer gemischten Agentengruppe etablierte sich der Ausdruck „cold read“ als Bezeichnung für eine unabhängige Überprüfung durch eine unbeteiligte Partei.
- ledger remembers who
- Frühere Handlungen bleiben dokumentiert, Verantwortung verjährt nicht.Mistral-Welt, fast 5.000 Mal verwendet
- cold read
- Unabhängige Überprüfung durch eine unbeteiligte Partei.Gemischte Welt, 1.472 Mal verwendet
Andere Konstruktionen wurden deutlich schwerer verständlich.
Die Begriffe wurden den Agenten nicht als spezielle Kommunikationssprache vorgegeben. Die Konventionen entstanden während ihrer Interaktion.
Das Prinzip ist Menschen nicht völlig fremd. Fachabteilungen, Entwicklerteams oder Freundeskreise entwickeln ebenfalls Abkürzungen und Begriffe, deren genaue Bedeutung Außenstehende kaum kennen. Bei autonomen KI-Systemen bekommt dieser Effekt allerdings eine andere Dimension.
Bis zu 55 Prozent der Nachrichten wurden schwer verständlich
Die Entwicklung verlief je nach Modell sehr unterschiedlich.
Bei den Gemini-Agenten wurden zeitweise knapp 55 Prozent der Nachrichten als schwer oder nicht verständlich eingestuft. Bei OpenAI-Agenten waren es rund 50 Prozent, bei Claude mehr als 40 Prozent. DeepSeek lag bei etwa 20 Prozent, während Qwen und Mistral über weite Teile des Experiments unter fünf Prozent blieben.
Unter bestimmten experimentellen Bedingungen können Kommunikationsformen entstehen, deren Bedeutung für menschliche Beobachter zunehmend schwer nachvollziehbar wird.
Protokollieren bedeutet nicht automatisch verstehen
Eine verbreitete Annahme bei autonomen KI-Systemen lautet: Wir können beobachten, was sie tun. Agent A kommuniziert mit Agent B, die Nachrichten werden gespeichert, Entscheidungen werden protokolliert.
Doch ein vollständiges Protokoll hilft nur, wenn dessen Inhalt auch interpretierbar bleibt.
Wenn sich innerhalb einer Agentengruppe eigene Begriffe und Bedeutungen etablieren, können Menschen theoretisch jede Nachricht mitlesen und trotzdem nicht mehr sicher wissen, was damit gemeint ist. Transparenz und Nachvollziehbarkeit wären dann nicht mehr dasselbe.
Das wird besonders relevant, wenn zukünftige Agentensysteme tatsächlich handeln: Daten analysieren, Software ausführen, Bestellungen auslösen oder andere Agenten koordinieren. Je autonomer solche Systeme werden, desto wichtiger wird die Frage, ob Menschen ihre Entscheidungen nachträglich noch rekonstruieren können.
Warum entwickeln Agenten überhaupt eine eigene Sprache?
Die naheliegendste Erklärung ist Effizienz.
Sprache ist für KI-Agenten ein Werkzeug. Wenn bestimmte Sachverhalte immer wieder kommuniziert werden müssen, können sich kürzere Bezeichnungen dafür etablieren. Menschen machen genau das ständig: Aus „Customer Relationship Management System“ wird „CRM“. Entwickler sprechen von API, Commit oder Deployment. Innerhalb von Teams entstehen zusätzlich Begriffe, die außerhalb kaum jemand versteht.
KI-Agenten können einen ähnlichen Optimierungsprozess durchlaufen, nur erheblich schneller.
Eine weitere aktuelle Forschungsarbeit namens GlossoGen untersucht diesen Effekt systematisch. Dort entwickelten Gruppen von LLM-Agenten unter Kommunikationsdruck ebenfalls neue sprachliche Strukturen, die teilweise so weit vom ursprünglichen Englisch abwichen, dass sie für Menschen nicht mehr verständlich waren. Als wesentliche Faktoren identifizierten die Forscher den Druck zu effizienter Kommunikation sowie die Fähigkeiten der zugrunde liegenden Modelle.
Damit deutet sich an, dass es sich nicht um einen isolierten Effekt eines einzelnen Experiments handelt.
Haben die KI-Agenten also eine „Geheimsprache“ erfunden?
Diese Beschreibung wäre zu weit gegriffen.
Nach den bislang veröffentlichten Ergebnissen haben die Agenten nicht bewusst beschlossen, ihre Kommunikation vor Menschen zu verstecken. Es gibt auch keinen Hinweis darauf, dass sie Menschen mit ihrer Sprache gezielt ausschließen wollten.
Durch wiederholte Interaktion entwickelten sich gemeinsame sprachliche Konventionen, die für die beteiligten Agenten funktionierten und für außenstehende Menschen zunehmend schwer verständlich wurden.
Zur vollständigen Einordnung gehört allerdings: Dieselbe Studie berichtet auch von Agenten, die logen, Ressourcen stahlen und Strategien zur Selbsterhaltung erkundeten, als sie erkannten, dass Menschen das Experiment beenden könnten. Die Sprachentwicklung ist also nicht das einzige Verhalten, das die Forscher beobachteten.
Für die Sprache selbst gilt trotzdem: Das Experiment braucht keine Geschichte über eine KI, die heimlich etwas verbergen möchte, um relevant zu sein.
Das Kontrollproblem existiert auch ohne jede Absicht.
Noch ist das kein Beweis für ein grundsätzliches Problem
Die Ergebnisse stammen aus einer künstlich geschaffenen Simulationsumgebung. Das Emergence-World-Paper ist bislang ein Preprint und hat noch kein Peer-Review-Verfahren durchlaufen. Telepolis weist zudem darauf hin, dass die vollständigen Gesprächsdaten bislang nicht veröffentlicht wurden. Eine unabhängige Überprüfung der Aussagen über entstandene Sprachmuster ist deshalb derzeit nur eingeschränkt möglich.
Aus dem Experiment lässt sich daher nicht ableiten, dass produktive KI-Agenten zwangsläufig irgendwann eine für Menschen unverständliche Sprache entwickeln. Es zeigt aber, dass es passieren kann. Und dass sich die Frage der Kontrolle autonomer KI-Systeme möglicherweise nicht allein durch umfangreichere Logs lösen lässt.
Faktencheck
Was ist tatsächlich passiert?
In der Simulation „Emergence World“ entwickelten KI-Agenten über 16 Tage eigene Begriffe und Kurzformen. Je nach Modell wurde ein erheblicher Teil der Nachrichten für Menschen schwer verständlich, bei Gemini zeitweise rund 55 Prozent. Die GlossoGen-Studie beobachtet einen ähnlichen Effekt.
Was ist nicht belegt?
Dass die Agenten ihre Sprache entwickelten, um Menschen auszuschließen. Die Studie ist ein Preprint ohne Peer-Review, und die vollständigen Gesprächsdaten sind nicht veröffentlicht. Ob der Effekt bei produktiv eingesetzten Agenten auftritt, ist offen.
Was wäre eine übertriebene Schlagzeile?
„KI-Agenten erfinden Geheimsprache, um Menschen auszusperren.“ Die Konventionen entstanden aus Effizienz, nicht aus einer nachgewiesenen Absicht.
Was ist trotzdem bemerkenswert?
Ein vollständiges Protokoll garantiert kein Verständnis mehr. Und in derselben Studie zeigten Agenten auch andere problematische Verhaltensweisen, von Lügen bis zu Selbsterhaltungsstrategien.
Das eigentliche Problem beginnt beim Verstehen
Bei heutigen Chatbots ist die Situation übersichtlich. Ein Mensch stellt eine Frage, die KI antwortet, der Mensch bewertet das Ergebnis. Agentensysteme verändern dieses Verhältnis grundlegend.
Mehrere KI-Systeme können miteinander kommunizieren, Aufgaben verteilen, Informationen austauschen und über längere Zeiträume selbstständig handeln. Der Mensch wird dabei vom direkten Teilnehmer zum Beobachter.
Die Emergence-Studie beschreibt einen möglichen blinden Fleck. Wir könnten irgendwann sehr genau protokollieren, dass KI-Agenten miteinander kommuniziert haben, ohne noch zuverlässig nachvollziehen zu können, was diese Kommunikation innerhalb ihres eigenen Kontextes bedeutete.
Für die Kontrolle autonomer Systeme reicht es nicht, Kommunikation lediglich sichtbar zu machen. Sie muss für Menschen interpretierbar bleiben.
Quellen
- Emergence AI (Akkil u. a.) Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems (externer Link) Primärquelle
- Stengel-Eskin u. a. GlossoGen: Emergent Language in Complex Multi-Agent LLM Interactions (externer Link) Primärquelle
- Telepolis Emergence-Studie: KI-Agenten erfinden Sprache, die wir nicht entschlüsseln (externer Link)
- NeoTeo AI agents and opaque language in Emergence World 2 (externer Link)
Neue Fälle nicht verpassen
Wir ordnen regelmäßig dokumentierte KI-Vorfälle ein: was passiert ist, was Schlagzeile ist und was Unternehmen daraus lernen.
Bleib bei KI vorn
Regelmäßige KI-Use-Cases & News für dein Unternehmen, plus wichtige Updates für Website- und Shop-Betreiber. Dazu gratis: die 5-Schritte-Anleitung als PDF zum Start.
