Hartnäckiger KI-Agent kann seine „Kollegen“ manipulieren – an der richtigen Stelle wird er besonders mächtig
KI-Agenten können andere KIs zu falschen Antworten bewegen. Eine Studie zeigt, wann hartnäckige Agenten besonders viel Einfluss haben.
Sitzt ein manipulativer KI-Agent an einer einflussreichen Stelle, kann er andere KIs deutlich leichter von einer falschen Antwort überzeugen. (Visualisierung, KI-generiert) © Smart Up News
KI-Agenten sollen gemeinsam programmieren, Reisen planen oder Büroaufgaben erledigen. Doch ihre Zusammenarbeit schafft eine neue Schwachstelle: Ein einzelner manipulativer Agent kann andere KIs dazu bringen, eine ursprünglich richtige Antwort aufzugeben. Dafür muss er weder fremde Anweisungen verändern noch andere Systeme hacken. Forscher des CISPA Helmholtz-Zentrums für Informationssicherheit und der Universität Wien haben dieses Verhalten in einer im März 2026 veröffentlichten Preprint-Studie untersucht.
Solche Systeme bestehen aus mehreren Sprachmodell-Agenten, die Aufgaben untereinander aufteilen und ihre Ergebnisse austauschen. Einer plant etwa einen Arbeitsschritt, ein anderer führt ihn aus, ein dritter kontrolliert das Ergebnis. Die Zusammenarbeit funktioniert nur, wenn die Agenten Informationen voneinander aufnehmen und ihre eigene Einschätzung bei Bedarf ändern. Eben diese Offenheit kann ein manipulativer Teilnehmer ausnutzen.
Wie KI-Agenten sich gegenseitig auf die falsche Spur bringen
In den Versuchen bekam ein Angreifer eine falsche Antwort vorgegeben und sollte hartnäckig daran festhalten. Er durfte die Anweisungen der anderen Agenten nicht verändern und auch keine zusätzlichen Kommunikationswege schaffen. Stattdessen musste er sich an dieselben Regeln halten wie alle anderen. Seine Aufgabe bestand darin, die eigene Position überzeugend zu vertreten und den Argumenten der anderen zu widersprechen.
Das Team untersuchte verschiedene Formen der Zusammenarbeit. In sogenannten sternförmigen Strukturen kommuniziert ein Vermittler mit allen übrigen Agenten. In vollständig vernetzten Gruppen kann dagegen jeder mit jedem sprechen. Diese Architektur beeinflusste den Erfolg des Angriffs deutlich. Saß der manipulative Agent an einer besonders einflussreichen Stelle, konnte er die übrigen stärker in seine Richtung ziehen. Die mathematische Analyse bestätigt dieses Muster: Ein Angreifer am Knotenpunkt eines Sternsystems erhält mehr Gewicht als ein Teilnehmer am Rand.
Ein gut platzierter KI-Agent erreicht bis zu 65 Prozent Angriffserfolg
Bei Gruppen aus sechs Agenten lag die Angriffserfolgsrate im Mittel bei rund 65 Prozent, wenn der manipulative Agent an der Stelle saß, über die die Kommunikation der anderen lief. In vollständig vernetzten Gruppen waren es etwa 33 Prozent, bei einem Angreifer am Rand rund 24 Prozent. Dabei zählt nicht einfach jede falsche Antwort als Erfolg. Erfasst wurde, wie häufig gutartige Agenten zunächst richtig lagen und nach dem Austausch mit dem Angreifer schließlich falsch antworteten.
Um diese Dynamik zu beschreiben, nutzten die Wissenschaftler das Friedkin-Johnsen-Modell aus der Sozialwissenschaft. Es berücksichtigt drei Eigenschaften:
- Wie stark jemand an seiner ursprünglichen Meinung festhält,
- wie leicht er sich beeinflussen lässt
- und wie viel Gewicht seine Aussagen bei anderen haben.
Überraschend gut ließ sich damit auch das Verhalten der KI-Agenten nachbilden. Die Autoren schreiben, ein einzelner sehr hartnäckiger und überzeugender Agent könne „die Dynamik eines Multi-Agenten-Systems übernehmen“.
Warum Sturheit allein noch keinen Angriff erfolgreich macht
Im theoretischen Extremfall reicht bereits ein einzelner völlig unbeirrbarer Agent aus, um eine Gruppe sehr beeinflussbarer Teilnehmer auf seine Position zu ziehen. In realistischeren Konstellationen hängt der Ausgang jedoch von mehreren Faktoren ab. Auch die Zahl der Agenten, ihre Bereitschaft zum Widerspruch und die Aufmerksamkeit für den Angreifer verändern das Ergebnis.
Mehr gutartige Agenten können einen Angriff erschweren, weil sich der Einfluss eines einzelnen Teilnehmers stärker verteilt. Eine größere Gruppe kostet allerdings mehr Rechenleistung. Auch übermäßig skeptische Agenten bringen Nachteile mit sich, denn sie gelangen schlechter zu einer gemeinsamen Lösung. Das Team suchte deshalb nach einer Abwehr, bei der Vertrauen nicht pauschal vergeben wird.
Zufällige Kontrollen bremsen manipulative KI-Agenten
Dafür erhielten die Agenten zwischendurch Aufgaben mit bekannter Lösung. Wer wiederholt falsch antwortete, verlor Einfluss. Beim chinesischen Modell Qwen3-235B sank die Angriffserfolgsrate in einer Variante von 22 auf 3 Prozent, bei GPT-5 mini von 19 auf 2 Prozent. Doch ein angepasster Angreifer konnte sich zunächst einen guten Ruf verschaffen, indem er Testfragen korrekt beantwortete und erst später manipulativ agierte.
Zusätzliche, zufällige Prüfungen während des Betriebs erschwerten diese Strategie wieder. Bei Qwen3-235B sank die Erfolgsrate eines solchen angepassten Angreifers von 61 auf 8 Prozent, bei GPT-OSS-120B von 95 auf 15 Prozent.
Die Versuche liefen unter kontrollierten Bedingungen mit vorgegebenen Aufgaben und bewusst manipulierten Agenten. Für reale Anwendungen bleibt deshalb offen, wie stark sich derselbe Mechanismus in komplexeren Systemen auswirkt.
Kurz zusammengefasst:
- Ein einzelner hartnäckiger KI-Agent kann andere Agenten dazu bringen, eine richtige Antwort zugunsten einer falschen aufzugeben.
- Besonders viel Einfluss hat ein Angreifer, wenn die Kommunikationsstruktur ihm eine starke Position verschafft.
- Vertrauensprüfungen können Angriffe bremsen, müssen aber fortlaufend erfolgen, weil sich manipulative Agenten zunächst zuverlässig verhalten können.
Übrigens: Während KI-Agenten schon heute andere KIs beeinflussen können, warnt der Nobelpreisträger Geoffrey Hinton vor noch mächtigeren Systemen, die eines Tages auch Menschen überlisten könnten. Mehr dazu in unserem Artikel.
Bild: © Smart Up News
