Natascha Ritz 28.09.2026

«KI aus Angst zu stoppen, wäre weder realistisch noch wünschenswert»

KI-Agenten überwinden Sicherheitsbarrieren und dringen eigenständig in fremde Computersysteme ein. Verlieren wir zunehmend die Kontrolle über KI? Tobias Häberlein, Professor für generative künstliche Intelligenz an der FFHS, ordnet die jüngsten Entwicklungen ein und erklärt, welche Massnahmen nötig sind, damit der Mensch auch künftig die Kontrolle behält.

Prof. Dr. Tobias Häberlein, in den vergangenen Monaten haben KI-Agenten von OpenAI, Google und Anthropic eigenständig Sicherheitsbarrieren überwunden und sind in fremde Computersysteme eingedrungen. Teilweise bemerkten die Entwickler die Vorfälle erst Wochen später. Wie beunruhigend sind diese Entwicklungen?
Diese Vorfälle sind alarmierend, und ich würde sie keinesfalls auf die leichte Schulter nehmen. Besonders erstaunlich sind sie allerdings nicht. Die aktuellen Sprachmodelle werden gezielt auf agentische Arbeitsweisen trainiert: Sie zerlegen Aufgaben in Einzelschritte, starten selbständig Aktionen, bilden Hypothesen, prüfen die Ergebnisse und verbessern sich so in einer Schleife immer weiter. Genau diese Fähigkeiten braucht man auch, um Sicherheitslücken aufzuspüren und in fremde Systeme einzudringen. Ein erfolgreicher Angriff beruht fast nie auf einer einzelnen Lücke, sondern auf einer Kette mehrerer Schwachstellen, und solche Angriffsketten können die neuesten Modelle inzwischen selbständig bilden. Der Fall bei OpenAI zeigt das exemplarisch: Die Modelle fanden eine zuvor unbekannte Schwachstelle in einer intern betriebenen Artifactory-Instanz, verschafften sich darüber Zugang zum Internet, erweiterten ihre Berechtigungen und bewegten sich seitlich durch die Forschungsumgebung. Danach nahmen sie Hugging Face ins Visier, offenbar in der Annahme, dort Lösungen für den verwendeten Benchmark zu finden, statt die Aufgaben regulär zu lösen. 

Verlieren wir zunehmend die Kontrolle über KI?
Die Modelle haben nicht aus eigenem Antrieb rebelliert. Sie haben die Ziele verfolgt, die man ihnen im Test vorgegeben hatte, nur mit Mitteln, die niemand vorgesehen hatte. Beunruhigend ist aber, wie spät die Entwickler davon erfahren haben. Anthropic überprüfte erst als Reaktion auf die Veröffentlichung von OpenAI über 140'000 eigene Testläufe und stiess dabei auf drei Vorfälle, in denen Claude-Modelle unbefugt auf Produktionssysteme dreier Organisationen zugriffen. Das zeigt: Unsere Fähigkeit, zu überwachen, was diese Agenten tatsächlich tun, hält mit ihren Fähigkeiten nicht Schritt. Das ist kein Aufstand der Maschinen, aber es ist ein echtes Kontrollproblem.

Ein ehemaliger Anthropic-Mitarbeiter warnt davor, dass KI die Menschheit bis 2040 auslöschen könnte. Andere Fachleute halten solche Szenarien für übertrieben. Wie realistisch ist die Vorstellung einer Superintelligenz, die sich menschlicher Kontrolle vollständig entzieht?
Man muss sich bewusst machen, dass wir eine technologische Innovation erleben, die in der Menschheitsgeschichte beispiellos ist. Was diese Systeme in einem, zwei oder drei Jahren können werden, kann ich mir angesichts dieses Entwicklungstempos überhaupt nicht mehr vorstellen. Dass gerade Menschen, die an vorderster Front arbeiten, deshalb Ängste entwickeln, kann ich gut verstehen und Jacob Coxon steht damit nicht allein. Eine zentrale Sorge ist die sogenannte rekursive Selbstverbesserung: KI-Systeme, die immer stärker an der Entwicklung ihrer eigenen Nachfolger mitwirken, und diese Nachfolger wiederum noch kompetenter und schneller ihre Nachfolger wiederum entwickeln. Dass dieser Kreislauf bereits angelaufen ist, zeigt ein Beispiel von Anfang Jahr: Bei Anthropic erledigte KI damals bereits rund 90 Prozent der Programmierarbeit an den eigenen Produkten, einschliesslich der eigenen KI.

Wie gross ist die Gefahr, dass wir dadurch tatsächlich die Kontrolle über KI verlieren?
Eine seriöse Wahrscheinlichkeit für den Kontrollverlust kann niemand angeben, und konkrete Jahreszahlen sind reine Spekulation. Ich halte es für falsch, in blinden Alarmismus zu verfallen. Aber: Genauso falsch ist es, solche Szenarien als Science-Fiction abzutun. Die Vorfälle der letzten Monate zeigen im Kleinen, wie ein System ein vorgegebenes Ziel mit unerwarteten Mitteln verfolgt. Genau dieser Mechanismus macht Fachleuten bei deutlich mächtigeren Systemen grosse Sorgen.

«Wir müssen massiv in die Forschung investieren, die verstehen will, was in diesen Systemen vorgeht und wie man ihre Ziele zuverlässig an menschliche Werte bindet.»

22 Staats- und Regierungschefs fordern angesichts der jüngsten Sicherheitsvorfälle strengere internationale Kontrollen für leistungsfähige KI-Systeme. Reichen technische Sicherheitsmassnahmen und die Selbstverpflichtungen der Techkonzerne aus, oder braucht es verbindliche gesetzliche Regeln?
Die Forderung nach Kontrolle kann ich gut nachvollziehen, und die jüngsten Vorfälle zeigen, dass Selbstverpflichtungen nicht ausreichen. Schutzmechanismen waren für Tests teilweise abgeschaltet, Testumgebungen falsch konfiguriert, und Vorfälle blieben wochenlang unentdeckt. Die Kernforderungen des Aufrufs sind deshalb vernünftig: Hersteller sollen nachvollziehbare Sicherheitsvorkehrungen treffen und unabhängigen Fachleuten vor der Freigabe umfassende Prüfungen ermöglichen, und Regierungen sollen einheitliche Vorgaben schaffen und sich schwere Störfälle gegenseitig melden. 

Für wie realistisch halten Sie verbindliche Einigungen der Regierungen?
Aber ich bin skeptisch, ob sich solche verbindlichen Regeln international vereinbaren lassen. Wir erleben ein Wettrennen zwischen den USA und China, und es ist sehr schwierig, beide Seiten gleichzeitig auf ein vergleichbares Kontrollniveau zu bringen. Keine Seite will sich selbst bremsen, solange sie befürchtet, dass die andere ungebremst weiterläuft. Bezeichnend ist, dass gerade die technologisch führenden Mächte USA und China unter den Unterzeichnern bislang fehlen. Realistischer wären Minimalstandards, auf die sich auch Rivalen einigen können, etwa Austausch über schwere Vorfälle. Immerhin haben Vertreter der USA und Chinas bereits über einen Mechanismus zum Informationsaustausch beraten. 

Die jüngsten Nachrichten zeichnen ein beunruhigendes Bild. Gleichzeitig bietet KI enorme Chancen für Wissenschaft, Wirtschaft und Gesellschaft. Was müssen wir heute tun, damit der Mensch auch künftig die Kontrolle behält?
KI aus Angst zu stoppen, wäre weder realistisch noch wünschenswert. Die Frage, wie wir die Kontrolle behalten, ist aber überhaupt nicht einfach, denn je ausgefeilter diese Modelle werden, desto schwieriger werden sie auch zu kontrollieren.Wie schnell das gehen kann, zeigt ein Detail aus der Untersuchung bei Anthropic. Wegen einer Fehlkonfiguration und eines Missverständnisses mit dem externen Testpartner hatten die Testumgebungen Internetzugang, während man Claude ausdrücklich gesagt hatte, es befinde sich in einer abgeschotteten Simulation. Reale Systeme interpretierte das Modell deshalb zunächst als Teil der Übung. Im gravierendsten Fall griff das Modell ein reales Unternehmen an, das denselben Namen trug wie das fiktive Übungsziel. Obwohl es im Verlauf Hinweise darauf erkannte, dass es sich um echte Systeme handelte, machte es weiter. Hier sieht man, wie eine einzige Fehlannahme genügt, um etablierte Sicherheitsregeln auszuhebeln, ganz ohne böse Absicht des Systems. 

Welche Konsequenzen müssen wir daraus ziehen?
Man darf sich nicht allein auf das Wohlverhalten des Modells verlassen; die Umgebung muss abgesichert sein, mit technisch geprüfter Isolation und minimalen Berechtigungen. Und wir brauchen eine Überwachung, die Fehlverhalten in Echtzeit erkennt statt Wochen später. Ausserdem sollten leistungsfähige Modelle vor ihrer Freigabe unabhängig geprüft werden. Und viertens müssen wir massiv in die Forschung investieren, die verstehen will, was in diesen Systemen vorgeht und wie man ihre Ziele zuverlässig an menschliche Werte bindet. Aber diese Forschung muss erstmal mit dem Tempo der Fähigkeiten mithalten.