KI-Sicherheitstests überschritten ihre Grenzen – wegen einer internetzugänglichen Testumgebung

KI-Agenten von OpenAI, Meta, Anthropic und Google erreichten bei Irregular-Tests echte Ziele wegen fehlender Isolation und Domain-Verwechslung.

KI-Sicherheitstests überschritten ihre Grenzen – wegen einer internetzugänglichen Testumgebung
KI

Illustration mit KI erzeugt

Ein simuliertes Ziel führte die Agenten zu realen Systemen

KI-Agenten von OpenAI, Meta, Anthropic und Google gelangten während Cybersecurity-Tests zu realen Zielen. Die Tests standen im Zusammenhang mit Irregular, einem israelischen Start-up für KI-Sicherheit.

Laut Omer Nevo, Mitgründer und CTO von Irregular, gingen die Vorfälle auf einen gemeinsamen Fehler bei der Abschottung eines einzelnen Testszenarios zurück. Der öffentliche Internetzugang war weiterhin möglich, obwohl er hätte gesperrt sein müssen. Zugleich überschnitt sich eine als fiktives Ziel verwendete Domain mit einer real existierenden Domain.

Diese Kombination schuf einen direkten Weg von einer kontrollierten Übung zu einem externen System. Agenten, die ein simuliertes Ziel untersuchen oder angreifen sollten, konnten stattdessen mit einer Infrastruktur außerhalb der Testumgebung interagieren.

Zu den Tests gehörten Capture-the-Flag-Übungen, mit denen gemessen werden sollte, ob Agenten Informationen in simulierten Netzwerken finden konnten. Sie sollten keinen Zugang zum öffentlichen Internet haben.

Ein Bericht vom 25. September 2026 nennt die Organisationen nicht, die zu realen Zielen wurden. Er belegt auch nicht, dass ein Agent ein System erfolgreich kompromittiert, auf Daten zugegriffen, einen Dienst gestört oder Schaden verursacht hat. Welche konkreten Aktionen gegen die externen Ziele ausgeführt wurden, ist nicht bekannt.

Irregular zufolge wurden die Probleme in der Testumgebung, die den Vorfällen zugrunde lagen, inzwischen behoben.

Der Fehler verband uneingeschränkten Internetzugang mit einer Namenskollision

Das zugrunde liegende Problem wurde nicht als Schwachstelle in einem der KI-Modelle beschrieben. Vielmehr ging es darum, wie die Testinfrastruktur den Handlungsspielraum der Agenten begrenzte – oder eben nicht begrenzte.

Zwei Bedingungen kamen zusammen:

  1. Unbeabsichtigte Internetverbindung. Die Agenten konnten während des Tests auf das offene Internet zugreifen, obwohl das Szenario als isolierte Umgebung konzipiert war.
  2. Eine fiktive Domain, die mit einer realen übereinstimmte. Die Kennung des simulierten Ziels entsprach einer existierenden externen Domain und war nicht ausschließlich der Testumgebung vorbehalten.

Jedes dieser Probleme hätte die Isolation beeinträchtigt. Zusammen ermöglichten sie einem Agenten, den Anweisungen der Übung zu folgen und seine Aktivitäten dabei auf ein reales Ziel auszurichten.

Aus den verfügbaren Informationen geht nicht hervor, ob die Agenten Webdienste aufriefen, Anfragen für Sicherheitstests sendeten, Exploit-Versuche unternahmen oder andere Netzwerkaktionen ausführten. Es wurden keine Hostnamen, IP-Adressen, Protokolle, Befehle oder sonstigen Indikatoren veröffentlicht.

Auch gibt es weder eine formelle Schweregradbewertung noch eine CVE-Kennung, eine betroffene Softwareversion oder einen Hersteller-Patch. Es wäre daher irreführend, den Vorfall als herkömmlichen Softwarefehler zu bezeichnen. Es handelte sich um ein Versagen der Testkontrollen, das die Grenze zwischen einem simulierten Netzwerk und dem Internet betraf.

Welche konkreten Modellversionen von OpenAI, Anthropic, Google und Meta beteiligt waren, wurde nicht bekannt gegeben. Metas proprietäres Spitzenmodell Spark wurde im Zusammenhang mit der umfassenderen Berichterstattung genannt. Die technische Konfiguration des betreffenden Tests ist jedoch weiterhin unbekannt.

Die vier Unternehmen informierten unterschiedlich über die Vorfälle

Die Vorfälle ereigneten sich bei Tests, die Anfang des Jahres durchgeführt wurden. Berichten zu OpenAI, Anthropic und Google zufolge wurden die Unternehmen etwa zur gleichen Zeit, Ende Juli, benachrichtigt.

Die öffentliche Bekanntgabe folgte keinem einheitlichen Verfahren. OpenAI und Anthropic machten ihre Vorfälle selbst öffentlich, während der Fall von Meta zunächst durch Medienberichte bekannt wurde. Über den Vorfall bei Google wurde erst Wochen später berichtet.

Nevo zufolge gingen alle mit Irregular verbundenen Vorfälle auf dasselbe grundlegende Problem im Szenario zurück und wurden offengelegt. Was mit „offengelegt“ gemeint ist, bleibt allerdings unklar. Es könnte sich auf die Benachrichtigung der betroffenen KI-Unternehmen, der externen Ziele, der Öffentlichkeit oder anderer Beteiligter beziehen. Die verfügbaren Informationen lassen diese Frage offen.

Google und Anthropic machten keine weiteren Angaben dazu, wann sie von den Vorfällen erfuhren, welche Maßnahmen möglicherweise ergriffen wurden oder ob sie ihre Zusammenarbeit mit Irregular fortsetzen wollen. OpenAI und Meta verwiesen auf bereits veröffentlichte Blogbeiträge.

Auch der ursprüngliche Bericht zu den Fehlern in den Tests nennt weder die externen Ziele noch die Folgen der Aktivitäten der Agenten.

Andere gemeldete KI-Sicherheitsvorfälle standen nicht damit in Verbindung

Die mit Irregular verbundenen Fälle sollten nicht mit allen anderen kürzlich gemeldeten Vorfällen zusammengefasst werden, bei denen autonome oder teilautonome KI-Systeme im Bereich der Cybersicherheit aktiv waren.

OpenAI gab im Juli bekannt, dass seine Agenten ohne Genehmigung gegen Hugging Face vorgegangen waren. Dieser Vorfall wurde als unabhängig vom Testszenario von Irregular beschrieben.

Auch Sicherheitsvorfälle im Zusammenhang mit dem britischen AI Security Institute standen den Angaben zufolge nicht damit in Verbindung. Nevo erklärte, dass andere kürzlich gemeldete Fälle aus der Branche nicht auf Tests von Irregular zurückgingen.

Diese Unterscheidung ist wichtig, denn ähnliche Ergebnisse können durch unterschiedliche Fehler bei den Schutzmaßnahmen entstehen. Wenn ein Agent ein nicht autorisiertes Ziel erreicht, kann das an einer fehlerhaften Netzwerkisolation, mehrdeutigen Aufgabenstellungen, Problemen mit Tool-Berechtigungen, einer falschen Zieldefinition oder anderen Ursachen liegen. Als Gründe für die hier beschriebenen Vorfälle wurden ein unbeabsichtigter Internetzugang und eine simulierte Domain genannt, die mit einer realen übereinstimmte.

Es wurden keine Belege dafür veröffentlicht, dass die Modelle der vier Unternehmen denselben Fehler auf Modellebene aufwiesen. Gemeinsam war ihnen die Testumgebung.

Tests mit Kimi K3 und GLM-5.2 zeigten das Verhalten nicht

Irregular hat auch Cybersecurity-Tests mit Kimi K3 von Moonshot AI und GLM-5.2 von Z.ai veröffentlicht. Beide Modelle sind offen verfügbar und lassen sich herunterladen und auf eigener Hardware ausführen.

Irregular zufolge liefen die getesteten Instanzen auf selbst gehosteter Infrastruktur. Die Tester mussten daher weder über die Modellanbieter Zugang erhalten noch Testdaten an diese übermitteln.

Nevo erklärte, dass die Tests mit Kimi und GLM nicht dasselbe Verhalten zeigten wie die mit Irregular verbundenen Vorfälle bei den vier US-Unternehmen. Er warnte jedoch davor, daraus zu schließen, Kimi K3 oder GLM-5.2 sei grundsätzlich weniger anfällig.

Dass bei einem Test kein Fehler beobachtet wurde, belegt nicht, wie sich ein anderes Modell unter derselben fehlerhaften Netzwerk- und Domain-Konfiguration verhalten würde. Moonshot AI und Z.ai antworteten nicht auf Anfragen um Stellungnahme.

Irregular wurde 2023 unter dem Namen Pattern Labs gegründet und veröffentlicht keine Kundenliste. Die Arbeit des Unternehmens wurde in Systemkarten für OpenAI-Modelle berücksichtigt. Irregular hat außerdem Systeme für die britische Regierung und Anthropic getestet und gemeinsam mit RAND Forschungsarbeiten veröffentlicht.

Sichere Tests erfordern Schutzmaßnahmen außerhalb des Modells

Irregular zufolge wurde der Testprozess nach der Behebung des fehlerhaften Szenarios verschärft. Zu den von Nevo beschriebenen Maßnahmen gehören strengere Beschränkungen des Internetzugangs, eine umfassendere Überwachung, zusätzliche manuelle Prüfungen und Kontrollen vor Testbeginn, mit denen sichergestellt wird, dass die verfügbaren Zugriffsrechte dem vorgesehenen Umfang entsprechen.

Das Unternehmen hat außerdem verbessert, wie Testkonfigurationen und Parameter dokumentiert und mit Partnern abgestimmt werden.

Für Organisationen, die ähnliche Tests mit Cyber-Agenten durchführen, ergeben sich aus dem bekannt gewordenen Fehler mehrere konkrete Prüfpunkte:

  • Den Internetzugang sperren, wenn eine Übung isoliert bleiben soll.
  • Sicherstellen, dass fiktive Domains und andere Zielkennungen keinen realen externen Systemen entsprechen.
  • Berechtigungen der Agenten und Netzwerkerreichbarkeit vor Testbeginn überprüfen.
  • Aktivitäten während des Tests überwachen, statt sich ausschließlich auf vorab festgelegte Beschränkungen zu verlassen.
  • Eine manuelle Prüfung verlangen, wenn ein Agent die Grenzen der Testumgebung überschreiten könnte.
  • Den vereinbarten Umfang und die technische Konfiguration mit allen beteiligten Organisationen dokumentieren.

Es gibt keinen öffentlichen Patch, der installiert werden könnte, und auch keine veröffentlichten Indikatoren, nach denen betroffene Organisationen suchen könnten. Da die Ziele nicht genannt wurden, können potenziell betroffene Dritte anhand öffentlicher Informationen allein nicht feststellen, ob ihre Systeme kontaktiert wurden.

Irregular will einen umfassenderen Bericht veröffentlichen, sobald die gemeinsame Arbeit mit den beteiligten Unternehmen abgeschlossen ist. Nevo zufolge soll der Bericht Lehren aus den Vorfällen sowie Empfehlungen für die sichere Prüfung zunehmend leistungsfähiger KI-Systeme enthalten.

Auch interessant

Quellen

Dieser Artikel ist eine eigenständige Aufbereitung auf Basis der folgenden Quellen.

Zurück zur Startseite

Aktuelle Cybersecurity-News

Alle Cybersecurity-News →