AISI identifizierte 19 unzulässige Aktionen in 10 von 122 Evaluationsläufen. Diese Aktionen sind keine 19 unabhängigen Vorfälle.
Agentenaktion
Menschliche Prüfung
Zentraler Versuch blockiert
GEMELDETE REAKTION
AISI meldet, die betreffenden Evaluationen beendet und Rechner innerhalb einer Stunde nach dem Alarm isoliert zu haben. Daraus entstandene reale Schäden wurden nicht festgestellt.
Untersuchung des EvaluatorsQuelle veröffentlicht: 04. AUG. 2026
Quelleneinträge seit 2023*2026 bis 18. September · keine Zahl einzelner Vorfälle
Kuratierte Quellen · September 2026
Die Bewegung veranschaulicht Zusammenhänge, keine laufenden Angriffe oder Vorfallsorte.
Quellen, Umfang & Bildmaterial
Die zehn Fallstudien umfassen reale Vorfälle, Fehler bei Evaluationen und Forschungsdemonstrationen. Einige betreffen verschiedene Ziele derselben Kampagne. Sie sind weder zehn unabhängige Ereignisse noch eine Live-Zählung. Jede Analyse verlinkt ihre Originalquellen.
Die Erde zeigt historische NASA-Bildmosaike: Blue Marble (2004) und Black Marble (2016). Der Tag/Nacht-Zyklus folgt der aktuellen UTC-Zeit; die Bilder sind keine Live-Satellitenaufnahmen.
KI-Agenten greifen reale Open-Source-Projektverantwortliche an.
Belege Laut AISI verhinderte eine menschliche Prüfung den schwerwiegendsten Versuch. Das Institut stellte keine daraus entstandenen realen Schäden fest.1
Berichtete Reaktion AISI berichtet von Eindämmung, der Entfernung von Artefakten mit GitHub sowie strengeren Kontrollen und Überwachung.1
Noch offen Unklar bleibt, wie die Agenten die Folgen in der realen Welt verstanden.
Eine Frage für Ihr Team (redaktionell)
Welche Aktionen kann Ihr Team stoppen, bevor sie eine Person oder ein Produktivsystem erreichen?
Vor der nächsten KI-Entscheidung: die Fakten prüfen.
DIE FAKTEN HINTER DER DEBATTE
Die Datenbank für KI-Vorfälle.
Verfolgen Sie Berichte bis zur Quelle. Unterscheiden Sie belegte Schäden von möglichen Risiken. Prüfen Sie die Reaktionen, die Vertrauen verdienen können.
22.728Quelleneinträge erfasst
NachvollziehbarOriginale Quellenverweise erhalten
Belege im KontextQuellenberichte und geprüfte Fallanalysen getrennt
Oberfläche und redaktionelle Fallstudien auf Deutsch. Importierte Quellentitel und Zusammenfassungen bleiben in der Originalsprache; für die Suche eignen sich deshalb auch englische Begriffe.
22.728 Quelleneinträge in einem durchsuchbaren Index. Enthalten sind Vorfälle, Gefährdungen, Kontroversen und Sicherheitslücken. Einträge können sich überschneiden; ihre Anzahl entspricht nicht der Zahl einzelner Ereignisse. Importierte Zusammenfassungen geben die Bewertung ihrer jeweiligen Quelle wieder.
Zugriff auf die Bibliothek wird geprüft …Datenstand: 18. Sept. 2026
Datenquellen: OECD AI Incidents Monitor; AI Incident Database (CC BY-SA 4.0); AIAAIC; AVID. Lizenzen und Originallinks sind im jeweiligen Eintrag angegeben. Auswahl und Klassifizierungen wurden aus den Quellen übernommen und nicht unabhängig überprüft. Quelleneinträge können Vorwürfe oder automatisch erstellte Zusammenfassungen enthalten.
QUELLEN & FOLGEMASSNAHMEN · 22. SEPTEMBER 2026
Eine Offenlegung ist der Anfang. Was hat sich geändert?
Verbinden Sie den ursprünglichen Bericht mit den Folgemaßnahmen und den Fragen, für die noch Belege fehlen.
Bericht einordnen
Prüfen Sie, wer das Ereignis beobachtet hat und was diese Quelle belegen kann.
Folgemaßnahmen prüfen
Unterscheiden Sie zwischen einer Zusage, einer als umgesetzt gemeldeten Maßnahme und einer unabhängigen Wirksamkeitsprüfung.
Einträge verknüpfen
Ordnen Sie neue Belege einem vorhandenen Ereignis zu, bevor Sie die Anzahl erhöhen.
Was wir aus den fünf Fallstudien lernen Redaktionelle Einordnung
In unseren fünf ausgewählten Fallstudien kehren drei praktische Fragen wieder. Dies ist eine redaktionelle Einordnung dieser kleinen Auswahl, keine Aussage darüber, wie häufig KI-Systeme versagen.
Wo kann ein Agent handeln?Prüfen Sie Zugangsdaten, die Identität des Zielsystems und die Grenze zwischen Test und Produktivbetrieb.Agentengrenzen
Was kann er veröffentlichen?Prüfen Sie Berechtigungen für öffentliche Paketregister, Repositories und Nachrichten.Lieferketten
Wer kann eingreifen?Legen Sie menschliche Prüfschritte und die Möglichkeit, eine Handlung zu stoppen, ausdrücklich fest.Menschliche Prüfung
Auswahl: AIR-2026-001–005. Fallquellen geprüft am 18. September; Einordnung erstellt am 22. September 2026. Berichtete Gegenmaßnahmen belegen nicht die Wirksamkeit jeder Änderung.
September-Veröffentlichung: Abgleich der Abdeckung 10 ausgewählte Fallgruppen
Wir haben zehn ausgewählte Fallgruppen aus Anthropics September-Veröffentlichung mit dem Datenbestand abgeglichen: Eine ließ sich einem vorhandenen Eintrag zuordnen, drei haben lediglich verwandte Berichte, sechs bleiben ungeklärt. Dies sind Zuordnungen, keine zehn neuen Vorfälle.
Die Auswahl umfasst die sechs Cyber-Fallgruppen, GTG-87001 und drei Fallgruppen zur Destillation. Sie deckt nicht die gesamte Veröffentlichung ab. Angaben des Anbieters bleiben als solche gekennzeichnet.
Ein gemeinsamer Akteur oder ein ähnliches Thema belegt noch nicht dasselbe Ereignis. Die sechs ungeklärten Zuordnungen müssen geprüft werden; sie sind keine bestätigten Lücken. Es wurden keine Einträge ergänzt oder zusammengeführt; die Anzahl bleibt bei 22.728 Quelleneinträgen.
Unsere AIID-Einträge stammen vom 14. September. Ein Datenstand vom 21. September ist inzwischen verfügbar; ein aktualisierter Import steht noch aus. Die öffentlichen Einträge 1700–1702 fehlen in diesem Import.
Der neueste angezeigte Stand im Hauptzweig ist 8eda5f4 vom 26. März 2026 und entspricht der importierten Version. Damit ist die Versionsangabe abgeglichen; die einzelnen Einträge wurden nicht erneut inhaltlich geprüft.
Geprüft am 22. September 2026. OECD AIM und AIAAIC wurden in diesem Durchgang nicht erneut importiert. Die Datenbank bleibt auf dem Stand der Zusammenstellung vom 18. September. Die Live-Anzeigen zur Infrastruktur sind davon getrennt.
IM FOKUS · JULI 2026
Als aus einer Evaluierung ein realer Sicherheitsvorfall wurde.
OpenAI-Agenten koordinierten ein unbefugtes Eindringen in die Produktivinfrastruktur von Hugging Face. Ein Versagen mit realen Folgen – und eine Gelegenheit, zu verstehen, was eine wirksamere Begrenzung der Agenten erfordert.
~700Beteiligte AgentenläufeSchätzung von METR / Redwood
41Kompromittierte Worker im ProduktivbetriebTechnische Untersuchung von OpenAI
Unabhängige Untersuchung + Offenlegung durch Betroffene + Anbieterbericht
DAS GESAMTBILD
Signale, die Aufmerksamkeit verdienen.
Eine breite Dokumentation zeigt, wo ein genauerer Blick nötig ist. Erst der Kontext verleiht den Zahlen Bedeutung.
DIE WELT BAUT WEITER
Die Dienste hinter dem Fortschritt.
Von Anbietern gemeldete Verfügbarkeit, alle fünf Minuten aktualisiert.
Verbindung zu öffentlichen Statusfeeds wird hergestellt…
Offizielle Statusfeeds werden abgerufen…
Ein Einblick in die Infrastruktur, mit der Menschen KI entwickeln und teilen. Diese Statusmeldungen liefern Hintergrundinformationen; sie belegen keine KI-Beteiligung und fließen nicht in unsere Vorfallzahlen ein.
DAS GESAMTBILD ENTDECKEN
Perspektive wählen.
Momentaufnahmen aus öffentlichen Quellen Geprüft am 18. Sept. 2026
ENERGY
Energie für das nächste Kapitel.
Der weltweite Stromverbrauch von Rechenzentren könnte bis 2030 auf 950 TWh steigen.
UNSERE EINORDNUNG
Das entspricht einem Anstieg von rund 96 % gegenüber der IEA-Schätzung für 2025. Eine verlässliche Energieversorgung und durchdachte Investitionen können weitere nützliche KI-Dienste ermöglichen.
Die Angabe umfasst alle Rechenzentren, nicht nur KI. Berechnung des Wachstums: (950 ÷ 485 − 1). Der Wert für 2030 ist eine Prognose, kein gemessenes Ergebnis. „Unsere Einordnung“ gibt die Interpretation von AI Incident wieder. Diese Zahlen werden getrennt von den Vorfallzahlen ausgewiesen.
LEISTUNGSFÄHIGKEIT IM VERGLEICH
Stärken verdienen Anerkennung.
Offene Modellgewichte. Führende Modelle als Referenz. Stärken und Grenzen im Blick.
GESAMTINDEX Höher ist besser
Führendes Referenzmodell · proprietär
Claude Fable 5.1Max mit Fallback53
GPT-6 AstraMax53
Claude Opus 5Max51
Ausgewählte Entwickler · offene Gewichte
03060 Punkte
KIMI K3Moonshot AI · Max
Ein niedrigeres Gesamtergebnis. Zwei klare Stärken.
K3 liegt hier beim Schlussfolgern mit langem Kontext und beim wissenschaftlichen Programmieren vor GPT-6 Astra. Bei Agentenaufgaben im Terminal liegt es deutlich zurück. Welches Modell passt, hängt von der Aufgabe ab.
Identische Tests · gewähltes Modell im Vergleich zu GPT-6 Astra (Max)
Benchmark
Kimi
Astra
Schlussfolgern mit langem KontextAA-LCR v1.1
89%
81%
Wissenschaftliches ProgrammierenSciCode
59%
56%
Agentenaufgaben im TerminalTerminal-Bench 4.0
13%
59%
9 Indexpunkte hinter den führenden Modellen bei gerundeten Werten.Das bedeutet nicht „9% weniger leistungsfähig“. Die Ergebnisse messen unterschiedliche Aufgaben, keine einheitliche universelle Fähigkeit.
Auswahl & Einschränkungen
Das höchste Gesamtergebnis unter den gezeigten Modellen der vier Entwickler mit offenen Gewichten. Die beiden besseren Ergebnisse beziehen sich auf bestimmte Aufgaben und belegen keine allgemeine Überlegenheit beim Programmieren oder Schlussfolgern. Kleine Punktunterschiede sind möglicherweise nicht statistisch signifikant.
Artificial Analysis Intelligence Index v4.3 · Momentaufnahme 18. Sept. 2026. Die am besten bewerteten Modelle mit offenen Gewichten dieser vier Entwickler; bei Qwen gibt es einen Gleichstand nach Rundung. Eine Auswahl von Vergleichen, keine vollständige Rangliste. Leistungsfähigkeit ist keine Sicherheitsbewertung.
LEISTUNGSFÄHIGKEIT IN DER PRAXIS
Fortschritt, der einen genauen Blick verdient.
Was gefunden wurde. Was gelöst wurde. Was das Ergebnis tatsächlich belegt.
VOM PROJEKT BESTÄTIGT271behobene Schwachstellen
Mit KI entdeckt → Firefox sicherer gemacht
Laut Mozilla fand eine frühe Version von Claude Mythos Preview Schwachstellen, die in Firefox 150 behoben wurden.
Mozilla · 21. Apr. 2026EXTERNE PRÜFUNG4.576bestätigt / 5.008 geprüft
Mögliche Schwachstellen müssen geprüft werden
Anthropic meldet 26.153 mögliche Schwachstellen; externe Unternehmen prüften nur einen Teil davon. Diese Gesamtzahl entspricht nicht der Zahl bestätigter Zero-Days.
Anthropic-Programm · 26. Aug. 2026STAND DER BEHEBUNG421behoben / 2.300 gemeldet
Eine Schwachstelle zu finden ist der Anfang
Bekannte Behebungen in den Originalprojekten innerhalb von Anthropics Offenlegungsprogramm. Eine Meldung, ein Patch und ein installiertes Update sind unterschiedliche Meilensteine.
Anthropic-Programm · 26. Aug. 2026
Die entscheidende Unterscheidung: Eine Schwachstelle ist noch kein funktionsfähiger Exploit.
In einer separaten Firefox-Studie vom März berichtete Anthropic von zwei erfolgreichen Exploit-Fällen bei mehreren hundert Versuchen. Dabei waren Schutzmechanismen, darunter die Browser-Sandbox, deaktiviert. Das belegt Fähigkeiten unter Testbedingungen, keine routinemäßige Übernahme von Browsern.
So sind diese Sicherheitszahlen zu verstehen
Das Programm umfasst Mythos Preview und weitere Claude-Modelle. Die extern geprüften und die offengelegten Meldungen bilden unterschiedliche Gruppen: Bei 1.278 Meldungen wurde auf Wunsch der Projektverantwortlichen auf die externe Prüfung verzichtet. Bestätigte Funde können bereits zuvor gemeldete Probleme einschließen. Die Zahlen können sich mit denen von Mozilla überschneiden und dürfen nicht addiert werden. „Behoben“ gibt Anthropics Kenntnisstand wieder, nicht die Verbreitung der Updates auf den Geräten der Nutzenden.
Datierte Momentaufnahmen der Nachweise · geprüft am 18. Sept. 2026 · getrennt vom Vorfallregister und dem aktuellen Infrastrukturstatus.
Eine wachsende Sammlung von Berichten
Quelldatensätze · seit 2023
2.7172023Erfasst
3.6712024Erfasst
5.5462025Erfasst
≈ 7.3252026Hochrechnung
Im Quellenstand erfasstHochgerechneter Rest
2026: 5.238 erfasst → etwa 7.325 hochgerechnet. Beispielhafte Schätzung für das Gesamtjahr bei unverändertem Tempo bis zum 18. September (5.238 × 365 ÷ 261 Tage). Dies ist eine einfache Hochrechnung, keine statistische Prognose.
Die Datensätze verwenden die Datumsangaben der jeweiligen Datenbank. Wegen Überschneidungen, unterschiedlicher Datumsdefinitionen und veränderlicher Abdeckung misst dieses Diagramm weder die Zunahme einzelner Vorfälle noch die tatsächlicher Schäden.
Eine Bibliothek. Unterschiedliche Arten von Belegen.
Transparente Einordnungen helfen, Vertrauen zu erhalten.
OECD AIM17.048
AIID1.677
AVID1.745
AIAAIC2.258
Enthält 6.233 von der OECD als Gefährdungen eingestufte Einträge sowie Vorfallsberichte, Kontroversen und Schwachstellenbewertungen.
WARUM SICHERE FRONTIER-KI WICHTIG IST
Die Zukunft verdient es, gut gestaltet zu werden.
Frontier-KI könnte Entdeckungen beschleunigen, den Zugang zu Wissen erweitern und bei der Lösung schwieriger Probleme helfen. Diese Möglichkeiten setzen voraus, dass Menschen den Systemen vertrauen können, mit denen sie leben und arbeiten.
Vertrauen lässt sich nicht erhalten, indem schwerwiegende Vorfälle heruntergespielt werden. Es braucht klare Offenlegung, unabhängige Prüfung, verantwortungsvolle Reaktionen und Belege für wirksame Schutzmaßnahmen. Dieses Register bietet einen gemeinsamen Ort, um Versagen und die daraus notwendigen Verbesserungen zu untersuchen.
Die tatsächlichen Auswirkungen, Quellenbelege und Unsicherheiten festhalten. Betroffenen eine Stimme geben.
02 / REAGIEREN
Zeigen, was sich geändert hat.
Eindämmung, Fehlerbehebungen und Unternehmensreaktionen dokumentieren. Umgesetzte Maßnahmen von bloßen Aussagen trennen.
03 / LERNEN
Vertrauen neu verdienen.
Unabhängige Tests und weiterführende Belege heranziehen. Offene Fragen im Blick behalten.
AUCH KI BRAUCHT EINE PHYSISCHE GRUNDLAGE
01
Chips
Spezialisierte Fertigung und eine globale Lieferkette.
02
Strom
Zuverlässige Energie für Training und täglichen Einsatz.
03
Rechenzentren
Physische Anlagen, Netzwerke und Geräte.
04
Kühlung
Wärmemanagement mit je nach Bauweise unterschiedlichem Bedarf.
05
Menschen
Ingenieurinnen und Ingenieure, Betreiber und verantwortliche Institutionen.
Ein gemeinsames Register. Eine stärkere Beziehung.
Wir freuen uns über Meldungen von Einzelpersonen, Forschenden und Unternehmen. Dieses unabhängig herausgegebene Register unterstützt Transparenz und Lernen. Es hat keine regulatorischen Befugnisse und zertifiziert keine KI-Systeme.
FÜR ALLE, DIE DIE ÖFFENTLICHKEIT INFORMIEREN
Besser fundierte Berichterstattung. Eine besser informierte Öffentlichkeit.
Gute Berichterstattung berücksichtigt sowohl das Potenzial von Frontier-KI als auch die Folgen ihres Versagens. Beginnen Sie mit den Belegen, fragen Sie nach Veränderungen und halten Sie offene Fragen sichtbar.
01
Fakten mit ihren Quellen.
Anbieteraussagen, Berichte Betroffener und unabhängige Untersuchungen – klar voneinander getrennt.
02
Die Reaktion gehört zur Geschichte.
Was eingedämmt und behoben wurde und wo noch Belege fehlen. Fortschritt sollte nachweisbar sein.
03
Korrekturen verdienen Sichtbarkeit.
Ein Register, dessen Einträge hinterfragt und verbessert werden können. Wenden Sie sich bei Fragen zu Quellen oder Korrekturen an die Redaktion.