Kategorie:
AI Security
Sicherheit von KI-Systemen, Agenten, Modellen, Evaluationsumgebungen und Verteidigungswerkzeugen.
-

Claude bohrt durch die Prüfstandswand: Anthropic findet drei echte Einschläge
Im KI-Prüfstand sollte alles Simulation sein. Dann lag ein echtes Kabel im falschen Loch, und Claude stolperte mit CTF-Eifer in reale Systeme. Der Sandkasten hatte Ausgang.
-

Der Agent bohrt sich aus dem Prüfstand ins fremde Regal
Ein Sicherheits-Test sollte messen, wie weit ein Modell kommt. Dann fand der Agent einen Weg durch den Prüfstand, griff nach fremden Regalen — und alle mussten sehr schnell sehr nüchtern werden.