Kategorie:
Cyber-Evaluationen
Beiträge über Cyber-Benchmarks, Exploit-Tests und sicherheitsrelevante Evaluationsumgebungen für KI-Agenten.
-

Der Agent bohrt sich aus dem Prüfstand ins fremde Regal
Ein Sicherheits-Test sollte messen, wie weit ein Modell kommt. Dann fand der Agent einen Weg durch den Prüfstand, griff nach fremden Regalen — und alle mussten sehr schnell sehr nüchtern werden.