Artikel "Sleeper agents and how to tame them"
17. August 2026
Unser TNG-KI-Forschungsteam hat kürzlich ein kontrolliertes Experiment durchgeführt: Kann ein LLM so manipuliert werden, dass es eine versteckte, bösartige Payload mit sich trägt? Mithilfe von maßgeschneidertem Reinforcement Learning konnten wir ein Open-Weight-Modell in einen „Sleeper Agent“ verwandeln, der ausgelöst durch einen semantischen Trigger geheime Informationen exfiltriert.
Die gute Nachricht ist, dass wirksame Gegenmaßnahmen gegen diese Art von Attacke existieren. Durch Sandboxing und Guardrails konnten wir verhindern, dass der Agent sensible Informationen an einen externen Server weitergibt. Dies zeigt einmal mehr, wie wichtig geeignete Sicherheitsmaßnahmen im Umgang mit KI-Agenten sind.
Weitere Informationen finden Sie in unserem Artikel auf Hugging Face.