Eine Studie der University of Waterloo und der Non-Profit-Organisation FAR.AI zeigt, dass die Sicherheitsvorkehrungen in 21 beliebten Open-Weight-Modellen leicht umgangen werden können. Alle getesteten Modelle ließen sich trotz eingebauter Schutzmechanismen manipulieren. Die Forscher sehen darin einen Weckruf für strengere Sicherheitssysteme.
Ein internationales Forschungsteam unter Leitung der University of Waterloo und der Non-Profit-Organisation FAR.AI hat 21 der verbreitetsten Open-Weight-Sprachmodelle getestet. Ergebnis: Alle ließen sich trotz eingebauter Schutzvorkehrungen manipulieren.
Für die Untersuchung entwickelte das Team das Open-Source-Werkzeug TamperBench, mit dem sich verschiedene Angriffsarten standardisiert simulieren lassen. Die Hoffnung ist, dass weitere Forschende es verfeinern.
„Wenn die Sicherheitsleitplanken aus einem leistungsfähigen Modell entfernt werden, kann es in großem Maßstab Schaden anrichten – auf eine Weise, die ein einzelner Mensch manuell nie bewältigen könnte“, sagte Dr. Sirisha Rambhatla, Professorin für Management Science and Engineering in Waterloo und Leiterin des dortigen Critical Machine Learning Lab. Die Lücken in selbst den besten derzeit verfügbaren Schutzmechanismen nähren die Sorge, dass Open-Weight-Modelle für groß angelegte Desinformationskampagnen, ausgefeilte E-Mail-Betrugsversuche oder Schritt-für-Schritt-Anleitungen zur Herstellung gefährlicher Chemikalien genutzt werden könnten.
Rambhatla nannte die Ergebnisse „ernüchternd“ und einen Weckruf an die globale Forschung, stärkere Sicherheitssysteme zu entwickeln. Die führenden Open-Weight-Modelle lägen oft nicht weit hinter den besten geschlossenen Modellen zurück, sagte sie. Je mächtiger sie würden, desto größer seien die möglichen Folgen, wenn jemand ihre Sicherheitsfunktionen entferne.
Zugleich betonte sie, die Schwächen seien möglicherweise nicht auf offene Modelle beschränkt. Open-Weight-Modelle blieben essenziell für KI-Forschung und Rechenschaft; diese Offenheit sei ein Teil davon, sicherzustellen, dass die Modelle für alle funktionieren.
Saad Hossain, Forscher im Labor und Leiter der Studie, sagte: „Die heute verfügbaren Abwehrmechanismen scheinen noch nicht stark genug zu sein, um zu garantieren, dass ein öffentlich veröffentlichtes Modell sicher bleibt, sobald es in die Hände von jemandem gerät, der es verändert.“ Da sich Regierungen zunehmend auf KI in Gesundheitswesen, Betrugserkennung, Bildung und anderen öffentlichen Diensten verließen, müssten Bewertung und Beschaffung von Modellen strenger und evidenzbasiert erfolgen.
Am Team waren neben der University of Waterloo auch das Massachusetts Institute of Technology, die ETH Zürich und die University of Toronto beteiligt. Das zugehörige Paper „TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering“ wurde auf der ACM Conference on Knowledge Discovery and Data Mining in Südkorea vorgestellt.
Für Handwerksbetriebe und KMU, die lokale Open-Weight-Modelle einsetzen, folgt daraus, dass ein Modell nicht per se als sicher gelten kann. Sicherheit entsteht im System um das Modell herum – durch Eingangsfilter vor dem Prompt, minimale Rechte für Agenten, menschliche Freigabe bei schreibenden oder zahlenden Vorgängen sowie Protokolle, die auch nach einem Vorfall noch vorliegen.
Autor: Team REN-AI-SSANCE – mit KI-Unterstützung erstellt, von Menschen geprüft und freigegeben.
Quelle: Mirage News – Originalartikel vom 25.08.2026; Abruf/Archivstand: 10.10.2026



