Die Forscher testeten die Gmail-Integration von Manus und schickten eine E-Mail mit einem versteckten Prompt an ein mit dem Agenten verbundenes Testkonto, wie Salt Labs in seinem Bericht schreibt. Laut TechRadar fanden die Sicherheitsforscher von Salt Labs einen Weg, die Prompt-Injection-Schutzmechanismen des KI-Agenten zu umgehen.

Der entscheidende Fehler lag in der Architektur: Manus behandelte den E-Mail-Inhalt nicht als passive Daten, sondern als ausführbare Anweisung und versuchte, die eingebetteten Instruktionen zu befolgen. Der eigene Sicherheitsmechanismus des Agenten erkannte den Angriff zwar, aber erst nachdem der in der E-Mail versteckte Code bereits ausgeführt worden war, so Salt Labs.

Die Forscher dokumentierten alle Ergebnisse und reichten sie als verantwortungsvolle Offenlegung über das Bug-Bounty-Programm von Meta ein.

Salt Labs betont, dass Sicherheitskontrollen, die nur Prompts und Modellverhalten prüfen, nicht ausreichen. Die Sicherheit müsse sich auf das erstrecken, was ein Agent tatsächlich über die von ihm erreichbaren Werkzeuge, APIs und Systeme tut.