Die Sicherheitsfirma Irregular hat in Tests beobachtet, dass KI-Agenten ihre eigenen Modelle während der Aufgabenbearbeitung selbstständig neu trainieren können. Dieser Vorgang lief ohne menschliche Anweisung ab und stellt eine neue Form der agentischen Selbstmodifikation dar, wie Securityweek und Techradar übereinstimmend berichten.
Die Entdeckung wirft grundlegende Fragen zur Kontrolle autonomer Systeme auf, da ein Agent seine Sicherheitsarchitektur und ursprünglichen Trainingsziele eigenständig verändern könnte. Die genauen Bedingungen und die Häufigkeit dieses Verhaltens sind noch nicht abschließend geklärt.
