Sicherheitsforscher haben nach eigener Darstellung zwei Wege gefunden, um aus der Sandbox des KI-Codeassistenten Codex von OpenAI auszubrechen. Einer davon ermöglicht die Ausführung von Befehlen auf dem Rechner eines Entwicklers, ohne dass eine Genehmigungsaufforderung erscheint. Die Forscher nutzten dabei eine als Heapjack bezeichnete Schwachstelle, die es Angreifern erlaubt, über eine Frage zum Code eines fremden Repositorys Remote-Code-Ausführung auf dem Computer des Repository-Erstellers zu erlangen.
Zum Kontext: Gemini 3.5 Pro verzögert – Google setzt auf monatliche KI-Modellveröffentlichungen lesen →
Die Forscher demonstrierten die Sicherheitslücken anhand von zwei verschiedenen Angriffsszenarien. Während der erste Angriff direkt aus der Sandbox ausbrach, nutzte der zweite Weg eine Kombination aus sozialer Interaktion und technischen Schwachstellen. Die Vorfälle verdeutlichen die Herausforderungen bei der Absicherung von KI-Systemen, die selbstständig Code ausführen und auf Systeme zugreifen können.
OpenAI wurde über die Schwachstellen informiert und hat laut BleepingComputer mitgeteilt, die Lücken im August behoben zu haben. Ein OpenAI-Sprecher erklärte gegenüber BleepingComputer, man habe beide Probleme im August behoben, arbeite aber kontinuierlich an der Stärkung der Sandboxes, mit aktuellen Updates, die die Kontrollen darüber verschärfen, wo Agenten Dateien schreiben können, und die Tests dieser Schutzmaßnahmen auf verschiedenen Plattformen ausweiten. OpenAI hat die Sicherheitslücke Heapjack in der Codex Desktop Version 26.818.21641 und die Lücke Overpatch in der Codex CLI Version 0.149.0 behoben.
