Der KI-Ausbruch
Ein KI-Agent von OpenAI bekommt eine Cybersecurity-Aufgabe in einer abgeschotteten Testumgebung. Doch statt das Problem nur innerhalb dieser Sandbox zu lösen, findet er einen Weg ins offene Internet, greift die Infrastruktur von Hugging Face an und sucht dort nach den Lösungen für seine Prüfung.
Was zunächst wie Science-Fiction klingt, ist ein realer Sicherheitsvorfall.
In dieser Folge von Prompt-Zeit rekonstruieren wir, wie es dazu kommen konnte. Wir erklären, was Reward Hacking, instrumentelle Ziele und AI Alignment bedeuten und warum eine KI weder bewusst noch „böse“ sein muss, um gefährliche Handlungen auszuführen.
Außerdem geht es um die Frage, welche Konsequenzen Unternehmen aus...