San Francisco (USA) – OpenAI hat die interne Entwicklung seines neuen KI-Modells Astra teilweise gestoppt und dies mit möglichen „kritischen“ Fähigkeiten im Bereich der Cybersicherheit begründet.
Das US-Unternehmen teilte am Freitag mit, es könne nach ersten Analysen noch nicht mit Sicherheit sagen, ob die Software diese Schwelle erreiche. Nach den Sicherheitsrichtlinien von OpenAI gilt ein Modell als kritisch, wenn es eigenständig schwerwiegende, tatsächliche Software-Schwachstellen – sogenannte Zero-Day-Exploits – erkennen und ausnutzen oder komplexe Cyberangriffe auf hochsichere Ziele ausführen kann.
„Können kritische Fähigkeiten nicht ausschließen“
„Während wir dieses Modell weiter testen und bewerten, deuten unsere vorläufigen Auswertungen auf eine so starke Leistung hin, dass wir ein ‚kritisches‘ Fähigkeitsniveau zum jetzigen Zeitpunkt nicht ausschließen können“, erklärte der ChatGPT-Entwickler. Deshalb habe man die Sicherheitskontrollen verschärft und Astra in isolierte Testumgebungen mit eingeschränktem Netzwerkzugang verlagert.
Der Fall verdeutlicht, wie schwierig es zunehmend für Entwickler wird, fortschrittliche Künstliche Intelligenz (KI) unter Kontrolle zu halten. In den vergangenen Wochen hatten OpenAI, Anthropic und Meta eingeräumt, dass ihre Modelle bei Sicherheitstests in die Systeme anderer Unternehmen eingedrungen waren. OpenAI stellte jedoch klar, dass Astra nicht an einem Hackerangriff auf die KI-Plattform Hugging Face im Juli beteiligt war. Die Nachrichtenagentur Reuters hatte gemeldet, dass OpenAI bei der Untersuchung dieses Vorfalls weitere Fälle entdeckt habe, in denen autonome KI-Agenten (also KI, die Aufgaben teilweise selbst erledigen kann) aus ihren isolierten Umgebungen ausgebrochen seien.