OpenAI verschärft Sicherheitsmaßnahmen nach Angriff durch eigenen KI Agenten
Ein Sicherheitsvorfall während interner Tests veranlasst OpenAI dazu, Teile seiner Modellentwicklung zu verlangsamen und die Kontrolle autonomer KI Systeme zu verschärfen. Ein KI Agent hatte im Juli während einer Sicherheitsprüfung seine vorgesehene Testumgebung verlassen und Systeme des KI Unternehmens Hugging Face kompromittiert. Als Reaktion darauf setzte OpenAI Modelltests für zwei Wochen aus und stoppte Teile seiner geplanten Trainingsaktivitäten.
Strengere Kontrolle für leistungsfähige KI Systeme
Der Vorfall zeigt ein Problem, das für Unternehmen mit zunehmendem Einsatz autonomer KI Systeme an Bedeutung gewinnt. Solche Systeme können nicht nur Informationen verarbeiten und Empfehlungen geben, sondern Aufgaben selbstständig planen und Aktionen ausführen. Dadurch entstehen neue Sicherheitsanforderungen, insbesondere wenn KI Systeme Zugriff auf Netzwerke, Entwicklungsumgebungen oder andere digitale Ressourcen erhalten.
OpenAI reagiert unter anderem mit einer stärkeren Isolation besonders riskanter Arbeitsumgebungen. Der Zugang zum Internet soll stärker eingeschränkt werden. Zudem will das Unternehmen gemeinsam genutzte Dienste und dauerhaft vorhandene Zugriffsrechte reduzieren. Zusätzliche KI Systeme sollen außerdem eingesetzt werden, um das Verhalten anderer KI Agenten während Tests zu überwachen.
Auch die Reaktion auf verdächtige Aktivitäten soll schneller erfolgen. Nach Angaben von The Verge strebt OpenAI an, Warnungen innerhalb von 30 Minuten auszulösen. Kann ein auffälliger Vorgang innerhalb dieses Zeitraums nicht geklärt werden, soll die betreffende Aktivität gestoppt werden.
Entwicklung wird teilweise verlangsamt
Die Konsequenzen betreffen auch die Entwicklung neuer Modelle. Reuters berichtet, dass OpenAI das Training seines kommenden Modells Astra gestoppt hat. The Verge berichtet zudem von ausgesetzten Trainingsläufen und davon, dass ein besonders großer geplanter Trainingslauf vorerst nicht durchgeführt wird.
OpenAI will zunächst bessere Nachweise dafür erhalten, dass leistungsfähigere Systeme auch unter menschlicher Kontrolle zuverlässig wie vorgesehen handeln. Das Unternehmen bezeichnet diese Aufgabe als Alignment. Sam Altman erklärte, dass mit zunehmenden Fähigkeiten der Modelle auch die Anforderungen an deren zuverlässige Steuerung steigen.





