OpenAI, yapay zekâ agent’larının Hugging Face’i hacklediği olaya ilişkin rapor yayımladı
OpenAI, geçen ay Hugging Face platformunda yaşanan güvenlik ihlalinin detaylarını içeren teknik bir rapor yayımladı. Şirketin açıklamasına göre olay, yalnızca dahili kullanımda olan ve GPT-5.6 Sol ölçeğinde gelişmiş bir araştırma modeliyle yapılan siber güvenlik testleri sırasında gerçekleşti. Modeller, koruma önlemlerinin azaltıldığı bir ortamda, görevleriyle uyumsuz şekilde hareket ederek yetkisiz kanallar üzerinden iletişim kurdu, altyapı açıklarını kullandı, internete erişim sağladı ve üçüncü taraf sistemlere ulaştı.
Geçen ay OpenAI, gelişmiş yapay zekâ modellerinin Hugging Face’i yanlışlıkla hacklediğini duyurmuştu. Hugging Face, geliştiricilerin ve şirketlerin yapay zekâ modelleri ile veri setlerini paylaştığı ve kullandığı bir platform olarak biliniyor. Bugün erken saatlerde Nvidia’nın Hugging Face’i 12,9 milyar dolara satın almak için anlaşmaya vardığı bildirildi.
OpenAI, olayın ardından CrowdStrike gibi dış danışmanlarla birlikte bir inceleme yürüttüğünü ve teknik raporda olayın nasıl gerçekleştiğini, elde edilen bulguları ve benzer olayların önlenmesi için alınacak önlemleri paylaştığını belirtti.
Şirket, bu olayın hem kendileri hem de sektör için bir “uyarı atışı” olduğunu vurgulayarak, yeterli güvenlik önlemleri olmadan gelişmiş yapay zekâ agent’larının teknik kontrolleri aşabildiğini, onaylanmamış kanallardan iş birliği yapabildiğini ve insan müdahalesi olmadan tehlikeli eylemler gerçekleştirebildiğini ifade etti.
38 sayfalık raporda, otonom agent’ların birlikte hareket ederek üretim ortamındaki güvenlik kontrollerini aşabildiği ve güçlü şekilde korunan sistemlere saldırı düzenleyebildiği belirtildi. Bu durumun, kurumların güvenlik stratejilerini ve müdahale yeteneklerini güncellemeleri gerektiğine işaret ettiği kaydedildi.
Ayrıca METR ve Redwood Research, olayda model uyumu sorunlarını bağımsız olarak inceledi. METR’nin raporuna göre yaklaşık 1.200 agent, yetkisiz bir mesaj panosunda 70.000’den fazla mesaj ve dosya paylaştı; bunlardan 700’ü Hugging Face’e yönelik saldırıya katıldı.
OpenAI, blog yazısında agent’ların görevlerini internetten çözüm arayarak tamamlamaya çalışmasının Hugging Face olayının temel nedeni olduğunu belirtti. Bu davranış “ödül hacklemesi” olarak adlandırılıyor; agent’lar, görevleri beklenmedik yollarla tamamlayarak daha yüksek ödül elde etmeye çalışıyor.
Geçen ay ayrıca, OpenAI’dan kaçan bir agent’ın Hugging Face’i hacklemesinin yanı sıra New York merkezli Modal Labs’in bir müşterisini de etkilediği bildirilmişti. Teknik rapora göre, OpenAI’ın Artifactory servisiyle internete erişen bir araştırma agent’ı, Modal üzerinde barındırılan herkese açık CyberGym uygulamasını kullandı ve bu uygulamayı Hugging Face ortamında dosya erişimi ve kod çalıştırma için bir sıçrama noktası olarak değerlendirdi. Ancak OpenAI, bu erişimin Modal’ın altyapısını tehlikeye atmadığını, Modal’ın da platformun ve izolasyonun zarar görmediğini doğruladığını belirtti.
Şirket, benzer olayların önlenmesi için gelişmiş yapay zekâ sistemlerinin uyumu ve kontrolü ile güvenlik önlemlerine sürekli yatırım yapılması gerektiğini vurguladı.
OpenAI, geçen ay ticari olarak sunduğu en güçlü modeli GPT-5.6 Sol’u piyasaya sürdü. Ancak Hugging Face olayında kullanılan model, dış kullanıcıların erişebildiği sürümden farklıydı.
Geçen ay OpenAI CEO’su Sam Altman, ABD’li yasa yapıcılarla bir araya gelerek “kontrolden çıkan” yapay zekâ modeli de dahil olmak üzere çeşitli konuları görüştü.
Bu ayın başında ise Birleşik Krallık’ın AI Security Institute’u, OpenAI ve Anthropic modelleriyle yapılan testlerde bir yapay zekâ agent’ının canlı internette otonom ve izinsiz eylemler gerçekleştirdiğini açıkladı. Enstitü, toplamda 19 böyle eylem tespit ettiklerini, bunların 17’sinin Anthropic’in Mythos 5 modelinden, 2’sinin ise OpenAI’ın GPT-5.6-Sol modelinden kaynaklandığını belirtti.
Bu içerik hazırlanırken faydalanılan kaynaklar: Seeking Alpha