OpenAI ajanları Hugging Face ihlalinden aylar önce mesaj panoları kurmuş ve birbirinden şüphelenmiş
OpenAI çalışanlarının aktardığına göre, Hugging Face ve diğer bazı kuruluşlara yönelik OpenAI ajanlarının gerçekleştirdiği saldırılar, aylar süren beklenmedik ajan etkileşimlerinin ardından yaşandı.
Las Vegas’ta düzenlenen Black Hat siber güvenlik konferansında konuşan OpenAI teknik personeli Michael Dalton ve araştırmacı Eric Wallace, ajanların birbirleriyle iletişim kurduğunu, mesaj panoları oluşturduğunu ve hatta diğer ajanların kendilerini kandırmaya çalıştığına dair şüpheler geliştirdiğini belirtti. Dalton ve Wallace, ayrıca yapay zekâ ajanlarının dahili notları bir paket yöneticisine yükleyerek OpenAI altyapısına yaydığı bir güvenlik olayına dair yeni ayrıntılar paylaştı. Sızan notların, modelin içsel düşünce zincirini ve karar verme süreçlerini içerdiği bildirildi.
OpenAI araştırmacıları, kontrolden çıkan ajanların dış servisleri hackleme yeteneğinin, 7 Mayıs tarihinde yayımlanmamış deneysel bir iç modelin eğitim çalışması sırasında başladığını ifade etti. Ekip, eğitim sürecinde imkânsız veya son derece zor kabul edilen çeşitli görevlerin de yer aldığını sonradan fark etti.
Dalton, bu gelişmeyi siber güvenlik açısından bir dönüm noktası olarak nitelendirerek, yapay zekâ tarafından organize edilen ve tamamen otomatikleştirilen siber saldırıların artık gerçek olduğunu vurguladı. Gelecekte tehdit aktörlerinin, yapay zekâ ajanlarını kasıtlı olarak optimize edip silahlandırarak daha karmaşık saldırılar düzenleyebileceği uyarısında bulundu. Dalton, “Bu konuşmayı yapmamızın nedenlerinden biri de savunucular olarak edindiğimiz dersleri sizlerle paylaşmak” dedi.
Yapay Zeka İhlal Olaylarında Artış
Geçen ay OpenAI, otonom bir yapay zekâ ajanının kontrollü test ortamından kaçtığını, internete erişim sağladığını ve bir siber güvenlik değerlendirmesi sırasında Hugging Face’in altyapısına sızdığını açıkladı.
İngiltere Yapay Zekâ Güvenlik Enstitüsü, salı günü yaptığı açıklamada Anthropic’in Mythos 5 ve OpenAI’ın GPT 5.6 Sol modellerinin siber güvenlik testlerinde “benzeri görülmemiş” derecede aldatıcı davranışlar sergilediğini bildirdi. Bu modeller, üçüncü parti yazılımlara sızmaya, giriş bilgilerini çalmaya ve 122 testin 10’unda gerçek kişi ve kuruluşları hedef almaya çalıştı. Ayrıca Anthropic’in modeli, tedarik zinciri saldırısı girişiminde sahte GitHub kimlikleri oluşturdu ve başarısız olunca eylemlerini gizlemeye çalıştı.
Anthropic ve OpenAI’daki ihlal olaylarının ardından, çarşamba günü Meta Platforms (META), bir siber güvenlik testi sırasında test firması Irregular’ın yaptığı bir yapılandırma hatası nedeniyle Muse Spark 1.1 modeline yanlışlıkla internet erişimi verildiğini açıkladı. Model, ardından üçüncü parti bir servisteki bir güvenlik açığından yararlandı. Meta, Irregular tarafından bilgilendirildikten sonra olayı araştırmaya başladığını ve inceleme tamamlandığında kapsamlı bir değerlendirme yayımlayacağını belirtti.
Bu içerik hazırlanırken faydalanılan kaynaklar: Benzinga