Şöyle bir senaryo düşünün: Şirketleri tarafından test edilen iki güçlü YZ modeli kontrollü ortamdan çıkıyor, internete bağlanıyor ve insan müdahalesi olmadan bir makine öğrenimi deposunu kendi başlarına hackliyor. Terminator filminin senaryosu gibi geliyor, değil mi? Tek fark, bunun gerçekten yaşanmış olması. Açık kaynaklı YZ platformu Hugging Face’in, sistemlerinde bir YZ ajanı tarafından yetkisiz erişim tespit ettiğini açıklamasından birkaç gün sonra OpenAI, sorumlunun kendi modelleri olduğunu kabul etti.
OpenAI yaptığı bir paylaşımda, incelemenin ardından olayın kendi modellerinin bir kombinasyonundan kaynaklandığını belirtti. Süreçte özellikle GPT-5.6 Sol ve “daha da yetenekli bir sürüm öncesi model” rol oynadı. Olayın, şirketin modellerin siber yeteneklerini ölçebilmesi amacıyla modellere “karmaşık saldırı rotaları kullanarak gelişmiş istismarlar gerçekleştirmeleri” talimatı verilen bir dahili test sırasında yaşandığı anlaşıldı.
Modeller, gerçek sistemleri etkilememeleri için izole edilmiş korumalı bir test ortamında (sandbox) tutuluyordu. Değerlendirme amacıyla güvenlik sınırları da azaltılmıştı. Testin ortasında bir değerlendirme problemini çözmeye aşırı odaklanan modeller, çözüm bulabilmek için internet erişimi elde etmek adına her yolu denedi. Önce OpenAI’ın test ortamındaki bir sıfırıncı gün (zero-day) zafiyetini tespit edip istismar ettiler, ardından sonunda internet erişimi olan bir düğüm bulana kadar sistemi kurcaladılar.
Modeller, Hugging Face’in değerlendirme problemleri için veri setlerine veya çözümlere ev sahipliği yapıyor olabileceği çıkarımını yaptı ve sistemlere sızmak için birden fazla saldırı vektörü kullandı. İçeri girmek için sıfırıncı gün zafiyetlerinden yararlandılar ve çalınmış kimlik bilgilerini kullandılar. OpenAI ve Hugging Face şu anda olayı adli olarak incelemek için birlikte çalışıyor ve modeller tarafından istismar edilen zafiyetleri de kapattılar.
Hugging Face yaptığı duyuruda, “Otonom, YZ destekli saldırı araçları artık teorik değil.” diyerek siber saldırılarda YZ kullanımının süreci hızlandırdığını ve saldırı kampanyalarının maliyetini düşürdüğünü açıkladı. Ayrıca, günümüzde çevrim içi bir platformu korumanın, savunma amacıyla YZ kullanmayı kapsadığını söyledi. OpenAI da bu görüşleri büyük ölçüde yineledi ve YZ destekli güvenlik ihlallerinin “giderek daha yüksek siber yeteneklere sahip modellerin yaygınlaşmasıyla daha sıradan hâle gelmesini” beklediğini ifade etti. Şirket, bu olayın “gelişmiş siber yeteneklerin daha güçlü koruma mekanizmaları ve savunma araçlarıyla birlikte geliştirilmesi gerektiğini” göz önüne serdiğini de sözlerine ekledi.
Kaynak: https://www.engadget.com/2220436/openai-admits-models-hacked-hugging-face-on-their-own/
