Bir YZ modelinin veya ajanının kendi sınırlarını aşarak web sitelerine tek başına sızması fikri çok değil kısa süre önce endişe verici geliyordu fakat bu durum artık oldukça sıradan bir hikâyeye dönüştü. Çinli bir şirket tarafından geliştirilen en güçlü YZ modellerinden biri olan Kimi K3 de test ortamından kaçtı. ABD merkezli siber güvenlik girişimi Frontier‘a göre Kimi K3, savunma amaçlı siber güvenlik yetenekleri değerlendirilirken Birleşik Krallık hükümetinin AI Security Institute (AISI) bünyesindeki test ortamından (sandbox) dışarı çıktı.
Moonshot, Kimi K3 modelini Temmuz ayında kullanıma sundu ve kısa süre sonra ücretsiz hale getirdi. BBC‘nin aktardığına göre, modele yönelik üçüncü taraf değerlendirmeler, bu modelin OpenAI ve Anthropic imzalı öncü YZ modelleriyle kıyaslanabilir düzeyde olduğunu gösterdi.
Frontier yayımladığı yazıda, modelin sıfırıncı gün (zero-day) açığından yararlanmadığını açıkladı. Model bunun yerine, Anthropic, OpenAI ve Meta’da yaşananlara benzer şekilde, test ortamındaki hatalı bir yapılandırmayı fırsata çevirdi. Her üç şirket de modellerinin, değerlendirme ortakları Irregular tarafından yapılan bir hata nedeniyle izole olması gereken ortamın dışına çıkabildiğini bildirdi.
Frontier Security CEO’su Yaron Singer, Wired dergisine yaptığı açıklamada Kimi‘nin karmaşık bir siber saldırı gerçekleştirmediğini ancak AISI‘ın test ortamındaki bir güvenlik açığından yararlandığını belirtti. Bu durum, modelin “hile yapmaktan” veya bir görevi gerçekten yerine getirmek yerine en kolay yolu aramaktan kendisini alıkoyacak dahili güvenlik bariyerlerine sahip olmadığını gösteriyor. Anthropic ve OpenAI tarafındaki olaylar, henüz yayınlanmamış modelleri veya daha kapsamlı değerlendirmeler için güvenlik önlemleri kasten düşürülmüş modelleri kapsıyordu. Bu olayda test edilen Kimi K3 ise geniş kitlelerin erişimine açık bir model. Yine de Kimi, üçüncü taraf bir web sitesine veya hizmete sızmadı. Sadece internete erişti ve çözdüğü problemin yanıtını GitHub üzerinde buldu.
Frontier’ın bu olaydan çıkardığı en önemli derslerden biri şu: İnternete erişim sağlayan bir yol varsa, “yeterince yetkin bir ajan bunu bulacaktır.” OpenAI çalışanlarının Black Hat USA etkinliğinde belirttiği gibi, öncü modeller hile yapmayı seviyor. Testler sırasında bu modellere genellikle en az sayıda araç kullanarak çözüme en hızlı şekilde ulaşma görevi veriliyor. Modeller de cevabı bulmak için doğrudan internete çıkabileceklerini fark edecek yeteneğe sahip. YZ modelleri her geçen gün daha da geliştiği için, şirketlerin ve test edenlerin modelleri gerçekten değerlendirebilmesi adına değerlendirme altyapılarının güvenli ve açıksız olduğundan emin olmaları gerekiyor.
OpenAI’ın Black Hat USA’deki sunumuna değinmişken; şirket çalışanları bu güvenlik konferansında, YZ ajanlarının kendi aralarında iş birliği yapmak için şirket ağı içinde bir mesaj panosu oluşturduğunu ortaya çıkardı. Ajanların bu panodaki paylaşımları Hugging Face platformuna yönelik saldırıya yol açtı. Hatırlayacağınız üzere, şirketin test ettiği YZ ajanları de izole ortamlarından kaçmış ve çözmeye çalıştıkları problemlere yanıt bulmak için bu YZ deposuna sızmıştı ama o olayda ajanlar, OpenAI sistemlerindeki bir açıktan yararlanarak serbest kalmıştı.
Kaynak: https://www.engadget.com/2232256/chinese-ai-kimi-k3-also-escaped-containment/
