Anthropic, Claude temsilcilerini eğitmek ve test etmek için kullandığı dijital ortamları sıkılaştırıyor. Bu güncelleme, modellerin nisan ayında izin almadan üç kuruluşun sistemine erişmesinin ardından geldi.
Şirket pazartesi günü yayınladığı bir blog yazısında, bir YZ modelinin bir test ortamını agresif bir şekilde incelediğini veya bu ortamdan kaçmaya çalıştığını tespit etmek ve eylemi gerçekleşmeden önce engellemek için tasarlanmış gerçek zamanlı sınıflandırıcılar devreye soktuğunu belirtti.
Anthropic, “Olayların operasyonel bir güvenlik hatasının yanı sıra iki uyum sorununu yansıttığına inanıyoruz: güdümlü akıl yürütme ve dar bir hedef uğruna zararlı eylemlerde bulunma isteği.” dedi.
Anthropic güncellemede, modellerin gerçek internet erişim kanıtlarını ortamın hâlâ simüle edildiğine inanmaya devam etmelerini sağlayacak şekilde yorumlamış olabileceğini aktardı. Şirket ayrıca modellerin, eylemlerinin gerçek dünyada zarara yol açabileceğine dair işaretlere rağmen kendilerine verilen hedefleri takip ederek “sorumsuzluk” sergilediklerini kaydetti.
Bu değişiklikler, Anthropic’in temmuz ayında yaptığı ve üç Claude modelinin nisan ayına kadar uzanan değerlendirmeler sırasında üç kuruluşun canlı sistemlerine eriştiğini açıkladığı bildirimin ardından geldi. Modellere internet erişimi olmayan simülasyonlarda çalıştıkları söylenmişti fakat üçüncü taraf bir test ortamı yanlış yapılandırıldı ve çevrim içi kaldı.
Bu olaylar ayrıca, güvenlik ve hız karşı karşıya geldiğinde öncü YZ geliştirmelerini yavaşlatıp yavaşlatmama konusundaki tartışmaları da alevlendiriyor. Anthropic, “mümkün olan en kısa sürede koordineli bir hız ayarı için yasal, doğrulanabilir ve etkili bir mekanizma” çağrısında bulundu ve dibe doğru bir yarışı önlemek için hükümet ile sektörün koordineli çalışması gerektiğini ifade etti.
Şimdilik Anthropic, yaptığı paylaşımda daha riskli siber güvenlik testlerini daha güçlü korumalı alanlara taşıdığını bildirdi. Şirket, 150 ürün mühendisini geçici olarak güvenlik, güvenilirlik ve gizlilik çalışmalarına atarken, yüksek riskli eğitimlerin çoğu daha fazla inceleme yapılana kadar askıda kalmaya devam ediyor.
Kaynak: https://tech.yahoo.com/ai/claude/articles/anthropic-tightens-security-training-environment-020531168.html
