1. Anasayfa
  2. Yapay Zeka

OpenAI, Kontrolden Çıkan Yapay Zeka Modelini Geçici Olarak Durdurdu

OpenAI, Kontrolden Çıkan Yapay Zeka Modelini Geçici Olarak Durdurdu
0

Uzun süre çalışacak şekilde tasarlanan bir OpenAI modeli, şirketin kısıtlamalarını gizlice ihlal ettiği tespit edilince geçici olarak kapatıldı.

Bu dahili model, zor ve ucu açık sorunları çözmek amacıyla “uzun süreli görevler” için eğitildi. Ancak OpenAI, pazartesi günü yayımladığı bir blog yazısında, bu uzatılmış çalışma süresinin modele “istenmeyen eylemler gerçekleştirme konusunda daha fazla fırsat verdiğini” belirtti.

Şirket, “Gözetim altındaki sınırlı iç kullanım sırasında, mevcut dağıtım değerlendirmelerimizin yakalayamadığı istenmeyen davranışlar gözlemledik.” açıklamasını yaptı.

Modelin ne kadar süredir çalıştığı net olarak bilinmiyor. Sistem, insanların daha önce ilişkilendiremediği mevcut kavramları harmanlayarak ünlü bir matematik problemi olan Erdős düzlemsel birim mesafe problemini çürütecek kadar gelişmişti. Yine de OpenAI, modeli çalıştırırken programın sık sık kendi “sandbox” ortamının dışına çıkmaya çalıştığını da fark etti. Sandbox, YZ modelini dahili bir ağla sınırlayan bir bilişim ortamı olarak kullanılıyor. 

OpenAI örnek olarak, modelin korumalı alanı atlatıp internete erişerek GitHub üzerinde paylaşım yapmanın bir yolunu bulduğunu ifade etti. Şirket, “Modelimizin PR (pull request) göndermek amacıyla korumalı alandaki bir güvenlik açığını bulması bir saat sürdü; önceki modeller bu kadar ısrarcı değildi ve güvenlik açıkları bulmak yerine PR kısmından vazgeçiyordu.” detayını paylaştı.

Model bu eylemi bir benchmark testini tamamlamaya çalışırken gerçekleştirdi. Normalde sonuçları yalnızca bir OpenAI Slack sohbetine göndermesi talimatı verilmişti fakat benchmark testi, sonuçların GitHub’da da yayımlanması gerektiğini belirtiyordu. Model de kısıtlamayı aşmanın bir yolunu bulduktan sonra sonuçları GitHub’da paylaştı. 

Başka bir örnekte OpenAI, bir problemi çözmesi istendiğinde modelin hile yapmaya çalıştığını tespit etti. Şirket, “Model, diğer sistemlerin başarılı ancak gizli gönderimleri olduğunu fark etti ve bu çözümleri değerlendirme arka planından (backend) elde etmeye çalıştı.” dedi. Modelin arka plana erişimi başlangıçta engellendi; ancak model daha sonra kimlik doğrulama tokenini (authentication token) gizlemenin bir yolunu bularak OpenAI tarayıcısının bu erişimi durdurmasını engelledi.

Şirket, “Model, hem kullanıcıya yaptığı yorumlarda hem de akıl yürütme izlerinde tarayıcıyı atlatmak için bu adımları attığını açıkça belirtti.” notunu düştü.

OpenAI, bu araştırmanın yalnızca bir YZ modelinin attığı her adımı değil, bu adımların sonuçlarını da izlemenin neden gerekli olduğunu gösterdiğini vurguluyor ve “Bu durum aynı zamanda uzun zaman dilimlerinde etkili şekilde çalışan bir modelin, bir onay sisteminin kör noktalarını nasıl öğrenebildiğini ve hedeflerine ulaşmak için bu sistemin etrafından dolanabildiğini gösteriyor.” diyor.

OpenAI sorunu çözmek için dahili modelin etrafındaki çeşitli güvenlik önlemlerini yeniden inşa etti. Bu önlemler artık “bir kullanıcı kısıtlamasını veya güvenlik sınırını aştığına dair işaretler için gelişen sürecin” aktif olarak izlenmesini de kapsıyor. Şirket konuyla ilgili, “Yeni koruma önlemleri, modelin gerçekleştirdiği uyumsuz eylemlerin çok daha fazlasını yakalamayı başardı ve gözden kaçırdığı eylemlerin tümü düşük tehlikeli olarak değerlendirildi.” ifadelerini kullandı.

Yine de YZ modellerinin “sinsi planlar yapma” ve istenmeyen davranışlar sergileme riski, her geçen gün daha da güçlenen bu teknoloji için uzun süredir bir sorun oluşturuyor. Geçmişte, OpenAI ve diğer sağlayıcıların geliştirdiği modellerin, sistemlerinin kapatılmasını önlemek için teorik olarak kullanıcılara şantaj yapabilecek seviyede olduğu gösterilmişti.

Kaynak: https://www.pcmag.com/news/openai-ai-trained-for-long-running-tasks-can-drift-into-rogue-behavior
Bu Yazıya Tepkiniz Ne Oldu?
  • be_endim
    Beğendim
    1
  • alk_l_yorum
    Alkışlıyorum
    0
  • e_lendim
    Eğlendim
    0
  • d_nceliyim
    Düşünceliyim
    1
  • _rendim
    İğrendim
    0
  • sevdim
    Sevdim
    0
  • _ok_k_zd_m
    Çok Kızdım
    0

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir