The New York Times’ın üç yıl önce OpenAI ve Microsoft’a açtığı telif hakkı davasında gizliliği kaldırılan yeni bilgiler, YZ için yapılan veri toplama (scraping) faaliyetlerinin hırsızlığa eşdeğer görüldüğünü ve YZ ürünlerinin yayıncılar için büyük bir tehdit oluşturduğunu gösteren itirafları ortaya çıkarıyor.
Dava dosyasına göre, üst düzey bir Microsoft yöneticisi şirketlerin YZ eğitim uygulamalarını özel görüşmelerde “hırsızlık” olarak tanımladı. OpenAI’ın kendi yönetimi ise geliştirdikleri YZ modellerinin, sistemleri eğiten içeriklerin sahibi olan yayıncılar ve gazeteciler için “varoluşsal bir tehdit” oluşturduğunu belirtti.
Gizliliği kaldırılan belgeler, şirketlerin ödeme duvarlarını (paywall) fark edilmeden aşarak, kitleler halinde veri toplayıp eğitim veri setleri oluşturduğunu ve telif hakkı bildirimlerini eğitim verilerinden kasten temizlediğini detaylandırıyor.
Yeni bilgilerin büyük bir kısmının doğrudan yayıncıların sunduğu dava özetinden geldiğini ve belgelerin aslının henüz gizli tutulduğunu belirtmekte fayda var. Haberimizde birazdan göreceğiniz Microsoft/OpenAI iç yazışmalarından alınan sözler, orijinal belge ve yazışmaların tam bağlamı olmadan aktarılıyor.
Gizliliği kaldırılan bu dosya, The New York Times’ın iki şirketi üretken YZ modellerini kendi içerikleriyle eğiterek telif hakkını ihlal etmekle suçladığı üç yıllık davada yeni bir tırmanışa işaret ediyor.
YZ şirketlerinin telif hakkıyla korunan materyalleri modellerini eğitmek için yasal olarak kullanıp kullanamayacağı sorusu henüz netleşmedi fakat yargıçlar genel olarak YZ şirketlerinin eğitimin bir “adil kullanım” teşkil ettiği yönündeki savunmalarına yakın duruyor. Bu yasal kural, parodi, haberleşme veya eleştiri gibi belirli durumlarda telifli eserlerin izinsiz kullanılmasına olanak tanıyor. Bu ayın başlarında Trump yönetimi, OpenAI’ın büyük dil modellerini (LLM) eğitmek için telifli materyalleri lisanssız kullanmasını savunan bir hukuki görüş sundu.
Ancak ortaya çıkan yeni itirafların birçoğu, OpenAI’ın adil kullanım savunmasıyla, özellikle de kullanımın orijinal eserin pazarına zarar vermemesi veya onun yerini almaması şartıyla çelişiyor.
Örneğin Microsoft’un kendi verileri, Copilot “yanıt motorunun” The New York Times alan adına sağladığı tıklama oranlarını geleneksel Bing aramasına kıyasla %93’e kadar düşürdüğünü gösteriyor. Microsoft Uygulamalı Bilimler Direktörü Brent Hecht tarafından Ocak 2024’te hazırlanan şirket içi bir sunum, bu düşüşü hem modellerin hem de tüm webin performansına zarar verecek bir “kıyamet döngüsü” olarak tanımlıyor.
Dava dosyasında aktarıldığı şekliyle Microsoft belgesinde, “Bir nihai ürünün, kendi temel tedarikçilerinin ekonomik temellerini tehdit etmesi son derece sıra dışı bir durumdur ancak büyük dil modeli işimizin ‘içerik tedarik zinciri’ açısından yarattığımız tablo tam olarak budur.” ifadesi yer alıyor.
Microsoft CEO’su Satya Nadella da bu yılın başlarında verdiği ifadesinde, “Ödeme duvarı arkasında yer alan her şeyin, bunu temel alma veya eğitim amacıyla kullanmak isteyen herkes tarafından lisanslanması gerektiğini” belirtti. Nadella, “OpenAI’ın ödeme duvarı arkasındaki bilgileri topladığından ve bunlarla model eğittiğinden haberdar edilseydim, OpenAI’ın modellerini yeniden eğitmesini talep etme hakkımı kullanırdım.” diyerek tutumunu netleştirdi.
Diğer itiraflar da adil kullanım testinin farklı dayanaklarıyla çelişiyor. OpenAI ChatGPT Başkanı Nick Turley, şirket içi yazışmalarda yayıncıların sohbet botu gibi ürünler karşısında “varoluşsal bir tehdit” ile karşı karşıya olduğunu belirterek bu ürünlerin “büyük ölçüde doğrudan kaynağın yerini aldığını ve geliştikçe daha da fazla yerini alacağını” yazdı.
OpenAI Başkanı Greg Brockman ise modelleri “habercilikte mükemmel” olarak tanımladı. Nadella da bu yıl yeminli ifadesinde, sohbet botlarıyla etkileşime girmenin “orijinal kaynağa gitme ihtiyacını ortadan kaldırarak bilgiyi doğrudan YZ platformunda sunma yoluyla web sitesinin yerini aldığını” kabul etti.
Bu tür ifadeler, teknolojinin orijinal eseri dönüştürmekten ziyade ona doğrudan rakip olduğunu gösteriyor.
Bir Microsoft belgesi, üretken YZ’nin “temel modelin eğitildiği verileri üreten kişilerin istihdamını ciddi şekilde aksatması yönünde gerçek bir risk” bulunduğunu ifade ediyor.
Kopyalamanın muazzam boyutu da dikkat çekici. Belgeler ilk kez, yalnızca OpenAI’ın eğitimin orta aşamasında kullandığı veri setlerinde, NYT, Daily News ve Center for Investigative Reporting tarafından yayımlanan eserlerin 91.692’den fazla kopyasının bulunduğunu ortaya koyuyor. Common Crawl’dan türetilen bir veri setinde ise yalnızca nytimes.com’dan iki milyondan fazla belge yer aldı.
Hecht, Ocak 2023 tarihli şirket içi bir bilgi notunda durumu “benzeri görülmemiş boyutlarda hayret verici bir hırsızlık” ve “insanlık tarihindeki en büyük emek hırsızlığı” olarak nitelendirdi.
Dava dosyası ayrıca OpenAI ve Microsoft’un davacıların içeriklerini nasıl elde ettiğine dair yeni ayrıntılar sunuyor. Buna, içeriklerin Bing Index üzerinden taranması da dahil.
Belgede, “OpenAI, tüm GPT-3 eğitim veri setini Microsoft’a teslim etti; Microsoft da bunu OpenAI modellerini kendi ticari ürünlerine nasıl entegre edeceğini değerlendirmek için kullandı.Microsoft da benzer şekilde Project Taxi ve Project Mango adlı girişimler aracılığıyla OpenAI’a eğitim verisi sağladı.” deniyor.
Şirketlerin Project Mango verilerini, haber yayıncılarına ait en az 160.903 özgün eserin kopyasını içeren bir eğitim veri setine dönüştürdüğü iddia ediliyor.
İddialara göre OpenAI çalışanları, veri taramasından en yüksek verimi almak için ödeme duvarlarını fark edilmeden aşmaya yönelik bir plan geliştirdi. Belgelerde, OpenAI araştırmacısı Nick Ryder, Brockman’a “nytimes ödeme duvarını aşmak için bir yöntem” bulduğunu söylediğinde Brockman’ın “Ah, güzel” yanıtını verdiği görülüyor.
OpenAI çalışanlarının ayrıca WebText ve WebText2 gibi, toplanan haber içeriklerine aşırı derecede dayanan eğitim veri setleri oluşturduğu iddiası da mevcut. Araştırmacıların açık bir web veritabanı olan Common Crawl’dan milyonlarca makale çektiği belirtiliyor. Bulgular ayrıca, araştırmacıların “modelin kullanıcılara telif hakkı bildirimleri sunmasını istememeleri” nedeniyle, veriler modele ulaşmadan önce telif hakkı bildirimlerini kasten temizleme çabalarını da tarif ediyor.
New York Daily News avukatı Steven Lieberman, TechCrunch ile paylaşılan açıklamasında, “Burada ilk kez ortaya konan kanıtlar, OpenAI ve Microsoft’un yaptıkları şeyin yanlış olduğunu bildiklerini gösteriyor.” dedi.
Kaynak: https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/
