1. Anasayfa
  2. Öne Çıkanlar

SpaceXAI Grok 4.6’yı Yayınladı: GPT-5.6 Sol ve Fable 5’le Başa Baş

SpaceXAI Grok 4.6’yı Yayınladı: GPT-5.6 Sol ve Fable 5’le Başa Baş
0

Anthropic ve OpenAI için dişli bir rakip ortaya çıktı.

SpaceXAI, amiral gemisi model serisinin en son güncellemesi olan Grok 4.6‘yı kullanıma sundu. Şirket bu sürümü, Anthropic ve OpenAI‘ın mevcut en üst düzey modellerine doğrudan rakip olarak konumlandırıyor. Grok 4‘ten Grok 4.5‘e geçişin aksine bu sürüm, saf bir zeka artışından ziyade, uzun ve çok adımlı görevlerde kararlılıkla çalışabilen bir model olarak öne çıkıyor. Şirket, bu yaklaşımıyla bu yıl öncü laboratuvarların asıl rekabet alanına dönüşen kapsamlı kodlama oturumlarını, araştırma görevlerini ve uygulama geliştirme iş akışlarını hedefliyor.

SpaceXAI’a göre Grok 4.6, uzun otonom ajan süreçlerinde odağını kaybetmeyecek şekilde ayarlandı. Model, bir kod tabanını derinlemesine inceleme, bilinmeyen bir konuyu çok sayıda adımda araştırma veya ham bir ürün fikrini çalışan ve cilalanmış bir yazılıma dönüştürme gibi karmaşık görevleri başarıyla yürütüyor. Şirket, modelin uzun süreli görevlerde tek bir deneme yapıp durmak yerine, ilerlemeden önce kendi çıktılarını doğrulayan gelişmiş bir öz denetim davranışı sergilemeye başladığını belirtiyor.

Altyapıda Neler Değişti? 

xAI, Grok 4.6‘nın önceki sürümüne kıyasla daha uzun bir ikincil eğitim aşamasından geçtiğini söylüyor. Bu süreçte, mantık yürütme ve teknik derinliğe odaklanan model üretimi özel verilerin yanı sıra yoğun mühendislik veri kümelerinden ve optimizer ile eğitim hattı düzenlemelerinden yararlanıldı. Tüm bu adımlar, ardından gelen ince ayar (fine-tuning) ve pekiştirmeli öğrenme (reinforcement learning) aşamaları için daha sağlam bir temel oluşturdu.

Denetimli ince ayar aşamasında xAI, farklı mantık yürütme çabaları, ajan kurulumları ile STEM, yazılım mühendisliği ve genel bilgi işleri dahil çeşitli alanlardaki eğitim rotalarını yeniden üretmek için Grok 4.5‘i kullandı. Düşük kaliteli örnekler ise otomatik denetimlerle elendi. Pekiştirmeli öğrenme tarafında ise model, genel kodlama, bilgi işleri ile çekirdek optimizasyonu, web geliştirme ve CAD çalışmaları gibi daha uzmanlaşmış alanları kapsayan geniş bir ajan görev yelpazesinde eğitildi.

Ayrıca xAI, modelin görsel ve etkileşimli projelerdeki ilk denemelerinde Grok 4.5‘e kıyasla belirgin şekilde daha güçlü sonuçlar verdiğini iddia ediyor. Model, defalarca düzeltme yapmaya gerek duymadan, tek seferde bir uygulamanın genel yapısını ve tasarım dilini büyük oranda yakalayabiliyor.

Grok 4.6 Performans Testleri

xAI, Grok 4.6’yı bir dizi kodlama ve otonom ajan testinde OpenAI’ın GPT-5.6 Sol ve Anthropic’in Fable 5 modelleriyle karşılaştırdı. Elde edilen rakamlar, Grok 4.6‘nın rakiplerinin açıkça önünde veya gerisinde kalmak yerine onlarla aynı seviyede yer aldığını gösteriyor.

Dokuz ayrı performans testinden oluşan karma bir değerlendirme olan Artificial Analysis Intelligence Index‘te Grok 4.6, 61 puan alarak GPT-5.6 Sol Max ile birebir aynı skoru paylaştı ve 62 puan alan Fable 5 Max‘in sadece bir puan gerisinde kaldı. Karşılaştırma açısından, Grok 4.5 High aynı indekste 56 puan almıştı.

Bu tablo, xAI tarafından yayınlanan diğer değerlendirmelerin çoğunda da geçerliliğini koruyor:

  • GDPVal-AA v2: Grok 4.6, 1753 puanla liderliği göğüsledi; Fable 5 Max (1741) ve GPT-5.6 Sol Max‘i (1728) geride bıraktı.
  • CursorBench v3.2: Grok 4.6, %69,9 skoruyla Fable 5 Max‘in (%70,5) hemen ardında yer alırken GPT-5.6 Sol Max‘i (%67,2) geride bıraktı.
  • DeepSWE v1.1: Grok 4.6, nispeten daha zayıf kaldığı bu testte %65,9 puan alarak hem GPT-5.6 Sol Max‘in (%73) hem de Fable 5 Max‘in (%70) gerisinde kaldı.
  • FrontierCode v1.1 (Extended): Grok 4.6, %61,3 seviyesine ulaşarak Fable 5 Max‘in (%64,9) gerisinde kaldı fakat GPT-5.6 Sol Max‘i (%60,6) geçti.
  • APEX-Agents: Grok 4.6, %57,5 puan alarak GPT-5.6 Sol Max (%56,7) ile Fable 5 Max (%59,2) arasında konumlandı.
  • Terminal-Bench v3.0: Grok 4.6, %26 ile belirgin biçimde geride kaldı; GPT-5.6 Sol Max (%34,6) ve Fable 5 Max‘in (%34,1) bir hayli arkasında yer aldı.
  • APEX-SWE: Grok 4.6, %56,4 puan alarak Fable 5 Max‘in (%58,8) gerisinde kaldı; xAI, bu test için karşılaştırılabilir bir GPT-5.6 Sol Max verisi paylaşmadı.
  • AA-Briefcase: Grok 4.6, 1577 puanla bu değerlendirmenin de zirvesine yerleşerek Fable 5 Max (1574) ve GPT-5.6 Sol Max‘i (1502) az farkla geride bıraktı.
  • Harvey LAB (Vals): Grok 4.6, %15,8 skorla rahat bir liderlik elde etti; GPT-5.6 Sol Max (%2,5) ve Fable 5 Max‘in (%11,3) çok önünde yer aldı.

Tüm test kümesi incelendiğinde Grok 4.6, Grok 4.5 High modelini her bir kriterde açık arayla mağlup ediyor. Model, bazı testlerde liderliği alıp bazılarında geride kalsa da GPT-5.6 Sol Max ve Fable 5 Max ile gerçek anlamda rekabet ediyor ve farkın açılmasına izin vermiyor fakat tüm bu verilerin xAI tarafından bildirildiğini unutmamak gerek. Şirket, rakip modellerin sayısal değerlerini kendisi bizzat test etmek yerine yayınlanan sistem kartlarından veya kamuya açık liderlik tablolarından aldığını söylüyor.

Grok 4.6 Fiyatlandırması: Rakiplerinin Altında 

Grok 4.6‘nın kozunu en net oynadığı alan maliyet tarafı oldu. xAI, modelin fiyatını 1 milyon girdi tokenı için 2 dolar ve 1 milyon çıktı tokenı için 6 dolar olarak belirledi. Bu rakam, benzer öncü modellerin talep ettiği ücretin yaklaşık yarısı. Daha düşük gecikme süresi isteyen kullanıcılar için ise bu fiyatın iki katına sunulan daha hızlı bir sürüm seçeneği mevcut.

Erişilebilirlik

Grok 4.6, şu anda Cursor ve xAI‘ın kendi platformu Grok Build bünyesinde kullanıma sunuldu. Ayrıca model, API üzerinden ve OpenRouter, Vercel, Cloudflare gibi üçüncü taraf platformlar aracılığıyla da erişime açıldı. xAI, kullanıcıların yeni modeli denemesini teşvik etmek amacıyla lansmanın ardından ilk hafta boyunca hem Grok Build hem de Cursor içinde sunulan standart kullanım limitini iki katına çıkarıyor.

xAI, modelin güvenlik sistemlerinin genişleyen yeteneklerine paralel biçimde yeniden kalibre edildiğini aktarıyor. Şirkete göre bu süreç bugüne kadarki en kapsamlı dağıtım öncesi güvenlik testi turu. Yayın sonrası değerlendirmelerin ve üçüncü taraf incelemelerin kesintisiz devam ettiği de belirtiliyor.

Kaynak: https://officechai.com/ai/grok-4-6-benchmarks/
Bu Yazıya Tepkiniz Ne Oldu?
  • 0
    be_endim
    Beğendim
  • 0
    alk_l_yorum
    Alkışlıyorum
  • 0
    e_lendim
    Eğlendim
  • 0
    d_nceliyim
    Düşünceliyim
  • 0
    _rendim
    İğrendim
  • 0
    sevdim
    Sevdim
  • 0
    _ok_k_zd_m
    Çok Kızdım

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir