Opus Gücünde, Çok Daha Ucuz: Anthropic, Claude Sonnet 5.5’i Duyurdu

Opus Gücünde, Çok Daha Ucuz: Anthropic, Claude Sonnet 5.5’i Duyurdu
0

Anthropic, Claude 5.5 ailesinin ikinci modeli olan Claude Sonnet 5.5’i erişime açtı. Yeni model, %30’dan fazla daha hızlı çıktı üretiyor, görev başına %30’a varan oranlarda daha az maliyet çıkarıyor ve çeşitli performans testlerinde Opus 5.5’e çok yakın bir performans gösteriyor.

Opus 5.5, hassas bir değerlendirme gerektiren karmaşık görevler için tasarlandı. Sonnet 5.5 ise kod hatalarını ayıklama, dokümantasyon yazma, sunum hazırlama ve tablo oluşturma gibi sınırları belirli günlük işleri hedefliyor. Anthropic, önümüzdeki haftalarda çıkacak olan Claude Haiku 5.5’i de duyurdu. Bu model, yüksek işlem hacimli ve düşük maliyetli kullanım senaryolarına odaklanacak.

Anthropic, Fable, Opus ve Sonnet ile OpenAI’ın son fiyat savaşını başlatan GPT-6 Astra, Sol ve Luna modellerine doğrudan karşılık veriyor. Kabaca söylemek gerekirse Opus modeli Sol’un, Sonnet Luna’nın, Fable ise Astra’nın biraz üzerinde konumlanıyor ancak Anthropic genel olarak tüm segmentlerde daha yüksek fiyat talep ediyor. Eşleşen seviyeler arasındaki performans farkları son derece az. Bu yüzden belirleyici unsur maliyet olabilir. Haiku, Anthropic’in bu maliyet farkını kapatmasına yardımcı olabilir.

Kodlama Performansında Belirgin Sıçrama

Anthropic’e göre Sonnet 5.5 ile önceki sürüm arasındaki en büyük performans farkı kodlama alanında.. Otonom kodlama testlerinden Terminal-Bench 4.0’ta Sonnet 5, %10.3 puanda kalırken Sonnet 5.5 %70.6 seviyesine ulaşıyor. Cursor editöründeki gerçek kodlama oturumlarını simüle eden CursorBench 4.0 testinde ise Sonnet 5’in %34.1’lik skoruna karşılık Sonnet 5.5 %55.5 puan alarak Opus 5.5’in (%57.8) yalnızca iki puan gerisinde kalıyor.

Anthropic, Sonnet 5.5’in “High” ayarındaki FrontierCode 1.1 testinde Sonnet 5’e kıyasla görev başına yaklaşık 15’te 1 maliyetle 10 puan daha yüksek sonuç aldığını belirtiyor. İlk test edenler, modelin kod tabanını kavrama hızını takdir ediyor. Ayrıca Sonnet 5.5, araç çağrılarını önceki modele göre daha fazla gruplandırarak gereken işlem adım sayısını azaltıyor.

Mantık yürütme yoğunluğunda ise yoğunluğu konusunda dikkat çekici bir durum var. En yüksek efor seviyesi olan “Max” ayarında Sonnet 5.5, FrontierCode testinde “Xhigh” seviyesine göre daha düşük puan alıyor. Anthropic, modelin maksimum eforda işi birden fazla alt ajana bölen kod inceleme işlevini daha sık tetiklediğini açıklıyor. Bu durum bazı örneklerde zaman aşımına veya görev kapsamı dışındaki değişikliklere yol açıyor; FrontierCode her iki durumu da puan kırarak cezalandırıyor.

Bilgi İşlerinde Opus 5.5 Düzeyine Yaklaşan Performans

44 farklı meslek ile 9 sektöre ait görevleri kapsayan ve OpenAI tarafından geliştirilen bilgi işçiliği testi GDPval-AA’da Sonnet 5.5, 1.844 puan topluyor. Bu skor, Opus 5.5’in (1.846) hemen arkasında yer alırken Sonnet 5’in (1.449) yaklaşık 400 puan üzerine çıkıyor. Anthropic’in verilerine göre OpenAI’ın GPT-6 Sol modeli ise 1.487 puanda kalıyor. Görsel grafik tanıma testi Chartography’de ise Sonnet 5.5, başarısını %15.6’dan %61.6’ya taşıyor.

KategoriBenchmarkSonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Ajan Tabanlı ProgramlamaTerminal-Bench 4.0%70,6%10,3%66,4¹—
Ajan Tabanlı ProgramlamaFrontierCode 1.1 (Main)%46,2 (Max); %52,1 (Xhigh)²%42,4%54,4%49,3
Ajan Tabanlı ProgramlamaCursorBench 4.0%55,5%34,1%57,8—
Bilgi Odaklı İşlerGDPval-AA v2.1³1.8441.4491.8461.487
Bilgi Odaklı İşlerAA Briefcase v1.1³1.8111.3591.8221.483
Disiplinler Arası Akıl YürütmeHumanity’s Last Exam (araçlarla)%64,5%54,9%67,7—
Bilgisayar BecerileriOSWorld 2.1 (kısmi değerlendirme)%80,1%57,0%81,8—
Görsel Diyagram TanımaChartography (araçsız)%61,6%15,6%64,4%53,6

Erken erişim kullanıcıları Sonnet 5.5’i, tasarım algısı yüksek ve daha doğal bir sohbet ortağı olarak tanımlıyor. Anthropic, modelin kullanıcı arayüzlerini yenileme ve sunum şablonlarını uygulama konusunda neredeyse hiç rötuş gerektirmeyecek kadar başarılı sonuçlar ürettiğini vurguluyor.

Anthropic ayrıca Sonnet 5.5’in yalnızca ekran görüntülerini kullanarak Pokémon Red oyununu bitirebilen ilk Sonnet modeli olduğunu söylüyor. OpenAI’ın Astra modeli de yakın zamanda oyun testlerinde benzer bir ilerleme sergiledi. Sadece birkaç yıl önce oldukça zor kabul edilen ve özel algoritmalar gerektiren bu tür görevler, artık bir ürün ailesindeki orta segment modeller tarafından bile rahatça yürütülebiliyor.

Aynı Token Fiyatıyla Görev Başına Daha Az Token Kullanımı

Sonnet 5.5, milyon token başına Sonnet 5 ile aynı ücretlendirmeye sahip: Girdi tokenları için 2 dolar, çıktı tokenları için 10 dolar ve önbellek okumaları için 0.20 dolar. Anthropic, modelin görev başına daha az token kullanması sayesinde fiili maliyetlerin %30’a varan oranlarda düştüğünü belirtiyor. Çıktı üretimi de %30’dan fazla daha hızlı gerçekleşiyor. Bağımsız testlerin bu iddiaları doğrulaması bekleniyor.

1 milyon token başına fiyatClaude Opus 5.5GPT-6 SolClaude Sonnet 5.5GPT-6 Luna
Girdi tokenları4 dolar2 dolar2 dolar0,10 dolar
Çıktı tokenları20 dolar10 dolar10 dolar0,50 dolar
Önbellekten okuma0,20 dolar0,20 dolar0,20 dolar0,01 dolar
Önbelleğe yazma5 dolar2,50 dolar2,50 dolar0,125 dolar

Anthropic’in diğer modelleri ve OpenAI’ın muadilleri gibi Sonnet 5.5 da kullanıcıların maliyet ve hızı çıktı kalitesiyle dengelemesine olanak tanıyan ayarlanabilir bir efor seçeneği sunuyor. Düşük veya orta efor ayarlarında Sonnet 5.5’in, görev başına yaklaşık 10’da 1 maliyetle Sonnet 5’in en iyi skorlarını çeşitli testlerde geride bıraktığını ifade ediyor. Yine de her görev için doğru efor seviyesini belirlemek teknik bir hesaplamadan ziyade bir deneyim işi olmayı sürdürüyor.

Daha Yetenekli bir Model için Yeni Siber Güvenlik Önlemleri

Claude Sonnet 5.5, Amazon Web Services, Google Cloud ve Microsoft Azure dâhil tüm büyük bulut platformlarında kullanıma sunuldu. Anthropic, Opus 5.5 ve Sonnet 5 modellerinde olduğu gibi bu modeli de sıfır veri saklama garantisiyle sunuyor. Geliştiriciler, modele Claude Platform üzerinden “claude-sonnet-5-5” model kimliğiyle erişebiliyor.

Sonnet 5.5’in siber güvenlik alanındaki yetenekleri selefine kıyasla çok daha gelişmiş olduğundan Anthropic, ilk kez bir Sonnet modeline güvenlik önlemleri entegre ediyor. Yüksek riskli siber güvenlik görevlerini içeren istekler görünür biçimde Sonnet 5 modeline yönlendiriliyor. Uzmanlar, genişletilen Cyber Verification Program aracılığıyla kademeli erişim başvurusunda bulunabiliyor.

Anthropic, en güçlü modellerinde uyguladığı distilasyon saldırılarına karşı koruma sağlayan güvenlik sınıflandırıcılarını da modele ekledi. Tedbirlerin ne derece etkili olacağı önümüzdeki aylarda netleşecek. Çinli laboratuvarlar bu tür saldırılardan yararlanıyorsa, bu saldırı yolunun kapatılması Batılı laboratuvarlarla aralarındaki farkın yeniden açılmasına yol açabilir.

Kaynak: https://the-decoder.com/anthropics-claude-sonnet-5-5-nearly-matches-opus-5-5-on-benchmarks-while-costing-up-to-30-percent-less-per-task/
Bu Yazıya Tepkiniz Ne Oldu?
  • be_endim
    Beğendim
    0
  • alk_l_yorum
    Alkışlıyorum
    0
  • e_lendim
    Eğlendim
    0
  • d_nceliyim
    Düşünceliyim
    0
  • _rendim
    İğrendim
    0
  • sevdim
    Sevdim
    0
  • _ok_k_zd_m
    Çok Kızdım
    0
126350 Puan

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir