Anthropic, Claude 5.5 ailesinin ikinci modeli olan Claude Sonnet 5.5’i erişime açtı. Yeni model, %30’dan fazla daha hızlı çıktı üretiyor, görev başına %30’a varan oranlarda daha az maliyet çıkarıyor ve çeşitli performans testlerinde Opus 5.5’e çok yakın bir performans gösteriyor.
Opus 5.5, hassas bir değerlendirme gerektiren karmaşık görevler için tasarlandı. Sonnet 5.5 ise kod hatalarını ayıklama, dokümantasyon yazma, sunum hazırlama ve tablo oluşturma gibi sınırları belirli günlük işleri hedefliyor. Anthropic, önümüzdeki haftalarda çıkacak olan Claude Haiku 5.5’i de duyurdu. Bu model, yüksek işlem hacimli ve düşük maliyetli kullanım senaryolarına odaklanacak.
Anthropic, Fable, Opus ve Sonnet ile OpenAI’ın son fiyat savaşını başlatan GPT-6 Astra, Sol ve Luna modellerine doğrudan karşılık veriyor. Kabaca söylemek gerekirse Opus modeli Sol’un, Sonnet Luna’nın, Fable ise Astra’nın biraz üzerinde konumlanıyor ancak Anthropic genel olarak tüm segmentlerde daha yüksek fiyat talep ediyor. Eşleşen seviyeler arasındaki performans farkları son derece az. Bu yüzden belirleyici unsur maliyet olabilir. Haiku, Anthropic’in bu maliyet farkını kapatmasına yardımcı olabilir.
Kodlama Performansında Belirgin Sıçrama
Anthropic’e göre Sonnet 5.5 ile önceki sürüm arasındaki en büyük performans farkı kodlama alanında.. Otonom kodlama testlerinden Terminal-Bench 4.0’ta Sonnet 5, %10.3 puanda kalırken Sonnet 5.5 %70.6 seviyesine ulaşıyor. Cursor editöründeki gerçek kodlama oturumlarını simüle eden CursorBench 4.0 testinde ise Sonnet 5’in %34.1’lik skoruna karşılık Sonnet 5.5 %55.5 puan alarak Opus 5.5’in (%57.8) yalnızca iki puan gerisinde kalıyor.
Anthropic, Sonnet 5.5’in “High” ayarındaki FrontierCode 1.1 testinde Sonnet 5’e kıyasla görev başına yaklaşık 15’te 1 maliyetle 10 puan daha yüksek sonuç aldığını belirtiyor. İlk test edenler, modelin kod tabanını kavrama hızını takdir ediyor. Ayrıca Sonnet 5.5, araç çağrılarını önceki modele göre daha fazla gruplandırarak gereken işlem adım sayısını azaltıyor.
Mantık yürütme yoğunluğunda ise yoğunluğu konusunda dikkat çekici bir durum var. En yüksek efor seviyesi olan “Max” ayarında Sonnet 5.5, FrontierCode testinde “Xhigh” seviyesine göre daha düşük puan alıyor. Anthropic, modelin maksimum eforda işi birden fazla alt ajana bölen kod inceleme işlevini daha sık tetiklediğini açıklıyor. Bu durum bazı örneklerde zaman aşımına veya görev kapsamı dışındaki değişikliklere yol açıyor; FrontierCode her iki durumu da puan kırarak cezalandırıyor.
Bilgi İşlerinde Opus 5.5 Düzeyine Yaklaşan Performans
44 farklı meslek ile 9 sektöre ait görevleri kapsayan ve OpenAI tarafından geliştirilen bilgi işçiliği testi GDPval-AA’da Sonnet 5.5, 1.844 puan topluyor. Bu skor, Opus 5.5’in (1.846) hemen arkasında yer alırken Sonnet 5’in (1.449) yaklaşık 400 puan üzerine çıkıyor. Anthropic’in verilerine göre OpenAI’ın GPT-6 Sol modeli ise 1.487 puanda kalıyor. Görsel grafik tanıma testi Chartography’de ise Sonnet 5.5, başarısını %15.6’dan %61.6’ya taşıyor.
| Kategori | Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|---|
| Ajan Tabanlı Programlama | Terminal-Bench 4.0 | %70,6 | %10,3 | %66,4¹ | — |
| Ajan Tabanlı Programlama | FrontierCode 1.1 (Main) | %46,2 (Max); %52,1 (Xhigh)² | %42,4 | %54,4 | %49,3 |
| Ajan Tabanlı Programlama | CursorBench 4.0 | %55,5 | %34,1 | %57,8 | — |
| Bilgi Odaklı İşler | GDPval-AA v2.1³ | 1.844 | 1.449 | 1.846 | 1.487 |
| Bilgi Odaklı İşler | AA Briefcase v1.1³ | 1.811 | 1.359 | 1.822 | 1.483 |
| Disiplinler Arası Akıl Yürütme | Humanity’s Last Exam (araçlarla) | %64,5 | %54,9 | %67,7 | — |
| Bilgisayar Becerileri | OSWorld 2.1 (kısmi değerlendirme) | %80,1 | %57,0 | %81,8 | — |
| Görsel Diyagram Tanıma | Chartography (araçsız) | %61,6 | %15,6 | %64,4 | %53,6 |
Erken erişim kullanıcıları Sonnet 5.5’i, tasarım algısı yüksek ve daha doğal bir sohbet ortağı olarak tanımlıyor. Anthropic, modelin kullanıcı arayüzlerini yenileme ve sunum şablonlarını uygulama konusunda neredeyse hiç rötuş gerektirmeyecek kadar başarılı sonuçlar ürettiğini vurguluyor.
Anthropic ayrıca Sonnet 5.5’in yalnızca ekran görüntülerini kullanarak Pokémon Red oyununu bitirebilen ilk Sonnet modeli olduğunu söylüyor. OpenAI’ın Astra modeli de yakın zamanda oyun testlerinde benzer bir ilerleme sergiledi. Sadece birkaç yıl önce oldukça zor kabul edilen ve özel algoritmalar gerektiren bu tür görevler, artık bir ürün ailesindeki orta segment modeller tarafından bile rahatça yürütülebiliyor.
Aynı Token Fiyatıyla Görev Başına Daha Az Token Kullanımı
Sonnet 5.5, milyon token başına Sonnet 5 ile aynı ücretlendirmeye sahip: Girdi tokenları için 2 dolar, çıktı tokenları için 10 dolar ve önbellek okumaları için 0.20 dolar. Anthropic, modelin görev başına daha az token kullanması sayesinde fiili maliyetlerin %30’a varan oranlarda düştüğünü belirtiyor. Çıktı üretimi de %30’dan fazla daha hızlı gerçekleşiyor. Bağımsız testlerin bu iddiaları doğrulaması bekleniyor.
| 1 milyon token başına fiyat | Claude Opus 5.5 | GPT-6 Sol | Claude Sonnet 5.5 | GPT-6 Luna |
|---|---|---|---|---|
| Girdi tokenları | 4 dolar | 2 dolar | 2 dolar | 0,10 dolar |
| Çıktı tokenları | 20 dolar | 10 dolar | 10 dolar | 0,50 dolar |
| Önbellekten okuma | 0,20 dolar | 0,20 dolar | 0,20 dolar | 0,01 dolar |
| Önbelleğe yazma | 5 dolar | 2,50 dolar | 2,50 dolar | 0,125 dolar |
Anthropic’in diğer modelleri ve OpenAI’ın muadilleri gibi Sonnet 5.5 da kullanıcıların maliyet ve hızı çıktı kalitesiyle dengelemesine olanak tanıyan ayarlanabilir bir efor seçeneği sunuyor. Düşük veya orta efor ayarlarında Sonnet 5.5’in, görev başına yaklaşık 10’da 1 maliyetle Sonnet 5’in en iyi skorlarını çeşitli testlerde geride bıraktığını ifade ediyor. Yine de her görev için doğru efor seviyesini belirlemek teknik bir hesaplamadan ziyade bir deneyim işi olmayı sürdürüyor.
Daha Yetenekli bir Model için Yeni Siber Güvenlik Önlemleri
Claude Sonnet 5.5, Amazon Web Services, Google Cloud ve Microsoft Azure dâhil tüm büyük bulut platformlarında kullanıma sunuldu. Anthropic, Opus 5.5 ve Sonnet 5 modellerinde olduğu gibi bu modeli de sıfır veri saklama garantisiyle sunuyor. Geliştiriciler, modele Claude Platform üzerinden “claude-sonnet-5-5” model kimliğiyle erişebiliyor.
Sonnet 5.5’in siber güvenlik alanındaki yetenekleri selefine kıyasla çok daha gelişmiş olduğundan Anthropic, ilk kez bir Sonnet modeline güvenlik önlemleri entegre ediyor. Yüksek riskli siber güvenlik görevlerini içeren istekler görünür biçimde Sonnet 5 modeline yönlendiriliyor. Uzmanlar, genişletilen Cyber Verification Program aracılığıyla kademeli erişim başvurusunda bulunabiliyor.
Anthropic, en güçlü modellerinde uyguladığı distilasyon saldırılarına karşı koruma sağlayan güvenlik sınıflandırıcılarını da modele ekledi. Tedbirlerin ne derece etkili olacağı önümüzdeki aylarda netleşecek. Çinli laboratuvarlar bu tür saldırılardan yararlanıyorsa, bu saldırı yolunun kapatılması Batılı laboratuvarlarla aralarındaki farkın yeniden açılmasına yol açabilir.
Kaynak: https://the-decoder.com/anthropics-claude-sonnet-5-5-nearly-matches-opus-5-5-on-benchmarks-while-costing-up-to-30-percent-less-per-task/
