1. Anasayfa
  2. Öne Çıkanlar

Meta’dan Yeni Ses Modeli: Aynı Anda Birden Fazla Dili ve Konuşmacıyı Anlıyor

Meta’dan Yeni Ses Modeli: Aynı Anda Birden Fazla Dili ve Konuşmacıyı Anlıyor
0

Meta, ilk gerçek zamanlı ses modeli Muse Voice Transcribe’ı tanıttı. Meta, modelin 20’den fazla konuşmacı için dikte ve transkripsiyon işlemlerini yapabildiğini ve aynı anda birden fazla dili sorunsuzca işleyebildiğini belirtiyor.

Platformda üç yıl paylaşım yapmadıktan sonra kısa süre önce X’e geri dönen Meta CEO’su Mark Zuckerberg, modelin birden fazla konuşmacıyı ve dili aynı anda işleyebilme yeteneğine dair bir örnek paylaştı. Videodaki transkripsiyon sistemi, birden fazla konuşmacıyı otomatik olarak ayırt edip diller arasında geçiş yapabiliyor. Hatta diller arası geçişi (code-switching) yakalayabiliyor ve birden fazla dilden kelime içeren cümleleri metne dökebiliyor.

Zuckerberg durumu şöyle açıkladı: “Model ne zaman dinleyeceğine karar veriyor. Her bir token’ı tahmin etmek ve doğruluğu artırmak için uyarlanabilir gecikme kullanarak zor kelimelerde biraz daha bekliyor ve kolay kelimelerde daha hızlı karar veriyor. Karmaşık, gerçek ses kayıtlarında da dayanıklılığını koruyor; 70’ten fazla dilde eğitildi (lansmanda 25’i doğrulandı), cümle ortasındaki diller arası geçişleri işliyor ve 20’den fazla konuşmacının yer aldığı saatler süren oturumları yönetiyor.” 

Meta’nın bu adımı, Google’ın benzer yeteneklere sahip kendi ses modeli Gemini 3.5 Transcribe’ı tanıtmasının üzerinden bir hafta bile geçmeden geldi. Ancak Google ses modelini Android’e ve (zamanla) Chrome’a entegre ederken, Meta’nın Muse Voice Transcribe’ı kendi ana hizmetlerine entegre etme planı olup olmadığı henüz net değil.

Şimdilik kullanıcılar, yeni modelin yeteneklerini Meta’nın kısa süre önce çıkardığı Meta AI Mac uygulamasında deneyimleyebilir. Mac uygulaması diğer uygulamalardaki sesli özellikleri çalıştırabildiği için, Muse Voice Transcribe artık diğer hizmetlerdeki dikte özelliklerine de güç verecek. Model ayrıca Muse Code ve Meta’nın Model API’si üzerinden geliştiricilere sunuluyor. Fiyatı 1.000 ses dakikası için 3 dolar. Ayrıca, Meta’nın araştırma blogunda Muse Transcribe’ın bir demo sürümü var.

Muse Voice Transcribe, sürekli yeni YZ modelleri ve araçları üreten Meta Superintelligence Lab (Meta Süperzeka Laboratuvarı, MSI) tarafından yayımlanan son ürün. Şirket son birkaç hafta içinde ilk özel kodlama ajanını, açık ağırlıklı bir modeli ve bahsi geçen Meta AI Mac uygulamasını da tanıttı.

Kaynak: https://www.engadget.com/2249112/meta-new-ai-transcription-model-can-distinguist-between-multiple-speakers-and-languages-in-real-time/
Bu Yazıya Tepkiniz Ne Oldu?
  • 1
    be_endim
    Beğendim
  • 0
    alk_l_yorum
    Alkışlıyorum
  • 0
    e_lendim
    Eğlendim
  • 0
    d_nceliyim
    Düşünceliyim
  • 0
    _rendim
    İğrendim
  • 0
    sevdim
    Sevdim
  • 0
    _ok_k_zd_m
    Çok Kızdım
İlginizi Çekebilir

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir