Microsoft Corp., metinden sese dönüşüme odaklanan diğer iki modelle birlikte ilk canlı deşifre modelini tanıtarak MAI model ailesini genişletti. Bu modeller, insanların birbirleriyle konuşmasına benzer şekilde insanların seslerini dinleyebilen ve anında yanıt verebilen sesli ajanlar geliştirmek isteyen yazılımcılar için tasarlandı.
Üç model arasında en önemli olanı MAI-Transcribe-2-Streaming. Şirket, bu modelin insan konuşmasını WebSocket üzerinden aldığını ve kişi konuştukça sürekli güncellenen bir transkripsiyon metnine dönüştürdüğünü belirtti. Kişi konuşmasını tamamladığında transkripsiyonun son hâlini aldığını doğruluyor. Microsoft, modelin böylelikle canlı altyazı gösteren ya da kullanıcı henüz söyleyeceğini bitirmeden isteğini işlemeye başlayan uygulamalara güç verebileceğini ifade etti.
MAI-Transcribe-2-Streaming, Microsoft’un Vercel AI Gateway platformunda listelendi ve ses saati başına 0,54 dolar olarak fiyatlandırıldı. 60’tan fazla dili destekleyen model, konuşulan dili otomatik olarak tespit edebiliyor. İlk transkripsiyon tahminlerini ortalama 320 milisaniye içinde sunuyor ancak Microsoft, yanıt hızının ağ bağlantısına ve yanıtı üreten YZ sistemine de bağlı olması sebebiyle bu performansı her senaryoda garanti edemeyeceğini ekledi.
Microsoft transkripsiyon modellerine yabancı değil. Şirket geçen ay, ses saati başına 0,10 dolar fiyatla MAI-Transcribe-2 modelini tanıttı. Bu da canlı sürüme göre beş kattan daha ucuz demek. Bunun temel nedeni, canlı modelin ses akışı devam ederken sürekli geçici sonuçlar döndürerek çok daha fazla işlem yapması. Standart MAI-Transcribe-2 modeli ise işleme başlamak için konuşmacının sözünü bitirmesini bekliyor.
Transkripsiyonun ötesinde, sohbet odaklı YZ ajanları için aynı derecede önem taşıyan metinden ses üretimine odaklı iki model daha var. Bunlardan MAI-Voice-2.1, daha etkileyici ve yüksek kaliteli ses çıktıları için en iyi tercih olarak öne çıkıyor. MAI-Voice-2.1-Flash ise daha hızlı yanıt ve daha düşük maliyet sağlamak adına bu özellikleri bir miktar kısıyor.
Vercel AI Gateway listelemelerine göre MAI-Voice-2.1 milyon karakter başına 22 dolar, Flash sürümü ise milyon karakter başına 15 dolar olarak fiyatlandırıldı. Microsoft, her iki metinden sese modelinin de 23 dili desteklediğini bildirdi.
Bu yeni modeller, her iki şirketin de büyük bir yatırımcısı olmasına rağmen Microsoft’un OpenAI Group PBC ve Anthropic PBC gibi model sağlayıcılarından uzaklaşma sürecini hızlandırdığını gösteriyor. Temmuz ayında, Microsoft AI İcra Kurulu Başkanı Mustafa Süleyman’ın OpenAI ve Anthropic’in güçlü öncü modellerine ait maliyetlerden giderek daha fazla endişe duyduğu bildirildi.
Buna karşılık Süleyman, Microsoft’un YZ araştırmacılarına MAI model ailesine ağırlık vermeleri talimatını verdi. Amacı, modelleri zamanla Excel ve Outlook gibi platformlardaki Copilot ajanlarına güç sağlamak için kullanmak. Süleyman, Bloomberg’e verdiği bir röportajda, “Anthropic’e çok fazla para ödüyoruz, bu yüzden hedefimiz bu maliyeti azaltmak ve nihayetinde tamamen ortadan kaldırmak.” dedi.
Yeni modellerin çıkışıyla Microsoft, insan kullanıcılarla doğal ve insan benzeri bir şekilde sohbet edebilen güçlü sesli YZ ajanları inşa etmek için ihtiyaç duyduğu her şeye sahip oldu. Sesli ajanların çalışabilmesi için üç şeyi yapabilmesi gerekiyor: Kendilerine söyleneni tanıyıp anlamak, söylenenlere dayanarak ne yapacaklarına karar vermek ve son olarak işitilebilir bir yanıt üretmek.
MAI-Transcribe-2-Streaming ilk sorunu hallederken, MAI-Voice modelleri üçüncü adımı çözüyor. Ortada ise ajanın ne yapacağına karar vermek için söylenenlerin transkripsiyon metinlerini okuyan standart bir büyük dil modeli, yani Microsoft’un güçlü akıl yürütme modeli Mai-Thinking-1 yer alıyor. Yazılımcılar üç ayrı model kullanarak sesli ajanlarının kalitesi, gecikme süresi ve maliyetleri üzerinde çok daha fazla kontrol elde ediyor.
Kaynak: https://siliconangle.com/2026/10/01/microsoft-targets-ultra-realistic-voice-agents-with-its-first-streaming-transcription-model/
