Microsoft, yeni konuşma tanıma modeli MAI-Transcribe-2’yi kullanıma sundu. 60 dili destekleyen model, bir saatlik ses kaydını yaklaşık 10 saniyede yazıya çevirebiliyor. Microsoft, yeni sistemin rakip modellere kıyasla hem daha hızlı hem de daha düşük maliyetli olduğunu belirtiyor.
Microsoft, yapay zekâ modelleri arasındaki rekabeti ses teknolojilerine taşıdı. Şirketin 3 Eylül’de tanıttığı MAI-Transcribe-2, toplantılardan röportajlara, çağrı merkezi kayıtlarından video altyazılarına kadar farklı ses içeriklerini metne dönüştürmek için geliştirildi.
60 dili destekliyor
MAI-Transcribe-2 toplam 60 dilde çalışabiliyor. Model yalnızca konuşmayı metne çevirmekle kalmıyor; kayıtta kimin konuştuğunu ayırt edebiliyor ve her kelime için zaman damgası oluşturabiliyor.
Sistem ayrıca sektörlere özgü terimleri ve özel isimleri daha doğru algılamak için anahtar kelimelerle yönlendirilebiliyor.
Bir saatlik ses yaklaşık 10 saniyede işleniyor
Microsoft’un paylaştığı verilere göre model, bir saatlik ses kaydını yaklaşık 10 saniyede işleyebiliyor.
Şirket, bağımsız Artificial Analysis değerlendirmelerine dayanarak MAI-Transcribe-2’nin OpenAI GPT-Transcribe’dan 10 kat, ElevenLabs Scribe v2’den 7 kat ve Google Gemini 3.5 Transcribe’dan 5 kat daha hızlı olduğunu bildiriyor.
Çok dilli konuşma tanıma performansını ölçen FLEURS testinde ise model 60 dil genelinde ortalama yüzde 5,2 kelime hata oranıyla ilk sıraya yerleşti.

Saatlik fiyatı 10 sent
Microsoft, fiyat tarafında da agresif bir strateji izliyor. MAI-Transcribe-2’nin ses işleme ücreti saat başına 0,10 dolar olarak belirlendi.
Ancak bu fiyat kalıcı değil. Şirket, 10 sentlik fiyatlandırmanın 31 Aralık 2026’ya kadar geçerli bir lansman teklifi olduğunu belirtiyor.
Model şu anda Microsoft Foundry üzerinden genel önizleme kapsamında kullanılabiliyor.
