Microsoft, transkripsiyon ve ses alanında tamamen kendi bünyesinde geliştirdiği üç yapay zekâ modelini piyasaya sürdü. Microsoft AI ekibi MAI-Transcribe-2-Streaming, MAI-Voice-2.1 ve MAI-Voice-2.1-Flash modellerinin geliştiricilerin kullanımına açıldığını duyurdu. Hamle, sesli asistan geliştiren yazılımcıları kendi ekosistemine çekme çabasının parçası.
Konuşurken metne dönüşen transkripsiyon
MAI-Transcribe-2-Streaming, Microsoft’un ilk akışlı (streaming) transkripsiyon modeli. Kaydın bitmesini beklemek yerine kişi konuşurken sesi anında metne dönüştürüyor. Şirket modelin 60 dili desteklediğini, konuşulan dili otomatik algıladığını ve konuşma sırasında dil değişse bile bunu fark edebildiğini belirtiyor. Tanıtım fiyatı, ses kaydının saati başına 0,54 dolar olarak açıklandı.
Bağımsız kıyaslamada birinci sıra
Model, Artificial Analysis’in kelime hata oranını ölçen AA-WER Streaming kıyaslamasında doğrudan birinci sıradan giriş yaptı. 24/7 Wall St.’nin aktardığına göre model hem nihai transkript doğruluğunda hem de ilk kısmi transkript doğruluğunda zirvede yer aldı ve yüzde 2,5 kelime hata oranına ulaştı. Yeni model, geliştiricilerin Azure konuşma hizmeti üzerinden zaten kullanabildiği MAI-Transcribe-2 ailesine ekleniyor.
Daha hızlı ve doğal ses üretimi
Microsoft, MAI-Voice-2.1’in uzun metinlerde bile kararlılığını koruyan, etkileyici ve düşük gecikmeli konuşma ürettiğini söylüyor. Flash sürümü ise sıralar arasındaki bekleme süresini azaltarak daha doğal bir sohbet akışı hedefliyor. Aynı ekip daha önce MAI-Voice ve MAI-1 modellerini de geliştirmişti. Piyasa analistleri, şirketin yapay zekâ yığınında kendi ürettiği her katmanın dış tedarikçilere bağımlılığı azalttığını savunuyor.
Günde sadece 1 TL'ye abone olarak tüm içeriklerimize sınırsız erişebilir ve bağımsız haberciliğe destek olabilirsiniz! Hemen Abone Ol




