Mimari

153 sesli not üzerinde Azure AI Speech ile Google Chirp 3 ve Amazon Transcribe karşılaştırması: InterMIND'ın sesli metne dönüştürme işlemini kuruluşunuzun kendi bulut ağ geçidinde neden yürüttüğü (2026)

Bir InterMIND kuruluşunun seçebileceği üç bulut ağ geçidinin sesli metne dönüştürme hizmetlerini — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) ve Amazon Transcribe — aynı 153 sesli not klibinde, 17 dilde, tek bir test ortamında, tek bir günde ölçtük. Dile göre kelime hata oranları, yöntem, her API'nin sınırları ve tanıyıcının liderlik tablosu yerine ağ geçidini neden izlediği.

The Mind.com Team

153 sesli not üzerinde Azure AI Speech ile Google Chirp 3 ve Amazon Transcribe karşılaştırması: InterMIND'ın sesli metne dönüştürme işlemini kuruluşunuzun kendi bulut ağ geçidinde neden yürüttüğü (2026)

Azure AI Speech, Google Chirp 3 ve Amazon Transcribe karşılaştırması: 153 sesli notta InterMIND neden sesten metne dönüştürmeyi kuruluşunuzun kendi bulut ağ geçidinde çalıştırıyor (2026)

Bir InterMIND kanalındaki sesli not, her ekip üyesinin kendi dilinde okuduğu bir metin mesajına dönüşür. Bunun ilk adımı sesten metne dönüştürmedir ve BT ile uyumluluk incelemecilerinden aldığımız soru "ne kadar doğru" değil, "bu kimin hizmeti ve ses nereye gidiyor" sorusudur.

Kısa cevap: varsayılan yapay zekâ ağ geçidinin konuşma hizmeti olan ve InterMIND'ın Sweden Central bölgesindeki kendi Azure kiracısında çalışan Azure AI Speech — ve bir kuruluşun seçebileceği diğer iki ağ geçidinin konuşma hizmetleri; hepsi aynı klipler üzerinde ölçülerek seçimin bir tercih değil, bir sayı meselesi olması sağlanıyor. Bu yazı, bu seçimin arkasındaki sayıları gösteriyor: aynı 153 klip, aynı gün içinde Azure AI Speech, Google Cloud Speech-to-Text ve Amazon Transcribe üzerinden geçiriliyor — ve her API hakkında, doğruluktaki bir yüzde puanından daha önemli olan iki gerçeği ortaya koyuyor.

Önce kural: kuruluş başına bir ağ geçidi

InterMIND'daki her yapay zekâ özelliği — toplantı özetleri, doküman özetleri, yazma asistanı, Ask AI ve toplantıdaki Mia — kuruluşun seçtiği tek bir dil modeli ağ geçidinde çalışır: varsayılan olarak EU Data Zone'daki Azure OpenAI, tercihe bağlı olarak AB çok bölgeli uç noktasındaki Google Vertex AI veya Frankfurt'taki Amazon Bedrock; her biri InterMIND'ın kendi kiracısında. Bu mantığı Kendi bulut ağ geçidinizde toplantı yapay zekâsı yazısında açıkladık: çoğu kuruluş için bu ağ geçidi zaten onaylı alt işleyici listesinde yer alıyor, dolayısıyla bir yapay zekâ özelliği listeye yeni bir şirket eklemiyor.

Sesli notlar için sesten metne dönüştürme bugün varsayılan ağ geçidinde aynı kuralı izliyor ve üç ağ geçidinin her birinin dil modellerinin yanında bir konuşma hizmeti var — bu yazının ölçtüğü de tam olarak bu:

Ağ geçidiKonuşma hizmetiBu testte kullanılan bölgeAPI bir kaydı nasıl işler
Azure OpenAI (Microsoft)Azure AI Speech, hızlı transkripsiyon API'siSweden Central5 saate ve 500 MB'a kadar bir dosya için tek istek (hızlı transkripsiyon belgeleri, Eylül 2026'da kontrol edildi)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, Chirp 3 modelieu çok bölgeliSenkron tanıma 60 saniye ve 10 MB ile sınırlı; daha uzun ses toplu işleme veya akış tanımayla işlenir (senkron sınırlar, Chirp 3, Eylül 2026'da kontrol edildi)
Amazon Bedrock (AWS)Amazon Transcribe, akış (streaming)eu-central-1 (Frankfurt)HTTP/2 veya WebSocket üzerinden bir akış oturumu; girdi PCM, FLAC veya Ogg-Opus formatındadır (akış belgeleri, Eylül 2026'da kontrol edildi)

Tanıyıcıya her seferinde konuşmacının kendi dili söyleniyor — bir üyenin profilinde ayarladığı dil — çünkü testlerimizde otomatik dil tanımlama kısa kliplerde güvenilmez çıktı: dört saniyelik bir Rusça not, İngilizce olarak geri döndü. Ürün bugün Azure'ı bu şekilde çağırıyor ve test de diğer ikisini aynı şekilde çağırıyor.

Neyi ölçtük

Küme. 17 dilde 153 klip: on dilde ürünün iki sentetik sesi tarafından seslendirilen iki iş diyaloğundan (bir sözleşme müzakeresi ve günlük bir ayak üstü toplantı) oluşan 136 diyalog sırası — artı herkese açık çeviri kıyaslamamızın FLORES-200 iş cümlelerinden oluşan, her dilde bir tane olmak üzere sentetik bir ses tarafından okunan ve 71 ila 109 saniye uzunluğundaki 17 resmi metin. Diyalog sıraları, gerçek bir sesli notun uzunluğunda, 3 ila 30 saniye arasında.

Ölçüt. Referans metne göre kelime hata oranı (WER) — büyük/küçük harf, noktalama ve boşluk normalleştirildikten sonra değiştirilen, eklenen veya silinen kelimelerin oranı; Çince ve Japonca karakter bazında karşılaştırılıyor. Karakter hata oranı da eşzamanlı olarak kaydedildi ve aynı hikâyeyi anlatıyor.

Test düzeneği. Tek bir betik, tek bir makine, 2026-09-16 tarihinde bir saat, her motor 153 klibin tamamı üzerinde çalıştı. Azure ve Amazon Transcribe her klibi bütün olarak aldı. Google'ın senkron tanıyıcısı en fazla 60 saniye kabul ediyor, bu yüzden 17 resmi klip sessizlik noktalarından 55 saniyenin altındaki parçalara bölündü ve transkriptler birleştirildi; 136 diyalog klibi ise bütün olarak işlendi. Amazon Transcribe sesin gerçek zamanlı bir hızda gelmesini istiyor, bu yüzden test düzeneği ona gerçek zamanın dört katı hızında besleme yaptı; aşağıdaki gecikme rakamı bu nedenle hizmetin değil, beslemenin belirlediği bir alt sınırdır.

Bu neyin karşılaştırması değil. Bir arabada telefonla yapılmış saha kayıtları değil, sessiz seslerde sentetik sesler. Bir gün, klip başına bir çalıştırma. Bu, kendi çeviri hattımızın test edildiği seste, kullanıcılarımızın yazdığı dillerde yapılmış bir karşılaştırma — bir lider tablosu değil.

Sonuçlar: dile göre kelime hata oranı

Her dilin klipleri üzerindeki ortalama WER; her motor 153 klibin tamamı için bir transkript döndürdü.

DilKlipAzure AI SpeechGoogle Chirp 3Amazon Transcribe
Arapça13%32%46%26
Çince13%3%3%8
Çekçe1%1%2%3
Felemenkçe1%2%2%3
İngilizce21%2%5%2
Fransızca13%5%11%12
Almanca13%7%9%13
Hintçe13%10%10%12
Macarca1%9%7%8
İtalyanca1%1%1%3
Japonca13%6%5%5
Korece1%9%11%11
Lehçe1%1%1%2
Portekizce (Brezilya)13%5%4%6
Rusça21%14%10%14
İspanyolca13%6%5%6
Türkçe1%4%3%4
Tüm 153 klip153%9%10%10
Yalnızca diyalog sıraları136%9%11%10
Yalnızca resmi metinler17%4%5%5
İşleme süresi ÷ ses uzunluğu0.100.220.41 (beslemeye bağlı)

Tek klibi olan diller (yalnızca resmi metin) bütünlük açısından gösterilmiştir; tek kliplik bir rakam bir oran değil, bir veri noktasıdır.

Sayılar ne söylüyor

  • Tüm küme üzerinde üç hizmet birbirinden bir puan içinde kalıyor: %9, %10 ve %10. 153 klibin her biri her motordan bir transkriptle geri döndü — 17 dilin kapsamı üçünde de tam.
  • Farklar dile göre değişiyor ve her iki yöne de gidiyor. Azure, Fransızca'da (%11 ve %12'ye karşı %5) ve Almanca'da (%9 ve %13'e karşı %7) en düşük hata oranına sahipti; İngilizce'de (Amazon Transcribe ile birlikte %2) ve Çince'de (Google ile birlikte %3) en düşük için eşitti. Amazon Transcribe, Arapça'da (%32 ve %46'ya karşı %26) en düşüktü. Google ise Rusça'da (%14 ve %14'e karşı %10), Portekizce'de, Macarca'da ve Türkçe'de en düşüktü.
  • Arapça üçü için de zor. Arapça diyalog klipleri üzerindeki en iyi sonuçta dört kelimeden biri yanlış. Bu, çeviri tarafında gördüklerimizle tutarlı: Arapça'yı, kalite çıtamızı geçene kadar Ağustos 2026'da toplantı dili seçicisinden çekmiştik (kaç dili desteklediğimiz).
  • İşleme süresi üçünde de gerçek zamanın hayli altında. Bu test düzeneğinde 30 saniyelik bir not, Azure'da yaklaşık üç saniye, Google'da yaklaşık yedi saniye sürüyor; Amazon rakamı ise hızı ayarlanmış beslemenin etkisi altında.

Azure AI Speech neden varsayılan kalıyor

Karara yön veren sırayla üç neden.

1. Varsayılan ağ geçidi Azure'dır. Bir ağ geçidi seçmemiş bir kuruluş, yapay zekâ özelliklerini EU Data Zone'daki Azure OpenAI üzerinde çalıştırır, dolayısıyla sesli notları aynı kiracıdaki Azure AI Speech tarafından transkribe edilir. Ek bir alt işleyici, ek bir bölge yok. Microsoft, Azure Speech'in verileri Speech kaynağının bölgesi dışında depolamadığını veya işlemediğini belirtiyor (bölgeler sayfası, Eylül 2026'da kontrol edildi); bizim kaynağımız hızlı transkripsiyon için listelenmiş olan Sweden Central bölgesinde.

2. API'nin yapısı bir sesli nota uyuyor. InterMIND'daki bir sesli not en fazla on dakika uzunluğunda olabilir (sesli notlar). Azure'ın hızlı transkripsiyonu tüm kaydı tek bir istekte alır. Google'ın senkron tanıması 60 saniyede duruyor, dolayısıyla on dakikalık bir not bir depolama kovası üzerinden toplu tanıma veya bir akış oturumu gerektiriyor; Amazon Transcribe akış yapıyor ama telefonların ve tarayıcıların kayıt yaptığı formatlar yerine PCM, FLAC veya Ogg-Opus alıyor, bu yüzden ses önce dönüştürülüyor. İkisi de çözülebilir — test düzeneği bunları çözüyor — ama bunlar her notun yolunda daha fazla hareketli parça anlamına geliyor.

3. Sayılar buna karşı bir argüman oluşturmuyor. %10 ve %10'a karşı %9 ile, bu kümede hiçbir motor sesli notları varsayılan ağ geçidinden taşımayı haklı çıkaracak kadar iyi değil. Google veya Amazon hata oranının yarısında çıksaydı, bu yazı bunu söylerdi.

Vertex AI veya Bedrock kullanan kuruluşlar için bunun anlamı

Kuruluşunuz ağ geçidi olarak Google Vertex AI veya Amazon Bedrock'ı seçtiyse yapay zekâ özellikleriniz orada çalışır. Bu kuruluşlardaki sesli notlar şu anda transkriptsiz bir kayıt olarak geliyor: bu yazının gösterdiği gibi Google Cloud Speech-to-Text ve Amazon Transcribe'ı ölçtük ama henüz ürüne bağlamadık. İzinler ve entegrasyon kodu mevcut; bunlar her notun yolunda olduğunda bu yazı güncellenecek. O zamana kadar, bir Vertex AI veya Bedrock kuruluşundaki sesli not, oynatılabilir bir kayıttır; ağ geçidini Azure'a geçiren bir kuruluş, o andan itibaren gönderilen notlarda transkript alır.

FAQ

InterMIND hangi sesten metne dönüştürme hizmetini kullanıyor?

Sohbetteki sesli notlar için, InterMIND'ın Sweden Central bölgesindeki kendi Azure kiracısındaki Azure AI Speech (hızlı transkripsiyon API'si) — varsayılan yapay zekâ ağ geçidinin konuşma hizmeti. Toplantılardaki canlı konuşma farklı bir yol izler: Fransa'da OVH'de barındırılan InterMIND'ın kendi medya motoru olan Mind API üzerinde çalışır ve hiçbir zaman bir bulut konuşma hizmetine değmez (bir toplantı gerçekte nerede çalışır).

Azure AI Speech, Google Speech-to-Text veya Amazon Transcribe'dan daha mı doğru?

Aynı gün aynı test düzeneğiyle ölçülen, 17 dildeki 153 sesli not klibinden oluşan kümemizde, Azure AI Speech'in ortalama kelime hata oranı %9, Google Cloud Speech-to-Text'in (Chirp 3) %10 ve Amazon Transcribe'ın %10 idi. Dile göre sıralama değişiyor: Azure Fransızca, İngilizce ve Çince'de en düşüktü, Amazon Transcribe Arapça'da, Google ise Rusça'da. Farklı bir kayıt kümesinde sıralama değişebilir; yukarıdaki tablo bizimki için kanıt niteliğindedir.

Kelime hata oranı nedir ve burada nasıl hesaplandı?

Kelime hata oranı, değiştirilen, eklenen ve silinen kelime sayısının referans metindeki kelime sayısına bölünmesiyle bulunur. Karşılaştırmadan önce büyük/küçük harfi, noktalamayı ve boşlukları normalleştiriyoruz; Çince ve Japonca'yı ise bu yazı sistemleri kelimeleri boşlukla ayırmadığı için karakter bazında karşılaştırıyoruz. %9'luk bir oran, yaklaşık her on bir kelimeden birinin referanstan farklı olduğu anlamına gelir.

Bir sesli notun sesi AB'den çıkıyor mu?

Hayır. Kayıt, InterMIND'ın AB'deki nesne depolamasında saklanır ve onu transkribe eden konuşma hizmeti bir AB bölgesinde çalışır: Azure'da Sweden Central, Google Cloud'da eu çok bölgeli bölgesi, AWS'de Frankfurt. Taraflar ve bölgelerin tam listesi alt işleyiciler sayfasında ve güven sayfasında yer alıyor.

Ses telefondan hiç çıkmasın diye konuşma neden uygulama tarafında, istemci tarafında tanınmıyor?

Bunu da Eylül 2026'da ölçtük. Chrome'un yerel işleme yapan yerleşik tanıyıcısı, ürün dilleri genelindeki 17 resmi klipten 0'ını doğru tanıdı ve istemci taraflı tanıyıcıların dil kapsamı, yukarıdaki tablodaki 17 dilden çok daha dar. İstemci taraflı tanıma, platformlar geliştikçe yeniden ölçtüğümüz bir yön; bugün her üye ve her dil için işleyen yol ağ geçidi yoludur.

Kuruluşumuz sesli notlarını hangi konuşma hizmetinin transkribe edeceğini seçebilir mi?

Ayrı olarak değil: bir kuruluş yöneticisinin Entegrasyonlar sayfasında seçtiği şey yapay zekâ ağ geçididir. Varsayılan ağ geçidinde sesli notlar Azure AI Speech tarafından transkribe edilir. Vertex AI ve Amazon Bedrock'ta sesli notlar henüz transkribe edilmiyor — yukarıdaki bölüme bakın.

Bir sesli not ne kadar uzun olabilir ve API bunu sınırlıyor mu?

En fazla on dakika. Azure'ın hızlı transkripsiyonu tek bir istekte 5 saate ve 500 MB'a kadar dosya kabul eder, dolayısıyla bir not tek bir çağrıda transkribe edilir. Google'ın senkron tanıması 60 saniye ve 10 MB kabul eder, bu yüzden test düzeneği uzun klipleri sessizlik noktalarından parçalara böldü.

Tanıyıcıya konuşmacının dili neden tespit ettirilmek yerine söyleniyor?

Çünkü bir sesli not kısadır. Dört saniyelik bir klipte otomatik dil tanımlama yanlış bir dil döndürebilir — bir Rusça test notu İngilizce olarak geri döndü; bir üyenin profil dili neredeyse her zaman doğrudur. Tanıyıcı bu dili alır ve yalnızca bu dil bilinmediğinde odanın dillerini aday olarak alır.

Toplantı sesi aynı hizmet tarafından mı transkribe ediliyor?

Hayır. Bir toplantıdaki canlı konuşma, çağrıyı taşıyan ve Fransa'da OVH'de barındırılan medya sunucusunda InterMIND'ın kendi motoru (Mind API) üzerinde tanınır ve çevrilir — bkz. bir toplantı gerçekte nerede çalışır. Bulut ağ geçidi yalnızca metni görür, bir çağrının sesini asla görmez (kendi ağ geçidinizde toplantı yapay zekâsı).

Sonuçları tekrar yayınlayacak mısınız?

Test düzeneği tek bir komutla çalışıyor ve her motorun izinleri hazır, dolayısıyla bir sağlayıcı yeni bir model çıkardığında tablo yeniden ölçülebilir. Tablo değiştiğinde bu yazı tarihiyle birlikte güncellenir.


Kendiniz görün


Kaynaklar: Microsoft — Azure AI Speech hızlı transkripsiyon (learn.microsoft.com) ve Speech bölgeleri tablosu (learn.microsoft.com); Google Cloud — Chirp 3 modeli (docs.cloud.google.com), senkron tanıma sınırları (docs.cloud.google.com) ve desteklenen diller (docs.cloud.google.com); AWS — Amazon Transcribe akış (docs.aws.amazon.com), uç noktalar ve kotalar (docs.aws.amazon.com) ve desteklenen diller (docs.aws.amazon.com); tümü Eylül 2026'da kontrol edildi. Ölçüm: InterMIND konuşma kıyaslaması, 2026-09-16, 153 klip, 17 dil.

Yeni gönderileri ve ürün güncellemelerini e-posta ile al

Ayda bir, yeni gönderiler ve ürün güncellemeleri içeren e-posta. İstediğiniz zaman abonelikten çıkın.


Yalnızca kullanan kişiler için ödeyin: InterMIND, etkin üye başına faturalandırmaya geçiyor

Pro ve Business planları, elle atadığınız koltukları satmayı bırakıyor. Tüm ekibinizi davet edin; her yenileme, önceki 28 gün içinde etkin olan üyeleri sayar ve yalnızca onlar için fatura keser. Sessizleşen bir üye erişimini korur ve hiçbir maliyet oluşturmaz; toplantı misafirleri ve dış kanal katılımcıları ücretsiz kalır. Etkin olarak nelerin kabul edildiği, sayının bir faturalandırma dönemi içinde nasıl değiştiği, yenilemeden önceki mektubun ne dediği ve faturalandırma sayfanızda nelerin değiştiği.

Tüm katılımcılar için canlı çevrilmiş altyazılar: Zoom, Teams ve Google Meet'in gereksinimleri ve her katılımcının kendi dilinde nasıl okuyabileceği (2026)

Tek bir konuşmacı, on dilde bir katılımcı kitlesi. Çevrilmiş altyazılar Zoom, Microsoft Teams ve Google Meet'te mevcuttur — her biri farklı bir lisansın arkasındadır ve her biri aynı soruya farklı şekilde yanıt verir: katılımcıların hangi dillerde okuma yapabileceğine kimin karar vereceği. Teams, bir town-hall (genel toplantı) düzenleyicisinin altı dili (Teams Premium ile on dili) önceden seçmesine izin verir; Zoom'daki çiftler sunucunun hesap ayarlarıyla belirlenir; Google Meet ise çevrilmiş altyazıları ücretli Workspace sürümleriyle sınırlar. Belgelenmiş harita, InterMIND'de nasıl çalıştığıyla birlikte; burada altyazı dili katılımcının kendi tarafındaki bir ayardır ve oda aynı zamanda sesle de çevrilir.