Azure AI Speech, Google Chirp 3 ve Amazon Transcribe karşılaştırması: 153 sesli notta InterMIND neden sesten metne dönüştürmeyi kuruluşunuzun kendi bulut ağ geçidinde çalıştırıyor (2026)
Bir InterMIND kanalındaki sesli not, her ekip üyesinin kendi dilinde okuduğu bir metin mesajına dönüşür. Bunun ilk adımı sesten metne dönüştürmedir ve BT ile uyumluluk incelemecilerinden aldığımız soru "ne kadar doğru" değil, "bu kimin hizmeti ve ses nereye gidiyor" sorusudur.
Kısa cevap: varsayılan yapay zekâ ağ geçidinin konuşma hizmeti olan ve InterMIND'ın Sweden Central bölgesindeki kendi Azure kiracısında çalışan Azure AI Speech — ve bir kuruluşun seçebileceği diğer iki ağ geçidinin konuşma hizmetleri; hepsi aynı klipler üzerinde ölçülerek seçimin bir tercih değil, bir sayı meselesi olması sağlanıyor. Bu yazı, bu seçimin arkasındaki sayıları gösteriyor: aynı 153 klip, aynı gün içinde Azure AI Speech, Google Cloud Speech-to-Text ve Amazon Transcribe üzerinden geçiriliyor — ve her API hakkında, doğruluktaki bir yüzde puanından daha önemli olan iki gerçeği ortaya koyuyor.
Önce kural: kuruluş başına bir ağ geçidi
InterMIND'daki her yapay zekâ özelliği — toplantı özetleri, doküman özetleri, yazma asistanı, Ask AI ve toplantıdaki Mia — kuruluşun seçtiği tek bir dil modeli ağ geçidinde çalışır: varsayılan olarak EU Data Zone'daki Azure OpenAI, tercihe bağlı olarak AB çok bölgeli uç noktasındaki Google Vertex AI veya Frankfurt'taki Amazon Bedrock; her biri InterMIND'ın kendi kiracısında. Bu mantığı Kendi bulut ağ geçidinizde toplantı yapay zekâsı yazısında açıkladık: çoğu kuruluş için bu ağ geçidi zaten onaylı alt işleyici listesinde yer alıyor, dolayısıyla bir yapay zekâ özelliği listeye yeni bir şirket eklemiyor.
Sesli notlar için sesten metne dönüştürme bugün varsayılan ağ geçidinde aynı kuralı izliyor ve üç ağ geçidinin her birinin dil modellerinin yanında bir konuşma hizmeti var — bu yazının ölçtüğü de tam olarak bu:
| Ağ geçidi | Konuşma hizmeti | Bu testte kullanılan bölge | API bir kaydı nasıl işler |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, hızlı transkripsiyon API'si | Sweden Central | 5 saate ve 500 MB'a kadar bir dosya için tek istek (hızlı transkripsiyon belgeleri, Eylül 2026'da kontrol edildi) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, Chirp 3 modeli | eu çok bölgeli | Senkron tanıma 60 saniye ve 10 MB ile sınırlı; daha uzun ses toplu işleme veya akış tanımayla işlenir (senkron sınırlar, Chirp 3, Eylül 2026'da kontrol edildi) |
| Amazon Bedrock (AWS) | Amazon Transcribe, akış (streaming) | eu-central-1 (Frankfurt) | HTTP/2 veya WebSocket üzerinden bir akış oturumu; girdi PCM, FLAC veya Ogg-Opus formatındadır (akış belgeleri, Eylül 2026'da kontrol edildi) |
Tanıyıcıya her seferinde konuşmacının kendi dili söyleniyor — bir üyenin profilinde ayarladığı dil — çünkü testlerimizde otomatik dil tanımlama kısa kliplerde güvenilmez çıktı: dört saniyelik bir Rusça not, İngilizce olarak geri döndü. Ürün bugün Azure'ı bu şekilde çağırıyor ve test de diğer ikisini aynı şekilde çağırıyor.