Azure AI Speech έναντι Google Chirp 3 έναντι Amazon Transcribe σε 153 φωνητικά μηνύματα: γιατί το InterMIND εκτελεί τη μετατροπή ομιλίας σε κείμενο στην cloud πύλη του οργανισμού σας (2026)
Ένα φωνητικό μήνυμα σε ένα κανάλι του InterMIND γίνεται μήνυμα κειμένου που κάθε συνάδελφος διαβάζει στη δική του γλώσσα. Το πρώτο βήμα είναι η μετατροπή ομιλίας σε κείμενο. Η ερώτηση που δεχόμαστε από τους υπεύθυνους IT και compliance δεν είναι «πόσο ακριβές είναι», αλλά «σε ποιον ανήκει η υπηρεσία και πού καταλήγει ο ήχος».
Η σύντομη απάντηση: το Azure AI Speech, η υπηρεσία ομιλίας της προεπιλεγμένης πύλης AI, στο δικό του Azure tenant του InterMIND στη Sweden Central. Μετρήσαμε επίσης τις υπηρεσίες ομιλίας των δύο άλλων πυλών που μπορεί να επιλέξει ένας οργανισμός, στα ίδια ακριβώς αποσπάσματα, ώστε η επιλογή να βασίζεται σε αριθμό και όχι σε προτίμηση. Η ανάρτηση παρουσιάζει τους αριθμούς πίσω από αυτή την επιλογή: τα ίδια 153 αποσπάσματα μέσα από το Azure AI Speech, το Google Cloud Speech-to-Text και το Amazon Transcribe την ίδια ημέρα. Παρουσιάζει επίσης τα δύο στοιχεία κάθε API που μετράνε περισσότερο από μια εκατοστιαία μονάδα ακρίβειας.
Πρώτα ο κανόνας: μία πύλη ανά οργανισμό
Κάθε λειτουργία AI στο InterMIND (περιλήψεις σύσκεψης, περιλήψεις εγγράφων, βοηθός γραφής, Ask AI και Mia στη σύσκεψη) εκτελείται σε μία πύλη γλωσσικού μοντέλου που επιλέγει ο οργανισμός: από προεπιλογή το Azure OpenAI στο EU Data Zone, ή κατ' επιλογήν το Google Vertex AI στο πολυπεριφερειακό endpoint της ΕΕ ή το Amazon Bedrock στη Φρανκφούρτη, πάντα στο δικό του tenant του InterMIND. Εξηγήσαμε τη λογική στο άρθρο Meeting AI στη δική σας cloud πύλη: για τους περισσότερους οργανισμούς η πύλη αυτή βρίσκεται ήδη στη λίστα εγκεκριμένων υπο-εκτελούντων την επεξεργασία, επομένως μια λειτουργία AI δεν προσθέτει καμία νέα εταιρεία στη λίστα.
Η μετατροπή ομιλίας σε κείμενο για τα φωνητικά μηνύματα ακολουθεί σήμερα τον ίδιο κανόνα στην προεπιλεγμένη πύλη. Καθεμία από τις τρεις πύλες έχει υπηρεσία ομιλίας δίπλα στα γλωσσικά της μοντέλα, και αυτό ακριβώς μετράει η παρούσα ανάρτηση:
| Πύλη | Υπηρεσία ομιλίας | Περιοχή που χρησιμοποιήθηκε στη δοκιμή | Πώς δέχεται το API μια ηχογράφηση |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, fast transcription API | Sweden Central | Ένα αίτημα για αρχείο έως 5 ώρες και 500 MB (τεκμηρίωση fast transcription, έλεγχος Σεπτέμβριος 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, μοντέλο Chirp 3 | πολυπεριφέρεια eu | Η σύγχρονη αναγνώριση περιορίζεται σε 60 δευτερόλεπτα και 10 MB· ο μεγαλύτερος ήχος περνά από αναγνώριση batch ή streaming (όρια sync, Chirp 3, έλεγχος Σεπτέμβριος 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Φρανκφούρτη) | Συνεδρία streaming μέσω HTTP/2 ή WebSocket· η είσοδος είναι PCM, FLAC ή Ogg-Opus (τεκμηρίωση streaming, έλεγχος Σεπτέμβριος 2026) |
Σε κάθε περίπτωση, ο αναγνωριστής ομιλίας ενημερώνεται για τη γλώσσα του ομιλητή, δηλαδή τη γλώσσα που όρισε το μέλος στο προφίλ του. Στις δοκιμές μας ο αυτόματος εντοπισμός γλώσσας αποδείχθηκε αναξιόπιστος σε σύντομα αποσπάσματα: μια ρωσική σημείωση τεσσάρων δευτερολέπτων επέστρεψε ως αγγλική. Έτσι καλεί σήμερα το προϊόν το Azure, και η δοκιμή καλεί με τον ίδιο τρόπο και τις άλλες δύο υπηρεσίες.