架构

Azure AI Speech 对比 Google Chirp 3 对比 Amazon Transcribe 在 153 条语音笔记上的表现:为什么 InterMIND 在您组织的自有云网关上运行语音转文本(2026)

我们测量了 InterMIND 组织可选的三种云网关的语音转文本服务——Azure AI Speech、Google Cloud Speech-to-Text (Chirp 3) 和 Amazon Transcribe——在一天内使用同一套测试工具,对同样的 153 条语音笔记片段进行了 17 种语言的测试。包括各语言的词错误率、测试方法、各 API 的局限性,以及为什么识别器遵循的是网关而非排行榜。

The Mind.com Team

Azure AI Speech 对比 Google Chirp 3 对比 Amazon Transcribe 在 153 条语音笔记上的表现:为什么 InterMIND 在您组织的自有云网关上运行语音转文本(2026)

Azure AI Speech 对比 Google Chirp 3 与 Amazon Transcribe:基于 153 条语音笔记的评测,以及 InterMIND 为何在贵组织的自有云网关上运行语音转文字(2026)

InterMIND 频道中的一条语音笔记会变成一条文本消息,每位团队成员都能以自己的语言阅读。其第一步是语音转文字,而 IT 和合规审核人员向我们提出的问题不是“它的准确率有多高”,而是“这是谁的服务,音频会发往哪里”。

简短的回答:Azure AI Speech,即默认 AI 网关的语音服务,运行在 InterMIND 位于 Sweden Central 的自有 Azure 租户中——而组织可以选择的另外两个网关的语音服务,在同一组音频片段上进行了测量,因此选择基于数据,而非偏好。本文展示了该选择背后的数据——在同一天,通过 Azure AI Speech、Google Cloud Speech-to-Text 和 Amazon Transcribe 处理相同的 153 个片段——以及关于每个 API 的两个事实,它们比一两个百分点的准确率更重要。

规则优先:每个组织一个网关

InterMIND 中的每一项 AI 功能——会议摘要、文档总结、写作助手、Ask AI 以及会议中的 Mia——都运行在组织选择的一个语言模型网关上:默认为 EU Data Zone 中的 Azure OpenAI,或按需选择的 EU 多区域端点上的 Google Vertex AI、位于法兰克福的 Amazon Bedrock,且均在 InterMIND 的自有租户中。我们在自有云网关上的会议 AI 中解释了原因:对于大多数组织而言,该网关已在获批的子处理者名单上,因此添加一项 AI 功能不会为该名单引入新公司。

如今,语音笔记的语音转文字在默认网关上遵循相同的规则,并且三个网关中的每一个都在其语言模型旁边配备了语音服务——这就是本文要评测的内容:

网关语音服务本测试使用的区域API 如何接收录音
Azure OpenAI (Microsoft)Azure AI Speech,快速转录 APISweden Central单次请求处理最长 5 小时、500 MB 的文件(快速转录文档,于 2026 年 9 月查阅)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2,Chirp 3 模型eu 多区域同步识别限制为 60 秒和 10 MB;更长的音频需通过批量或流式识别处理(同步限制Chirp 3,于 2026 年 9 月查阅)
Amazon Bedrock (AWS)Amazon Transcribe,流式eu-central-1(法兰克福)通过 HTTP/2 或 WebSocket 的流式会话;输入为 PCM、FLAC 或 Ogg-Opus(流式文档,于 2026 年 9 月查阅)

在每种情况下,识别器都会被告知说话者自己的语言——即成员在其个人资料中设置的语言——因为在我们的测试中,自动语言识别在短片段上被证明不可靠:一段四秒的俄语笔记被识别为英语。这是目前产品调用 Azure 的方式,测试也以相同方式调用另外两个服务。

我们测量了什么

数据集。 17 种语言的 153 个片段:136 个对话回合——两段商务对话(合同谈判和每日站会),由产品的两个合成语音以十种语言说出——加上 17 段正式语段,即我们公开翻译基准测试中的 FLORES-200 商务语句,由合成语音朗读,每种语言一段,长度为 71 到 109 秒。对话回合时长为 3 到 30 秒,与真实语音笔记的长度相当。

指标。 参考文本的词错率(WER)——即替换、插入或删除的词占比——在对大小写、标点和空格进行标准化之后;中文和日文按字符进行比较。字符错率也一并记录,且反映出相同的情况。

测试环境。 一个脚本,一台机器,2026 年 9 月 16 日耗时一小时,每个引擎处理全部 153 个片段。Azure 和 Amazon Transcribe 整体接收每个片段。Google 的同步识别器最多接受 60 秒,因此 17 个正式片段在静音处被切割成 55 秒以下的片段并拼接转录文本;136 个对话片段则整体接收。Amazon Transcribe 要求音频以实时速度输入,因此测试环境以四倍于实时的速度向其馈送数据;下文所述的延迟数据因此是由馈送速度设定的下限,而非服务本身的延迟。

这不代表什么。 安静音频中的合成语音,而非车内手机录制的现场音频。一天内测试,每个片段运行一次。这是对我们自有翻译流水线所测试的音频、以及用户使用的语言进行的比较——而非排行榜。

结果:各语言的词错率

每种语言片段的平均 WER;每个引擎均对全部 153 个片段返回了转录文本。

语言片段数Azure AI SpeechGoogle Chirp 3Amazon Transcribe
阿拉伯语1332%46%26%
中文133%3%8%
捷克语11%2%3%
荷兰语12%2%3%
英语212%5%2%
法语135%11%12%
德语137%9%13%
印地语1310%10%12%
匈牙利语19%7%8%
意大利语11%1%3%
日语136%5%5%
韩语19%11%11%
波兰语11%1%2%
葡萄牙语(巴西)135%4%6%
俄语2114%10%14%
西班牙语136%5%6%
土耳其语14%3%4%
全部 153 个片段1539%10%10%
仅对话回合1369%11%10%
仅正式语段174%5%5%
处理时间 ÷ 音频长度0.100.220.41(受馈送速度限制)

只有单个片段(仅正式语段)的语言为完整性而列出;单片段数据仅为一个数据点,而非错率。

数据说明了什么

  • 在整个数据集上,三个服务彼此相差不到一个百分点: 9%、10% 和 10%。153 个片段中的每一个都从每个引擎返回了转录文本——三种服务对 17 种语言的覆盖率均为 100%。
  • 差异因语言而异,且互有高低。 Azure 在法语(5% 对 11% 和 12%)和德语(7% 对 9% 和 13%)上的错率最低,并在英语(2%,与 Amazon Transcribe 并列)和中文(3%,与 Google 并列)上并列最低。Amazon Transcribe 在阿拉伯语上最低(26% 对 32% 和 46%)。Google 在俄语(10% 对 14% 和 14%)、葡萄牙语、匈牙利语和土耳其语上最低。
  • 阿拉伯语对三者而言都很困难。 阿拉伯语对话片段的最佳结果是四个词中错一个。这与我们在翻译侧观察到的情况一致,因此我们已于 2026 年 8 月将阿拉伯语从会议语言选择器中撤下,直到质量达到我们的标准(我们支持多少种语言)。
  • 三者的处理时间都远低于实时。 在此测试环境中,一条 30 秒的笔记在 Azure 上约需三秒,在 Google 上约需七秒;Amazon 的数据则受限于定速馈送。

为什么 Azure AI Speech 仍是默认选择

三个原因,按其决定性顺序排列。

1. 默认网关是 Azure。 未选择网关的组织在 EU Data Zone 中的 Azure OpenAI 上运行其 AI 功能,因此其语音笔记由同一租户中的 Azure AI Speech 转录。没有额外的子处理者,没有额外的区域。Microsoft 声明 Azure Speech 不会在 Speech 资源所在区域之外存储或处理数据(区域页面,于 2026 年 9 月查阅);我们的资源位于 Sweden Central,该区域列于快速转录支持范围内。

2. API 形态契合语音笔记。 InterMIND 中的语音笔记最长可达十分钟(语音笔记)。Azure 的快速转录通过单次请求接收整个录音。Google 的同步识别在 60 秒处截止,因此一条十分钟笔记需通过存储桶进行批量识别或使用流式会话;Amazon Transcribe 使用流式传输,但接受 PCM、FLAC 或 Ogg-Opus,而非手机和浏览器录制的格式,因此音频需先转码。两者都可解决——测试环境就解决了它们——但在每条笔记的路径上增加了更多活动部件。

3. 数据并不反对它。 在 9% 对 10% 和 10% 的情况下,该数据集中没有任何引擎好到足以证明将语音笔记移出默认网关是合理的。如果 Google 或 Amazon 的错率只有一半,本文就会如此说明。

这对使用 Vertex AI 或 Bedrock 的组织意味着什么

如果您的组织选择了 Google Vertex AI 或 Amazon Bedrock 作为网关,您的 AI 功能将在那里运行。这些组织中的语音笔记目前以无转录文本的录音形式到达:我们已经评测了 Google Cloud Speech-to-Text 和 Amazon Transcribe,如本文所示,但尚未将它们接入产品。权限和集成代码已就绪;当它们进入每条笔记的路径时,本文将予以更新。在此之前,Vertex AI 或 Bedrock 组织中的语音笔记是可播放的录音;将网关切换为 Azure 的组织,从切换之时起发送的笔记将获得转录文本。

常见问题

InterMIND 使用哪种语音转文字服务?

对于聊天中的语音笔记,使用的是 InterMIND 自有 Azure 租户(位于 Sweden Central)中的 Azure AI Speech(快速转录 API)——即默认 AI 网关的语音服务。会议中的实时语音是另一条路径:它运行在 InterMIND 自有的媒体引擎(Mind API)上,托管于法国的 OVH,且从不触及云语音服务(一场会议在哪里运行)。

Azure AI Speech 是否比 Google Speech-to-Text 或 Amazon Transcribe 更准确?

在我们于同一天使用相同测试环境测量的 17 种语言 153 个语音笔记片段集上,Azure AI Speech 的平均词错率为 9%,Google Cloud Speech-to-Text(Chirp 3)为 10%,Amazon Transcribe 为 10%。不同语言间的排名会有所变化:Azure 在法语、英语和中文上最低,Amazon Transcribe 在阿拉伯语上最低,Google 在俄语上最低。在不同的录音集上排名可能有所不同;上表是我们的证据。

什么是词错率,在此如何计算?

词错率是替换、插入和删除的词数除以参考文本中的词数。我们在比较前对大小写、标点和空格进行标准化,并对中文和日文按字符进行比较,因为这些书写系统不使用空格分隔词语。9% 的错率意味着大约每十一个词中有一个与参考文本不同。

语音笔记的音频会离开欧盟吗?

不会。录音存储在 InterMIND 位于欧盟的对象存储中,转录它的语音服务也运行在欧盟区域:Azure 上的 Sweden Central、Google Cloud 上的 eu 多区域、AWS 上的法兰克福。各方及区域的完整列表见子处理者页面信任页面

为什么不在应用内客户端识别语音,让音频不离开手机?

我们也对此进行了测量,时间在 2026 年 9 月。Chrome 内置的本地处理识别器在产品支持的语言中,对 17 个正式片段的识别率为 0,且客户端识别器的语言覆盖范围远窄于上表中的 17 种语言。客户端识别是我们随着平台改进而重新评测的方向;如今,网关路径是适用于每位成员、每种语言的有效路径。

我们的组织能选择由哪种语音服务转录其语音笔记吗?

不能单独选择:AI 网关由组织管理员在“集成”页面上选择。在默认网关上,语音笔记由 Azure AI Speech 转录。在 Vertex AI 和 Amazon Bedrock 上,语音笔记尚未进行转录——请参阅上文部分。

语音笔记能有多长,API 会限制吗?

最长十分钟。Azure 的快速转录单次请求接受最长 5 小时、500 MB 的文件,因此一条笔记可在单次调用中完成转录。Google 的同步识别接受 60 秒和 10 MB,这就是测试环境在静音处切割长片段的原因。

为什么识别器被告知说话者的语言,而不是自动检测?

因为语音笔记很短。在四秒的片段上,自动语言识别可能返回错误的语言——一条俄语测试笔记被识别为英语;成员个人资料中的语言几乎每次都是正确的。识别器获取该语言,只有在未知时,才会将会议的语言作为候选。

会议音频是否由同一服务转录?

不。会议中的实时语音在承载通话的媒体服务器上由 InterMIND 自有引擎(Mind API)识别和翻译,托管于法国的 OVH——见一场会议在哪里运行。云网关看到的是文本,绝非通话的音频(自有网关上的会议 AI)。

你们还会再次发布结果吗?

测试环境通过一条命令运行,每个引擎的权限均已就绪,因此当供应商发布新模型时可以重新测量该表。当其改变局面时,本文将更新日期。


亲自体验


来源:Microsoft — Azure AI Speech 快速转录(learn.microsoft.com)及 Speech 区域表(learn.microsoft.com);Google Cloud — Chirp 3 模型(docs.cloud.google.com)、同步识别限制(docs.cloud.google.com)及支持的语言(docs.cloud.google.com);AWS — Amazon Transcribe 流式(docs.aws.amazon.com)、端点和配额(docs.aws.amazon.com)及支持的语言(docs.aws.amazon.com);均于 2026 年 9 月查阅。测量:InterMIND 语音基准测试,2026-09-16,153 个片段,17 种语言。

通过电子邮件获取新文章和产品更新

每月一封电子邮件,包含新文章和产品更新。随时可取消订阅。