번역 품질 마케팅이 왜 망가졌는지 — 그리고 우리가 대신 공개하는 것
실시간 번역 벤더의 웹사이트를 열어보세요. 다음과 같은 종류의 숫자들을 볼 수 있습니다:
- "200개 이상의 언어"
- "6,000개 이상의 언어 쌍"
- "세계 최초" / "최고 수준의 정확도"
- "99% 정확도"
이제 곧 진행할 회의에 이 숫자들이 어떤 의미가 있는지 해당 벤더 페이지에서 찾아보세요. 언어별 품질. 재현 가능한 방법론. 표본 크기. 시간에 따른 점수. 모델의 취약점에 대한 정직한 공개.
찾을 수 없을 것입니다. 마케팅 문구에도 없고, 문서에서도 거의 찾을 수 없습니다.
이것이 이 카테고리의 현재 평형 상태입니다. 이는 세 가지 이유로 존재합니다:
- 대부분의 벤더는 자체 번역 엔진을 소유하지 않습니다. 이들은 OpenAI, Google, DeepL, Microsoft 또는 이들의 조합을 통해 라우팅합니다. 언어 쌍별 품질 데이터를 공개하는 것은 다른 회사의 모델을 벤치마크하는 것과 같아서 마케팅적 가치가 없습니다.
- 정직한 품질 데이터는 빌보드에 올리기 어렵습니다. 단일 점수는 노이즈가 많습니다. 분포는 더 유용하지만 압축하기 어렵습니다.
last-six-months trend는 더욱 유용하지만 압축하기는 더 어렵습니다. - 구매 부서가 아직 반발하지 않았습니다. 구매자들은 마케팅 숫자를 표면적인 가치로 받아들이며, 따라서 이 평형 상태가 유지됩니다.
이 평형 상태는 오래가지 못할 것입니다. 제약, 법무, 금융, 감사, 공공 부문 등 차세대 구매자들은 "몇 개의 언어를 지원하느냐"보다 더 어려운 질문을 던질 것입니다. 우리는 그들이 벤더의 말을 그대로 믿어야 할 필요가 없다고 생각하여 /benchmark를 구축했습니다.
마케팅 숫자가 말해주지 않는 것
**"200개 이상의 언어"**는 벤더가 200개 언어로 텍스트를 출력하는 모델을 가지고 있음을 의미합니다. 이 언어들 간의 품질은 주요 언어 쌍(EN↔DE, EN↔ES, EN↔FR)의 경우 프로덕션 수준에서부터 저자원 언어 쌍의 경우 겨우 사용 가능한 수준까지 다양합니다. 언어 쌍별 분석 자료가 없다면, 당신의 회의가 이 기준선의 어느 쪽에 떨어질지 알 수 없습니다.
**"6,000개 이상의 언어 쌍"**은 80개 소스 언어에 대한 N × N 조합입니다. 6,000개 쌍을 지원한다고 말하는 것은 쉬운 부분입니다. 특정 언어 쌍이 CAPA 검토, 계약 협상 또는 실적 발표 통화에 사용하기에 충분히 좋다고 말하는 것 — 그 부분은 브로셔에 없습니다.
**"99% 정확도"**는 무엇을 측정했는지, 어떤 참조 기준을 사용했는지, 어떤 표본을 대상으로 했는지, 누가 판정했는지를 명시하지 않는 한 내용이 없습니다. 번역 품질에는 보편적인 척도가 없습니다. 언어 쌍, 콘텐츠 도메인, 오디오 품질(음성의 경우), 지연 예산, 그리고 특정 사용 사례에서 "충분히 좋음"이 의미하는 바에 따라 달라지는 분포를 가집니다.