공개적으로 검증하는 번역 품질
AI 번역 품질 벤치마크
InterMIND가 실제로 얼마나 잘 번역하는지를 고정된 FLORES-200 벤치마크 세트를 기준으로 자동화된 테스트 스위트로 매월 언어 쌍별로 측정합니다. 임의로 골라낸 평균이 아닌, 합성 데이터 기반의 재현 가능한 결과입니다.
채팅 번역
91/100
중앙값 · 22개 쌍 · 22회 실행 · Q4 2026
입력한 메시지를 인라인으로 번역
음성 번역
93/100
Q3 2026 대비 +3중앙값 · 22개 쌍 · 22회 실행 · Q4 2026
음성 인식 + 번역을 합친 엔드투엔드 단일 점수
44 언어 쌍·45 채점된 실행·23 언어·매월 업데이트 · 2026년 10월
점수 = 참조 번역과의 의미적 충실도(0–100)입니다. 높을수록 좋습니다.
우수 90+ 양호 70–89 보통 50–69 미흡 <50
텍스트 채팅 번역
입력한 메시지를 전송 시 인라인으로 번역합니다.
이번 분기 23개 언어 중 23개 언어가 평균 양호(70+) 이상입니다 · Q3 2026 대비 14개 향상
언어별 평균 품질 · Q4 2026Q3 2026 대비
각 막대는 이번 분기에 해당 언어로 또는 해당 언어에서 번역한 모든 실행을 합산한 값입니다. 점선 표시는 이전 분기를 나타냅니다.
Q4 2026 (avg) Q3 2026 중앙값 91 · Q4 2026
100
75
50
25
0
100
100
100
97
96
94
94
92
92
91
91
91
91
91
89
89
88
88
88
88
87
87
71
▲2es
▲4it
▲1pt
▲1ro
▲3fr
▲7ko
▲3pl
▼1sv
▲5zh
▲6fi
▼4de
▲2en
▼4ja
▲30tr
▲9is
▼2nl
▼4da
▲3ru
▼1uk
▼3no
▼4cs
▲26hi
▼13hu
Faded bars have a thin sample (<3 runs) — read them as provisional.
음성 번역
실시간으로 음성을 인식하고 번역합니다. 엔드투엔드로 처리하기 더 어려운 문제입니다.
이번 분기 23개 언어 중 23개 언어가 평균 양호(70+) 이상입니다 · Q3 2026 대비 19개 향상
언어별 평균 품질 · Q4 2026Q3 2026 대비
각 막대는 이번 분기에 해당 언어로 또는 해당 언어에서 번역한 모든 실행을 합산한 값입니다. 점선 표시는 이전 분기를 나타냅니다.
Q4 2026 (avg) Q3 2026 중앙값 93 · Q4 2026
100
75
50
25
0
100
98
97
97
97
96
96
96
95
94
93
92
92
91
90
89
89
89
88
87
85
83
76
▲8ko
▲3es
▲2zh
▲3ja
▲1it
▲4uk
▲3pt
▲3ro
▲10ru
▲3pl
▲1fr
•nl
▲4en
▲1cs
▲1no
▲2sv
▲9hu
▲4de
•da
▼4hi
•fi
▲5is
▲8tr
Faded bars have a thin sample (<3 runs) — read them as provisional.
시간에 따른 품질 추이
게시를 시작한 이후 모달리티별 월간 중앙값입니다.
채팅 음성
100
75
50
25
0
98
68
99
77
92
94
84
92
91
93
2026년 3월
2026년 4월
2026년 5월
2026년 7월
2026년 8월
2026년 9월
2026년 10월
전체 데이터 표
게시된 모든 언어 쌍과 월별 중앙값, 범위, 표본 크기를 제공합니다. 모든 열을 기준으로 정렬할 수 있습니다.
자주 묻는 질문
지원 언어가 계속 늘어나기 때문입니다. 제품에 추가하는 모든 언어는 주간 벤치마크 실행에 포함되고, 게시 기준을 충족하는 즉시 지수에 반영됩니다. 그런데 새 언어는 1년 동안 튜닝해 온 언어 쌍 수준에서 시작하는 경우가 드뭅니다. 대표 수치는 해당 분기에 게시된 모든 언어 쌍의 중앙값이므로, 기존 언어 쌍이 모두 유지되거나 향상되더라도 신규 언어가 한꺼번에 들어오면 수치가 내려갑니다. 이후 신규 언어 쌍을 튜닝하면서 점수가 오르고 지수도 회복됩니다. 특정 언어의 발전 상황을 보려면 아래에서 해당 언어 쌍 페이지를 여세요. 그 추이는 다른 어떤 것에도 희석되지 않습니다.
각 테스트는 참조 텍스트(채팅)를 보내거나 참조 오디오 파일(음성)을 재생하여, 제품이 사용하는 것과 동일한 라이브 파이프라인에 통과시킵니다. 그런 다음 LLM 평가자가 기준이 되는 참조 번역과 비교해 출력을 0~100점으로 채점합니다. 점수는 구간으로 나뉩니다. 90 이상은 우수, 70–89는 양호, 50–69는 보통, 50 미만은 미흡입니다. 음성 인식과 평가자 모두 노이즈가 있어 한 번의 실행은 수십 점씩 달라질 수 있으므로, 단일 수치가 아니라 한 달간의 중앙값과 범위로 언어 쌍을 판단하세요.
음성은 음성 인식과 번역을 합친 엔드투엔드 단일 점수입니다. 채팅은 입력한 텍스트만 번역한 점수입니다. 인식 오류는 음성 점수에 반영되므로 음성 쌍은 평균적으로 점수가 낮게 나오며, 게시 기준선도 채팅의 60에 비해 45로 더 낮습니다. 팀이 주로 글로 입력한다면 채팅 수치를, 주로 말로 소통한다면 음성 수치를 참고하세요.
아니요. 이 벤치마크는 합성 데이터 기반입니다. 자동화된 테스트 스위트가 매주 고정된 FLORES-200 기준 세트를 파이프라인에 통과시키며, 이것이 이 수치의 유일한 출처입니다. 데모에서 사용자가 진행한 세션은 점수에 반영되거나 벤치마크에 저장되지 않으며, 고객님의 미팅 역시 벤치마크에 사용되지 않습니다.
위 표에서 해당 언어 쌍의 페이지를 열면 월별 중앙값, 범위, 표본 크기와 월별 추이를 확인할 수 있습니다. 직접 가진 자료로 확인해 보려면 테스트 환경을 열어 보세요. 벤치마크가 실행되는 것과 동일한 2분할 구성이며, 사용하시는 언어로 말하거나 입력하면 됩니다. 자동으로 시작되는 것은 없으며 저장되는 것도 없습니다. 목록에 없는 언어 쌍은 아직 게시 기준선을 넘지 못했거나 제품에 아직 추가되지 않은 것입니다. 점수가 낮은 언어 쌍도 직접 링크로 접근할 수 있으며, 저희는 이를 숨기지 않습니다.