공개적으로 검증하는 번역 품질

AI 번역 품질 벤치마크

InterMIND가 실제로 얼마나 잘 번역하는지를 고정된 FLORES-200 벤치마크 세트를 기준으로 자동화된 테스트 스위트로 매월 언어 쌍별로 측정합니다. 임의로 골라낸 평균이 아닌, 합성 데이터 기반의 재현 가능한 결과입니다.

채팅 번역
91/100
중앙값 · 22개 쌍 · 22회 실행 · Q4 2026

입력한 메시지를 인라인으로 번역

음성 번역
93/100
Q3 2026 대비 +3중앙값 · 22개 쌍 · 22회 실행 · Q4 2026

음성 인식 + 번역을 합친 엔드투엔드 단일 점수

44 언어 쌍·45 채점된 실행·23 언어·매월 업데이트 · 2026년 10월

점수 = 참조 번역과의 의미적 충실도(0–100)입니다. 높을수록 좋습니다.

우수 90+ 양호 70–89 보통 50–69 미흡 <50

텍스트 채팅 번역

입력한 메시지를 전송 시 인라인으로 번역합니다.

이번 분기 23개 언어 중 23개 언어가 평균 양호(70+) 이상입니다 · Q3 2026 대비 14개 향상

언어별 평균 품질 · Q4 2026Q3 2026 대비

각 막대는 이번 분기에 해당 언어로 또는 해당 언어에서 번역한 모든 실행을 합산한 값입니다. 점선 표시는 이전 분기를 나타냅니다.

Q4 2026 (avg) Q3 2026 중앙값 91 · Q4 2026
100
75
50
25
0
100
100
100
97
96
94
94
92
92
91
91
91
91
91
89
89
88
88
88
88
87
87
71
▲2es
▲4it
▲1pt
▲1ro
▲3fr
▲7ko
▲3pl
▼1sv
▲5zh
▲6fi
▼4de
▲2en
▼4ja
▲30tr
▲9is
▼2nl
▼4da
▲3ru
▼1uk
▼3no
▼4cs
▲26hi
▼13hu

Faded bars have a thin sample (<3 runs) — read them as provisional.

음성 번역

실시간으로 음성을 인식하고 번역합니다. 엔드투엔드로 처리하기 더 어려운 문제입니다.

이번 분기 23개 언어 중 23개 언어가 평균 양호(70+) 이상입니다 · Q3 2026 대비 19개 향상

언어별 평균 품질 · Q4 2026Q3 2026 대비

각 막대는 이번 분기에 해당 언어로 또는 해당 언어에서 번역한 모든 실행을 합산한 값입니다. 점선 표시는 이전 분기를 나타냅니다.

Q4 2026 (avg) Q3 2026 중앙값 93 · Q4 2026
100
75
50
25
0
100
98
97
97
97
96
96
96
95
94
93
92
92
91
90
89
89
89
88
87
85
83
76
▲8ko
▲3es
▲2zh
▲3ja
▲1it
▲4uk
▲3pt
▲3ro
▲10ru
▲3pl
▲1fr
•nl
▲4en
▲1cs
▲1no
▲2sv
▲9hu
▲4de
•da
▼4hi
•fi
▲5is
▲8tr

Faded bars have a thin sample (<3 runs) — read them as provisional.

시간에 따른 품질 추이

게시를 시작한 이후 모달리티별 월간 중앙값입니다.

채팅 음성
100
75
50
25
0
98
68
99
77
92
94
84
92
91
93
2026년 3월
2026년 4월
2026년 5월
2026년 7월
2026년 8월
2026년 9월
2026년 10월

이 수치는 실제 세션에서 나왔습니다

라이브 데모의 모든 실행은 자동으로 채점되어 다음 달 벤치마크에 반영됩니다. 세션은 다음과 같은 모습입니다:

실시간 번역 회의
→ EN

전체 데이터 표

게시된 모든 언어 쌍과 월별 중앙값, 범위, 표본 크기를 제공합니다. 모든 열을 기준으로 정렬할 수 있습니다.

자주 묻는 질문