Әдістеме

InterMIND аударма сапасының бенчмаркі біздің өз тест жиынтығымызбен автоматты түрде жасалады: апта сайынғы синтетикалық іске қосу көпшілікке арналған /demo бетін қуаттайтын сол аударма конвейерін бекітілген эталондық жиын бойынша, әр тіл жұбы үшін бірдей тәсілмен жүргізеді. Ол синтетикалық әрі қайталанатын: мұнда ештеңе іріктелмейді немесе тек ең жақсысы таңдалмайды, ал бағалау процесінде адам жоқ.

Жеке тест қалай жұмыс істейді

Тест іске қосылғанда бастапқы тілдегі эталондық аудиофайл ойнатылады (дауыс тесті) немесе эталондық мәтін жіберіледі (чат тесті), ол біздің нақты уақыттағы аударма конвейері арқылы мақсатты тілге аударылады. Нәтижесінде шыққан аударманы LLM-төреші канондық эталондық аудармамен салыстырып, 0–100 шәкілі бойынша бағалайды.

LLM-төреші: негізгісі — google/gemini-3.8-flash, резервтісі — anthropic/claude-sonnet-5 (Vercel AI Gateway арқылы). Барлық жұптар үшін бірдей промпт, рубрика және эталондық мәтіндер қолданылады.

Айлық нәтиже қалай жинақталады

  1. Аяқталған әрбір толық бенчмарк іске қосуы demo_test_runs кестесінде мақсатты тілдер бойынша бағаларымен бірге жазылады. Бір жұптық алдын ала көріністер қосылмайды — медианаларға тек көптілді толық іске қосулар ғана қатысады.
  2. Әр (бастапқы тіл, мақсатты тіл, тест түрі, апта) үшін біз соңғы іске қосуды қалдырамыз, содан кейін айлар бойынша жинақтаймыз — осылайша бір дереккөз апта ішінде бір жұпты қайталап, медианаларды ығыстыра алмайды.
  3. Қайталанбайтын жиыннан медиана, минимум, максимум, p10, p90, орташа мән және таңдама көлемін есептейміз.
  4. Жеке бағаларды снапшот түрінде сақтаймыз, сондықтан ай жабылғаннан кейін бастапқы іске қосулар TTL бойынша жойылса да, сандар өзгермей қалады.

Жұп қоғамдық индексте қашан пайда болады

(жұп × тест түрі × ай) жолы таңдаманың ең аз көлемі мен медиана баллының төменгі шегінен өткенде қоғамдық индекс пен сайт картасына (sitemap) енуге жарамды болады (дауыс үшін шек төменірек, өйткені ASR шуы сөзсіз болады). Деректер көптеген тәуелсіз келушіден емес, жалғыз автоматты көзден келетіндіктен, бұл синтетикалық деректер үшін бірегей дереккөз талабы жеңілдетілген — ал таңдама көлемі мен сапа шектері қолданыла береді.

Шектен өтпеген жұптар тікелей сілтеме арқылы қолжетімді болып қалады — шектер тек іздеу жүйелеріне көрінетін нәрсені ғана реттейді. Төмен бағаларды тікелей сұраған ешкімнен жасырмаймыз.

Нені әдейі ТАЛАП ЕТПЕЙМІЗ

  • Жалғыз баллға сенуге болмайды. ASR мен LLM бағалауы екеуі де шулы болғандықтан, жақсы жұмыс істейтін жұптың өзі іске қосулар арасында 30 балға ауытқуы мүмкін. Сондықтан әр бетте жалғыз сан емес, үлестірім көрсетіледі.
  • LLM-төрешінің өзі де мінсіз емес. Болашақта оны ауыстыруымыз немесе қос төреші қолдануымыз мүмкін; бұл болған жағдайда тарихи жолдарда төрешінің идентификаторы көрсетіледі.
  • Бенчмарк кідірісті, құнды, қолжетімділікті немесе пайдаланушы қанағаттанушылығын өлшемейді. Олар басқа жерде қарастырылады.
  • Деректер синтетикалық — оларды сыртқы үшінші тарап трафигі емес, біздің өз автоматты жиынтығымыз жасайды. Сыртқы панель бар деген әсер қалдырмай, мұны ашық айтамыз.

Адал көрсеткіштер

Белгілі бір жұп бойынша ай сапасы төмендесе — ол көрінетін күйінде қалады. Қате түзетіліп, келесі айда нәтиже секірсе — жақсару сол бетте көрінеді. Тарихи агрегаттарды ешқашан қайта жазбаймыз. Әкімшілер қоғамдық индекстен жеке айларды ғана жасыра алады; олар бұрын жарияланған сандарды өзгерте алмайды.

Тарихи деректерге әсер ететін белгілі мәселелер

  • Чат тестінің харнессі, 2026-04-23 дейін: автоматты чат-тест конвейерінде тілдер бойынша ақаулар болды. Алдыңғы айлардағы чат агрегаттары сол кезеңдердегі нақты аударма сапасынан төмен балл көрсетуі мүмкін. Әсер еткен айлар дерекқорда сақталады, бірақ қоғамдық индекстен жасырылады; трендтік диаграммада түзету кезінде сатылы өзгеріс көрінеді.

Сұрақтар

Мұндағы бір нәрсемен келіспейсіз бе? Issue ашыңыз немесе бізге жазыңыз. Біз бұл бетті жаңартып, өзгерісті белгілейміз.