InterMIND-ты басқаратын төрт аудару пайплайнының ішінде

InterMIND-та «бір ғана аударма» деген жоқ. Төрт пайплайн бар — дауыс, чат, жазбалар, құжаттар — әрқайсысының өз қозғалтқышы, кідіріс бюджеті және сапа шеңбері бар. Сіз сөйлеген сәт пен басқа тілдегі қатысушы сізді түсінген сәттің арасында шын мәнінде осылай болады.

The Mind.com Team

InterMIND-ты басқаратын төрт аудару пайплайнының ішінде

InterMIND-ты жүргізетін төрт аударма конвейерінің ішкі құрылымы

mind.com сайтындағы ескі /product/overview/how-it-works беті бірнеше ірі релиздің алдында қалып қойды. Онда көптеген вендор беттеріндегідей бір ғана «аударма қозғалтқышы» сипатталады: «сіз сөйлейсіз» дегеннен «олар естиді» дегенге дейінгі бір үлкен көрсеткі. Бұл сурет екі жыл бұрын да жеңілдетілген болатын. Бүгін ол қате.

Шындығында InterMIND төрт бөлек аударма конвейерін іске қосады. Әрқайсысы бөлек мәселені шешеді, бөлек қозғалтқышпен жұмыс істейді, кідіріс бюджеті мен сапа диапазоны да өзгеше. Олар тіл таңдау тізімін ортақ пайдаланады, бірақ қозғалтқышты бөліспейді.

Бұл «қалай жұмыс істейді» деген сұраққа жаңартылған жауап.

Серік материал: «Қанша тілді қолдайсыздар?» мақаласы әр конвейердің нені қамтитынын (23 / 23 / 30 / 17) түсіндіреді. Ал бұл жазба әр конвейердің нені істейтінін және оның неге бөлек жүйе екенін түсіндіреді.


«Бәріне бір қозғалтқыш» деген неге жалған

Тірі кездесу платформасы бір мезгілде кемінде төрт жұмыс атқаруы керек, ал олар бір-біріне қарама-қарсы бағытта тартады:

  1. Нақты уақыттағы дауыс — кіріс аудио, шығыс аударылған аудио, бір секундтан аз кідіріспен, әр көрермен өз тілінде. Басты шектеу — кідіріс.
  2. Нақты уақыттағы чат мәтіні — қысқа хабарламалар, жылдам, өңдеулер, дәйексөздер және HTML құрылымы сақталады.
  3. Нақты уақыттағы ортақ жазбалар — таңбама-таң бірлесіп теру, аударма кезінде сақталуы тиіс құрылымдық иерархиямен (тізімдер, тақырыптар, чекбоксты тармақтар).
  4. Асинхронды құжат файлдары — чатқа тасталған 40 беттік PDF. Кідіріс бюджеті жоқ. Басты шектеу — дәлдік: пішімдеу, кестелер, бет нөмірлері, қаріп.

Төртеуін де орындауға тырысатын бір алып LLM шақыруын құруға болады. Біз тырыстық. Ол төртеуінде де нашар жұмыс істейді. Дауыстың кідіріс бюджеті модельге ойлануға мүмкіндік бермейді, ал құжаттардың дәлдік бюджеті ойлануды талап етеді. Чаттағы өңдеуге көрермен тілінде diff керек, ал 40 беттік PDF-ке токенді стримдейтін ешбір модель бере алмайтын пішім сақтау керек.

Сондықтан біз төртеуін жүргіземіз. Міне, олардың әрқайсысы.


1-конвейер: нақты уақыттағы дауыс аудармасы

Мәселе: Қатысушы француз тілінде сөйлейді. Екіншісі неміс тілімен қосылған, үшіншісі бразилиялық португал тілімен, төртіншісі жапон тілімен. Әрқайсысы спикерді өз тілінде, өз құлағында, көз байланысын сақтауға болатындай қысқа кідіріспен естуі керек.

Бюджет: Басынан аяғына дейін секундтан аз. ~1,2 секундтан асқанда әңгіме бұзылады: адамдар аударманың үстінен сөйлей бастайды, ал кездесу «ағылшынша сөйлесейік» деген жаққа ауа бастайды.

Аудио іс жүзінде қалай қозғалады

Дауыс аудармасының конвейері: спикердің браузері аудионы WebRTC арқылы біздің өз қозғалтқышымызға — Франциядағы OVH-тегі Mind API медиа-серверіне — жібереді, ол ASR жүргізіп, бөлмеде бар әр мақсатты тілге аударады; әр көрермен өзіне арналған аударылған аудио тректі алады, ал ws-server қорытынды үшін транскрипт сөздерін қабылдайды.

Нақты атап өтуге тұрарлық бірнеше жайт:

  • ASR медиа-серверде жұмыс істейді. Спикердің аудиосы WebRTC арқылы біздің өз қозғалтқышымызға — Франциядағы OVH-тегі Mind API-ға — барады және дәл сол қоңырауды алып жүрген серверде танылады; браузер тек аудио жібереді және сөздерді кері қабылдайды. Бөлек сөйлеу вендоры жоқ, аударма басталғанға дейін қосымша хоп та жоқ. (Чаттағы дауыстық жазбалар бұған қосылмайды: олардың speech-to-text функциясы Azure AI Speech-те, яғни әдепкі AI шлюзінің сөйлеу сервисінде жұмыс істейді.)
  • Аударма бір fan-out емес. Қозғалтқыш бөлмеде бар әр мақсатты тіл бойынша аударады, әр көрермен бойынша емес: бір тілге аударма сол тілдегі алғашқы тыңдаушы аударылған ағынды сұраған сәтте басталады, неміс тілін таңдаған үш қатысушы бір неміс аудармасын бөліседі, ал араб тілінде ешкім тыңдамаса, арабшаға ештеңе аударылмайды. Сондықтан төрт тілді кездесу мен қырық тілді кездесудің құны шын мәнінде кімнің келгеніне дейін бірдей болады: біз ешбір қатысушы тыңдамайтын тілдерге ешқашан аудармаймыз.
  • Синтезделген сөйлеу әр көрермен үшін жеке. Әр қатысушы өзіне арналған аударылған аудио тректі алады, ол түпнұсқа спикердің бейнесімен араласады. Олар «аударылған кездесудің» бір басты нұсқасын көрмейді: олар сол бір кездесуді көреді, тек жеке аудио арнасы өздері таңдаған тілге аударылады. Сондықтан бір физикалық бөлмедегі екі адам әрқайсысы құлаққап тағып, әртүрлі тілде тыңдай алады.

Кездесу қисайған кезде бұл неге маңызды

Сегіз тілді 60 минуттық қоңырауда нәрселер қызық жолдармен бұзылады: WebSocket-тер үзіледі, ASR жалқы есімді уақытша қате транскрипциялайды, бір қатысушының желісі тұрақсыздана бастайды. Жоғарыдағы архитектура ақаулықтарды оқшаулауға мүмкіндік береді: бір көрерменнің аудиосындағы ақау басқа жетеуіне әсер етпейді, өйткені аударма қозғалтқышы «аударманы» ешқашан бір данада жасамайды — ол сегізін параллель жасайды, ал тек зардап шеккен біреуі ғана қалпына келуі керек.

Қозғалтқыштың өзі біздікі, өз инфрақұрылымымызда орналасқан. Біз нақты уақыттағы дауысты үшінші тараптың жалпы мақсаттағы LLM-дері арқылы жібермейміз. Оларды кідіріс бюджеті жоққа шығарады; ал деректер резиденттігі мәселесі оларды нақты осыған мән беретін реттелетін клиенттер үшін жоққа шығарады.

Дауыс сапасы туралы нені жариялаймыз: /benchmark өндірістік дауыс конвейерін жарияланған әр тіл жұбы бойынша FLORES-200 сөйлемдерімен ай сайын тексереді. Төреші аталған (негізгісі Gemini 3.7 Flash, резервтегісі Claude Sonnet 5). Толық үлестірім — медиана, p10, p90, минимум, максимум, таңдама көлемі — бетте көрсетілген. Бұл сандардың нені өлшейтінін және нені өлшемейтінін әдістемеден қараңыз.


2-конвейер: нақты уақыттағы чат аудармасы

Мәселе: Кездесудегі әр чат хабарламасы әр қатысушы үшін өз тілінде, жіберілген сәтте аударылуы керек. Сонымен қатар өңдеулер де бар, ал өңдеулер қайта аударма емес, өңдеу сияқты көрінуі тиіс.

Бюджет: Жылдам, бірақ секундтан аз емес. Чат хабарламасы басқа тілде жарты секундта пайда болса, оған ешкім мән бермейді. Адамдарға аударманың дұрыс екені және өңдеулердің мағынасы бар екені маңызды.

Чат конвейері іс жүзінде не істейді

Әр хабарлама дауыс конвейері қолданатын сол аударма қозғалтқышынан өтеді, бірақ алдын ала және кейінгі өңдеуі бөлек:

  • HTML құрылымы сақталады. Чат бай мәтінді қолдайды (абзацтар, тізімдер, дәйексөздер, жуан, көлбеу). Біз оны модель үшін қарапайым мәтінге түрлендіреміз, аударамыз, содан кейін нәтижені бастапқы тегтермен қайта орап қоямыз. Модель HTML-ді ешқашан көрмейді, ол таза прозаны көреді.
  • Дәйексөздер бөлек аударылады. Хабарламаға жауап беріп, оны дәйексөз ретінде келтірсеңіз, [QUOTE]…[/QUOTE] блогы мен жаңа мазмұн бөлек бірліктер ретінде аударылады, сондықтан модель екеуін шатастыра алмайды.
  • Ұзын хабарламалар бөліктерге бөлінеді. Біз абзац шекараларында бір бөлікке 1 000 таңбадан бөлеміз. Әр бөлік — өз аударма шақыруы. 4 000 таңбалық «романдарды» модельге бір рет беруден аулақпыз: ақау түрлері (қиылу, жоғалған абзацтар, сөйлемнің ортасында үзілу) тым ұсқынсыз.
  • Аударма жалқау (lazy). Біз IntersectionObserver қолданамыз: хабарлама көрерменнің көру аймағына келгенде ғана аударылады. Бұрын ұзақ жүріп жатқан арнада тілді ауыстырғанда тарихтағы әр аударма API шақыруы қайта орындалатын. Енді олай емес.

Қызық бөлік: өңдеулер diff ретінде

v1.2 нұсқасында біз басқа тілдегі көрермендер үшін чат өңдеулерінің жұмысын өзгерттік. Ескі мінез-құлық мынадай болды: біреу хабарламаны өңдейді, біз оны түгел қайта аударамыз, сіз жаңа абзацты көресіз де, нақты не өзгергенін өзіңіз іздейсіз.

Жаңа мінез-құлық:

  1. Бастапқы хабарлама сіздің тіліңізге бұрыннан аударылған.
  2. Жіберуші өңдегенде, біз жаңа нұсқаны қайта аударамыз.
  3. Біз сіздің алдыңғы аудармаңыз бен жаңа аудармаңыздың арасындағы diff-ті сіздің тіліңізде есептейміз.
  4. Біз бұл diff-ті жолішілік көрсетеміз, Git не өзгергенін көрсететін тәсілмен.

Сонымен ағылшынша «review by Tuesday» «review by Thursday» болып өзгергенде, испан тілінде оқитын әріптесіңіз қайта оқуға тура келетін қайта аударылған абзацты емес, бөлектелген martes → jueves дегенді көреді.

Ол үшін чат конвейерін күйсіз (stateless) «сұраныс бойынша аудару» эндпоинті ретінде емес, әр көрермен үшін күйі бар кэш ретінде қарастыру қажет болды. Құжаттар мен дауысқа бұл керек емес. Чатқа керек.


3-конвейер: нақты уақыттағы ортақ жазбалар аудармасы

Мәселе: Хост ортақ жазбалар панелін ашып, теруді бастайды. Әр қатысушы жазбаларды өз тілінде, таңбама-таң, құжат құрылымы — тақырыптар, кірістірілген тізімдер, чек-тізімдер, код блоктары — бүтін күйінде көреді.

Бюджет: Чаттағыдай (~жарты секунд), бірақ екі қосымша шектеумен:

  • Аударылып жатқан нәрсе аударма кезінде өзгереді. Хост әлі теріп жатыр. Әр пернені басқан сайын «бүкіл құжатты» аударатын аңғал жүйе жыпылықтау тудырады және API бюджетін өртейді. Біз бүкіл құжатты емес, өзгерген бірлік деңгейінде аударамыз.
  • Құрылым сақталуы керек. Аударма моделінен үш кірістірілген тізімі бар markdown блокты аударуды сұрасаңыз, түпнұсқаға ұқсайтын, бірақ иерархиясы байқалмай тегістелген, элементтері қайта нөмірленген немесе шегіністері жылжыған нәрсе қайтарады. Біз модельге бүкіл блокты көрсетпейміз.

Жазбалар конвейерінің чаттан айырмашылығы

Басты нәрсе — құрылымды сақтау. Біз әр тізім элементін бір құжат ретінде емес, жеке аударамыз. Модель мынаны көреді:

"Compliance review — Q2 deliverables"

мынаны емес:

"# Project plan\n## Quarter\n- Compliance review — Q2 deliverables\n- Vendor scoring\n - Tier 1 vendors..."

Орап тұрған құжат — <ul>, тақырыптар, шегіністер — клиент жағында түпнұсқа құжаттың құрылымымен қайта құрылады, әр жапырақ түйін өз аудармасымен ауыстырылады. Модель иерархияны «жақсартуға» ешқашан мүмкіндік алмайды.

Жазбалар да чат өңдеулеріндегідей әр көрерменге арналған diff моделін қолданады: хост жолды өзгертсе, басқа тілдердегі көрермендер жаңа абзацты емес, өзгерген сөздердің бөлектелгенін көреді.


4-конвейер: асинхронды құжат аудармасы

Мәселе: Біреу чатқа 40 беттік PDF, Word құжатын, PowerPoint презентациясын немесе Excel кестесін тастайды. Әр қатысушы өз тілінде көшірме сұрай алады. Аударылған файл түпнұсқаға ұқсауы керек: сол қаріптер, сол кестелер, сол бет нөмірлері, сол колонтитулдар, сол диаграммалар өз орнында.

Бюджет: Нақты уақыт шектеуі жоқ. Бір минут жарайды. Екі минут жарайды. Шектеу — дәлдік: аударылған PDF түпнұсқаға ұқсамаса, алушы оған сенбейді.

Бұл конвейер неге дауыспен қозғалтқышты бөліспейді

Жалпы LLM, тіпті өте жақсысы да, құжаттың аударылған мәтінін қайтарады. Ол сол макеті бар аударылған PDF қайтармайды. Модельде «түпнұсқамен сәйкес келуі тиіс бет үзілімі» немесе «баған енін сақтауы тиіс кесте ұяшығы» деген ұғым жоқ.

Бұл бет үшін біз DeepL Document API-ін тікелей қолданамыз. Ол файлдардан алынған прозаны емес, файлдарды файл ретінде аудару үшін жасалған. DeepL мыналарды өңдейді:

  • PDF (макетті сақтай отырып)
  • DOCX, DOC
  • PPTX
  • XLSX

Құжат DeepL конвейеріне жүктеледі, серверде пішімі бүтін күйінде аударылады және сол пішімде қайтарылады. Содан кейін біз нәтижені өз объектілік сақтау қоймасына жүктейміз және чатқа жүктеп алуға болатын қосымша ретінде қайтарамыз.

Бұл нешеге түседі және оны неге жасырмаймыз

DeepL бір құжат үшін ең кемі 50 000 таңба есептейді — құжат бір бет немесе отыз бет болса да, Pro тарифінде шамамен бір АҚШ доллары. Біз бұл шығынды файл үшін ақы алудың орнына өзіміз көтереміз; ол кездесудің аударма пайдалану есебінде есептелген таңбалар ретінде көрінеді, оларды өнімнің қалған бөлігі аударма белсенділігін есептейтін тәсілге сәйкес келетін сөз-бірліктеріне айналдырамыз.

Біз бұл бет үшін DeepL-ді таңдадық, өйткені файлдарды файл ретінде аудару — дәл оның жасалған міндеті, біз одан жақсысын жасауға тырыспадық. Керісінше жағдай дұрыс емес: DeepL біз кездесулер үшін құрған типтегі тірі дауыс конвейерін жүргізбейді. Мәселелер әртүрлі, құралдар әртүрлі. «InterMIND аудармасын не қуаттайды» деген сұраққа адал жауап — «әр конвейерге лайықты қозғалтқыш», ал «барлық жерде біздің қозғалтқышымыз» емес.

Бұл конвейер қамтитын, бірақ дауыс қамтымайтын тілдер

Құжат конвейері дауыстағы 23 тілге қарсы 30 тілге жетеді. Қосымшаларға мыналар кіреді: болгар, грек, эстон, индонезия, литва, латыш, словак, словен тілдері. (Араб тілі де осы тізімде, және ол қосымшалардың бірі: оның дауыс сапасы біздің межеден төмен болғандықтан, ол нақты уақыттағы таңдау тізімінен алынып тасталған, ал оның жұптар бойынша баллдары /benchmark бетінде жария қалады — оны қайтаратын нәрсе сол сан. Хинди тіліне қатысты асимметрия кері бағытта: дауыста бар, файлдарда әзірге жоқ.)

Бұл асимметрия шынайы. Ол француз қатысушысы кездесуді эстон тілінде тыңдай алмаса да, келісімшарт PDF-ін эстон тілінде сұрай алатынын білдіреді. Біз оны бір санмен тегістеп жібермей, таңдау тізімінде белгілейміз. Негіздемесі тіл санына арналған жазбада.


Конвейерлер қайда түйіседі

Төрт конвейер оқшау жұмыс істемейді. Кездесу бөлмесі — олар бір-біріне тиетін жер, ал жігі маңызды:

  • Құжат тіркемесі бар чат хабарламасы мәтін үшін чат конвейерін, ал файл үшін құжат конвейерін іске қосады. Басқа тілдегі қатысушы хабарламаның аудармасын бірден көреді, ал тіркеменің аудармасы жүктеп алынатын файл ретінде асинхронды түрде келеді.
  • Транскрипт жолын дәйексөз ететін ортақ жазба жазбалар ↔ дауыс шекарасынан өтеді. Транскрипт — дауыс конвейерінің жіберуші тілі үшін шығарғаны; жазбаның аудармасы сол дәйексөздің басқалардың тілдеріндегі әр көрерменге арналған көшірмесін, дереккөзі көрсетілген күйде жасайды.
  • Кездесуден кейін экспортталған транскрипт бүкіл әңгіме бойынша чат стиліндегі мәтін конвейерін іске қосып, қатысушылар жүктей алатын тіл бойынша файл жасайды. Бұл чат аудармасымен бірдей код жолы, тек пакеттелген.

Тіл таңдау тізімі — интерфейстің бір бөлігі. Оның астындағы инфрақұрылым — бір-бірімен сөйлесетін төрт конвейер.


Нені әдейі жасамаймыз

  • «Бірыңғай аударма моделі» жоқ. Біз дауысты, чатты, жазбаларды және құжаттарды орындайтын бір модель құрмаймыз. Кідіріс пен дәлдік арасындағы айырбастың жеңімпазы жоқ. Біз әр бетке лайықты қозғалтқышты қолданамыз.
  • Үнсіз қайта бағыттау жоқ. Файл конвейері бүгін хиндиге аудара алмаса, біз дауыс қозғалтқышына үнсіз ауысып, істеді дегендей кейіп танытпаймыз — файл таңдау тізімі олқылықты жасырмай, белгілейді.
  • «200 тілге аударамыз» деген жоқ. Біздің қозғалтқыш 24 тіл шығарады. Тірі беттер 23-ті, құжаттар 30-ды қолдайды — және бір маркетингтік сыйымды санның орнына аудитордың алдында тұра алуы тиіс жұптар бойынша сапа /benchmark бетінде, әлсіз жұптарды қоса, жарияланған.

Өзіңіз байқап көріңіз

  • Тірі демоны байқап көріңіз — тірі дауыс конвейерін сіздің аудиоңызға қолданады, 23 өнім тілінің кез келгенінде. /benchmark бағалайтын сол конвейер.
  • Бенчмаркті қараңыз — нақты трафик бойынша жұптар және айлар бойынша сапа. Таңдау тізіміндегі әр жұп, күшті немесе әлсіз, тікелей сілтемемен ашылады.
  • Әдістемені оқыңыз — сандардың не екені, не еместігі, төреші кім екені.

Төрт конвейер, төрт қозғалтқыш, бір кездесу бөлмесі. Ескі how-it-works бетінің адал алмастырушысы осы.

— Mind.com командасы


Дереккөздер: DeepL — қолдау көрсетілетін тілдер, DeepL — пайдалануды санау және биллинг (бір файлға 50 000 таңбалық минимум), FLORES-200; конвейерлер туралы ішкі фактілер жеткізілген кодпен тексерілді, 2026 жылғы тамызда расталды.

Тікелей аударма бойынша қосымша

Тікелей аударма бойынша барлық жазбалар
Түрік тіліндегі дауыстық аудармашы: етістік соңында келеді және қайсысы керек екенін дәл осы анықтайды
Тікелей аударма

Түрік тіліндегі дауыстық аудармашы: етістік соңында келеді және қайсысы керек екенін дәл осы анықтайды

Түрік тілінде етістік, сондай-ақ болымсыздық пен шақ сөйлемнің соңында тұрады. Осы бір ерекшелік «дауыстық аудармашы» деп сатылатын үш өнімді ажыратады: телефон қосымшалары, аудармашы құлаққаптар және кездесулердегі нақты уақыттағы аударма. Олардың әрқайсысы түрік сөйлемімен не істей алатынын, не істей алмайтынын және жеткізушінің тілдер санына қарап бұл жұп туралы ештеңе білуге болмайтынын түсіндіреміз.

The Mind.com Team

Синхронды аудармашы: тірі адам, RSI платформасы немесе AI — көптілді meeting-ке не қажет (2026)
Тікелей аударма

Синхронды аудармашы: тірі адам, RSI платформасы немесе AI — көптілді meeting-ке не қажет (2026)

«Синхронды аудармашы» — бұл мамандық; ал іздеу жүйесінде көпшілік шын мәнінде сөйленіп жатқан сөздің басқа тілде бірден жетуін іздейді. Бұл нұсқаулық кабинаны, RSI платформасын және AI арқылы синхронды аударманы бір-бірінен ажыратады, құралдарды олардың құжаттамасы бойынша салыстырады — Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet, InterMIND — және салыстырулар қалдырып кететін мәселелерді қояды: meeting мазмұнының қаншасы сіздің тіліңізге шынымен жетеді және деректер қайда өңделеді.

The Mind.com Team

Синхронды аударма: кабина, RSI немесе AI — және кездесулеріңізге қандай құралдар қажет (2026)
Тікелей аударма

Синхронды аударма: кабина, RSI немесе AI — және кездесулеріңізге қандай құралдар қажет (2026)

«Синхронды аударма» үш түрлі шындықты қамтиды: кабинадағы аудармашы, қашықтан синхронды аударма (RSI) және нақты уақыттағы AI аудармасы. Бұл нұсқаулық үшеуін бір-бірінен ажыратады, құжатталған құралдарды — Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet, InterMIND — салыстырады және салыстыру мақалалары айналып өтетін сұрақты қояды: кездесудің қаншасы шын мәнінде сіздің тіліңізге оралады?

The Mind.com Team

Жаңа жазбалар мен өнім жаңартуларын электрондық пошта арқылы алыңыз

Айына бір хат: жаңа жазбалар мен өнім жаңартулары. Кез келген уақытта жазылымнан бас тартуға болады.