Di balik empat pipeline terjemahan yang menjalankan InterMIND
Halaman /product/overview/how-it-works lama di mind.com sudah beberapa rilis mayor tertinggal. Halaman tersebut mendeskripsikan satu "mesin terjemahan" seperti cara yang dilakukan sebagian besar halaman vendor — satu panah besar dari "Anda berbicara" ke "mereka mendengar." Gambaran tersebut sudah merupakan penyederhanaan dua tahun lalu. Hari ini, gambaran itu salah.
Faktanya, InterMIND menjalankan empat pipeline terjemahan terpisah, masing-masing menyelesaikan masalah yang berbeda dengan mesin yang berbeda, anggaran latensi yang berbeda, dan batasan kualitas yang berbeda. Mereka berbagi pemilih bahasa. Mereka tidak berbagi mesin.
Ini adalah jawaban terbaru untuk "bagaimana cara kerjanya."
Tulisan pendamping: "How many languages do you support?" membahas apa yang dicakup oleh masing-masing pipeline (23 / 23 / 30 / 17). Pos ini membahas tentang apa yang dilakukan oleh masing-masing pipeline — dan mengapa hal itu berbeda.
Mengapa "satu mesin untuk segalanya" adalah kebohongan
Platform rapat langsung memiliki setidaknya empat tugas yang harus dikerjakan sekaligus, dan semuanya menarik ke arah yang tidak kompatibel:
- Suara real-time — audio masuk, audio terjemahan keluar, di bawah satu detik, setiap penonton dalam bahasa mereka sendiri. Batasan utamanya adalah latensi.
- Teks chat real-time — pesan singkat, cepat, dengan suntingan, kutipan, dan struktur HTML yang dipertahankan.
- Catatan bersama real-time — pengetikan kolaboratif karakter demi karakter, dengan hierarki struktural (daftar, judul, kotak centang) yang harus tetap utuh selama penerjemahan.
- Berkas dokumen asinkron — PDF 40 halaman yang dimasukkan ke dalam chat. Tidak ada anggaran latensi. Batasan utamanya adalah fidelitas — pemformatan, tabel, nomor halaman, font.
Anda bisa membangun satu panggilan LLM raksasa yang mencoba melakukan keempatnya. Kami sudah mencoba. Itu buruk dalam keempatnya. Anggaran latensi untuk suara berarti model tidak bisa berpikir; anggaran fidelitas untuk dokumen berarti model harus berpikir. Suntingan chat membutuhkan diff dalam bahasa penonton; PDF 40 halaman membutuhkan pelestarian format yang tidak diberikan oleh model token-streaming mana pun.
Jadi kami menjalankan empat pipeline. Berikut adalah masing-masing pipeline tersebut.