Methodology

Mengapa pemasaran kualitas terjemahan rusak — dan apa yang kami publikasikan sebagai gantinya

Setiap vendor terjemahan mempublikasikan jumlah bahasa. Tidak ada yang mempublikasikan kualitas per pasangan yang dapat diverifikasi pada lalu lintas nyata. Mengapa kesenjangan itu penting dalam evaluasi pengadaan Anda berikutnya — dan apa yang kami publikasikan sebagai gantinya.

The Mind.com Team

Mengapa pemasaran kualitas terjemahan rusak — dan apa yang kami publikasikan sebagai gantinya

Mengapa pemasaran kualitas terjemahan rusak — dan apa yang kami publikasikan sebagai gantinya

Buka situs vendor penerjemah langsung mana pun. Anda akan melihat jenis angka yang sama:

  • "200+ bahasa"
  • "6.000+ pasangan bahasa"
  • "Pertama di dunia" / "Akurasi tertinggi"
  • "99% akurat"

Sekarang cobalah temukan — di halaman vendor mana pun — apa arti angka-angka itu untuk rapat yang akan Anda jalankan. Kualitas per bahasa. Metodologi yang dapat direproduksi. Ukuran sampel. Skor dari waktu ke waktu. Pengungkapan jujur tentang di mana model lemah.

Anda tidak akan menemukannya. Tidak di materi pemasaran, dan jarang di dokumentasi.

Ini adalah keseimbangan kategori. Ada karena tiga hal:

  1. Sebagian besar vendor tidak memiliki mesin terjemahan sendiri. Mereka merutekan melalui OpenAI, Google, DeepL, Microsoft, atau kombinasi keduanya. Memublikasikan data kualitas per pasangan berarti melakukan benchmark model milik orang lain — tidak ada nilai pemasaran di situ.
  2. Data kualitas yang jujur sulit dipajang. Satu skor saja penuh derau. Distribusi lebih berguna tetapi lebih sulit dikompres. last-six-months trend lebih berguna lagi, dan lebih sulit lagi.
  3. Pengadaan belum pernah menentang. Pembeli menerima angka pemasaran apa adanya, dan karenanya keseimbangan bertahan.

Keseimbangan ini tidak akan bertahan. Kategori pembeli berikutnya — farmasi, hukum, keuangan, audit, sektor publik — akan mengajukan pertanyaan yang lebih tajam daripada "berapa banyak bahasa." Kami membangun /benchmark karena kami merasa mereka tidak seharusnya hanya mengambil kata-kata vendor.


Apa yang tidak diberitakan oleh angka pemasaran

"200+ bahasa" berarti vendor memiliki model yang menghasilkan teks dalam 200 bahasa. Kualitas di seluruh bahasa tersebut berkisar dari kelas produksi untuk pasangan utama (EN↔DE, EN↔ES, EN↔FR) hingga hampir tidak dapat digunakan untuk pasangan dengan sumber daya terbatas. Tanpa rincian per pasangan, Anda tidak dapat mengetahui di sisi mana garis itu rapat Anda akan berada.

"6.000+ pasangan bahasa" adalah kombinatorika N × N pada 80 bahasa sumber. Mengatakan Anda mendukung 6.000 pasangan adalah bagian yang mudah. Mengatakan bahwa pasangan tertentu cukup baik untuk tinjauan CAPA, negosiasi kontrak, atau konferensi laba — itu adalah bagian yang tidak ada di brosur.

"99% akurat", tanpa menentukan apa yang diukur, terhadap referensi apa, pada sampel apa, oleh hakim apa — adalah tanpa substansi. Kualitas terjemahan tidak memiliki skalar universal. Ia memiliki distribusi yang bergantung pada pasangan bahasa, domain konten, kualitas audio (untuk suara), anggaran latensi, dan apa arti "cukup baik" untuk kasus penggunaan spesifik.


Apa yang sebenarnya perlu diketahui pembeli

Pertanyaan-pertanyaan yang muncul dalam tinjauan DPA nyata dan evaluasi pengadaan:

  1. Kualitas per pasangan — bagaimana performa pada DE↔EN, EN↔AR, JA↔KO, secara spesifik?
  2. Ukuran sampel — berapa banyak eksekusi yang mendasari angka yang Anda laporkan? Sepuluh? Sepuluh ribu?
  3. Metodologi — siapa yang menilai terjemahan, terhadap referensi apa, dengan rubrik apa?
  4. Distribusi, bukan rata-rata — seperti apa 10% kasus terburuk? 10% terbaik? Mediannya?
  5. Pergeseran dari waktu ke waktu — apakah pasangan tertentu menjadi lebih baik atau lebih buruk sejak Anda terakhir memublikasikan angka?
  6. Apa yang tidak Anda ukur — apa yang secara eksplisit tidak ditangkap oleh benchmark Anda?

Tidak ada satu pun dari pertanyaan ini yang tidak dapat dijawab. Mereka hanya tidak ada di halaman pemasaran siapa pun.


Apa yang kami publikasikan

/benchmark adalah jawaban kami. Metodologinya ada di /benchmark/methodology — ditulis sebelum kami tahu Anda akan membaca ini.

Tiga hal membedakannya dari norma kategori.

1. Traffic nyata, bukan suite yang dikurasi

Setiap skor dalam benchmark publik berasal dari eksekusi pengujian /demo nyata. Kami tidak memilih pasangan yang berperforma baik sebelumnya. Pipeline yang sama yang melayani demo pembeli adalah yang diukur.

2. Hakim disebutkan namanya

Utama: google/gemini-3.5-flash. Cadangan: anthropic/claude-sonnet-5. Keduanya melalui Vercel AI Gateway. Hakim adalah bagian dari metodologi — diungkapkan dengan nama. Ketika kami mengganti hakim (kami telah melakukannya, seiring model pensiun), baris historis membawa hakim yang sebenarnya menilai mereka; skor lama tidak pernah dinilai ulang secara diam-diam.

3. Distribusi adalah datanya, bukan rata-rata

Setiap baris yang dipublikasikan menunjukkan median, p10, p90, min, max, dan ukuran sampel — bukan satu angka. Satu angka untuk pasangan terjemahan adalah derau. Bentuk distribusi adalah sinyalnya.


Praktik yang belum diadopsi kategori

  • Pasangan skor rendah tidak disembunyikan. Indeks publik dibatasi pada ≥ 10 distinct IPs, ≥ 10 runs, median ≥ 60 — tetapi siapa pun dapat menautkan langsung ke pasangan mana pun dan melihat angka aslinya, termasuk pasangan yang berperforma buruk bulan ini.
  • Masalah yang diketahui didokumentasikan. Ketika harness pengujian chat rusak selama beberapa minggu di awal 2026, periode tersebut ditekan dari indeks dan dicatat secara tertulis di halaman metodologi. Sejarah tidak ditulis ulang secara diam-diam.
  • Apa yang sengaja TIDAK kami klaim adalah bagian penuh di halaman metodologi. Kami menyatakan di mana hakim LLM itu sendiri tidak sempurna. Kami menyatakan apa yang tidak kami ukur (latensi, biaya, kepuasan pengguna, kesalahan sisi ASR sebelum terjemahan berjalan). Kami mengungkapkan bahwa smoke test otomatis kami sendiri adalah bagian dari traffic.

Filter untuk evaluasi vendor berikutnya

Jika Anda mengevaluasi platform rapat multibahasa mana pun — milik kami atau lainnya — metodologi adalah halaman yang layak dibaca. Angkanya sendiri adalah bagian yang mudah.

Filter praktis untuk vendor mana pun dalam kategori ini:

  • Minta data kualitas per pasangan bahasa, per bulan pada traffic nyata. Bukan benchmark yang dikurasi. Bukan agregat.
  • Tanyakan siapa hakim mereka, apa yang secara eksplisit tidak mereka ukur, dan apa yang telah berubah dalam enam bulan terakhir.
  • Tanyakan apa yang terjadi ketika skor pasangan turun — apakah mereka memberi tahu siapa pun, atau memperbaikinya secara diam-diam?

Jika vendor memiliki ketiga jawaban secara tertulis, evaluasilah mereka dengan serius. Jika tidak, Anda membeli pemasaran — bukan kualitas terjemahan.


Cobalah sendiri

  • Coba demo langsung — menjalankan pipeline terjemahan produksi pada audio Anda, menilainya dengan hakim yang sama yang menilai benchmark publik, dan menunjukkan output kepada Anda.
  • Lihat benchmark — setiap pasangan bahasa yang dipublikasikan, setiap bulan, dengan distribusi lengkap.
  • Baca metodologi — bagaimana angka dihitung, apa yang termasuk, apa yang tidak.

Anda tidak perlu mengambil kata-kata kami untuk semua itu. Itulah intinya.


Sumber: identifier hakim, ambang batas gating, dan aturan penekanan di atas diverifikasi terhadap kode yang dirilis dan dipublikasikan di /benchmark/methodology; hakim dilayani melalui Vercel AI Gateway; klaim pemasaran yang dikutip di atas adalah frasa khas kategori, bukan kutipan dari vendor tertentu; diperiksa Agustus 2026.

Dapatkan postingan baru melalui email

Kami akan mengirimkan email saat kami mempublikasikan postingan baru. Berhenti berlangganan kapan saja.