Metodologi

Tolok ukur kualitas terjemahan InterMIND dihasilkan secara otomatis oleh rangkaian pengujian kami sendiri: setiap minggu, sebuah pengujian sintetis menjalankan pipeline terjemahan yang sama dengan yang menjalankan /demo publik terhadap kumpulan referensi tetap, dengan cara yang sama untuk setiap pasangan bahasa. Pengujian ini bersifat sintetis dan dapat direproduksi — tidak ada yang dikurasi atau dipilih-pilih di sini, dan tidak ada manusia dalam proses penilaian.

Cara kerja satu pengujian

Satu pengujian memutar file audio referensi (pengujian suara) atau mengirim teks referensi (pengujian chat) dari bahasa sumber melalui pipeline terjemahan langsung kami ke bahasa target. Hasil terjemahan dinilai 0–100 oleh LLM judge dengan membandingkannya terhadap terjemahan referensi baku.

LLM judge: google/gemini-3.8-flash sebagai yang utama, anthropic/claude-sonnet-5 sebagai cadangan (melalui Vercel AI Gateway). Prompt, rubrik, dan teks referensi yang sama digunakan untuk semua pasangan.

Cara agregasi satu bulan

  1. Setiap proses benchmark penuh yang selesai dicatat di demo_test_runs beserta skor per bahasa target. Pratinjau satu pasangan dikecualikan — hanya proses penuh multibahasa yang masuk ke dalam median.
  2. Untuk setiap kombinasi (bahasa sumber, bahasa target, jenis pengujian, minggu), kami menyimpan proses terbaru, lalu mengagregasinya per bulan — sehingga satu sumber tidak dapat memengaruhi median dengan mengulang satu pasangan dalam seminggu.
  3. Dari kumpulan data yang sudah dideduplikasi, kami menghitung median, minimum, maksimum, p10, p90, rata-rata, dan ukuran sampel.
  4. Kami menyimpan snapshot skor individual sehingga setelah suatu bulan ditutup, angkanya tetap stabil meskipun data proses mentah sudah dihapus oleh TTL.

Kapan sebuah pasangan muncul di indeks publik

Satu baris (pasangan × jenis pengujian × bulan) memenuhi syarat untuk masuk ke indeks publik dan sitemap apabila memenuhi ukuran sampel minimum dan batas bawah skor median (batas bawah yang lebih rendah untuk suara, yang tidak bisa lepas dari derau ASR). Karena kumpulan data berasal dari satu sumber otomatis dan bukan dari banyak pengunjung independen, persyaratan sumber unik dilonggarkan untuk data sintetis ini — batas bawah ukuran sampel dan kualitas tetap berlaku.

Pasangan yang tidak memenuhi syarat tetap dapat diakses melalui tautan langsung — ambang batas hanya membatasi apa yang dilihat mesin pencari. Kami tidak menyembunyikan skor rendah dari siapa pun yang memintanya secara langsung.

Apa yang sengaja TIDAK kami klaim

  • Satu skor tunggal tidak dapat dipercaya. Pasangan yang berperilaku baik bisa berayun 30 poin antarproses karena ASR dan penilaian LLM sama-sama mengandung derau. Itulah sebabnya setiap halaman menampilkan distribusi, bukan satu angka.
  • LLM judge itu sendiri tidak sempurna. Kami mungkin akan beralih atau menggunakan dua judge di masa mendatang; baris historis akan memuat pengenal judge ketika hal itu terjadi.
  • Benchmark ini tidak mengukur latensi, biaya, ketersediaan, atau kepuasan pengguna. Hal-hal tersebut dibahas di tempat lain.
  • Kumpulan data ini bersifat sintetis — dihasilkan oleh rangkaian otomatis kami sendiri, bukan oleh lalu lintas pihak ketiga yang independen. Kami menyatakan hal ini secara terbuka, tanpa mengesankan adanya panel eksternal.

Penilaian yang jujur

Ketika kualitas suatu pasangan menurun pada suatu bulan — hal itu tetap terlihat. Ketika sebuah bug diperbaiki dan bulan berikutnya melonjak — peningkatannya terlihat di halaman yang sama. Kami tidak pernah menulis ulang agregat historis. Admin hanya dapat menyembunyikan bulan tertentu dari indeks publik; mereka tidak dapat mengubah angka yang sudah dipublikasikan.

Masalah yang diketahui memengaruhi data historis

  • Chat test harness, sebelum 2026-04-23: pipeline pengujian chat otomatis mengalami kegagalan pada beberapa bahasa. Agregat chat dari bulan-bulan sebelumnya mungkin menunjukkan skor yang lebih rendah daripada kualitas terjemahan sebenarnya pada periode tersebut. Bulan-bulan yang terdampak tetap disimpan di database tetapi disembunyikan dari indeks publik; grafik tren akan menunjukkan perubahan mendadak pada titik perbaikan.

Pertanyaan

Tidak setuju dengan sesuatu di sini? Buka issue atau tulis kepada kami. Kami akan memperbarui halaman ini dan mencatat perubahannya.