Metodoloji

InterMIND çeviri kalitesi kıyaslaması, kendi test paketimiz tarafından otomatik olarak üretilir: haftalık bir sentetik çalıştırma, herkese açık /demo sayfasına güç veren çeviri hattının aynısını sabit bir referans kümesi üzerinde, her dil çifti için aynı şekilde çalıştırır. Kıyaslama sentetik ve yeniden üretilebilirdir — burada hiçbir şey seçilip süzülmemiştir ve puanlama sürecinde insan yoktur.

Tek bir test nasıl çalışır

Bir test çalıştırması, kaynak dildeki bir referans ses dosyasını (ses testi) oynatır veya bir referans metni (sohbet testi) gönderir ve bunu canlı çeviri hattımızdan geçirerek hedef dile çevirir. Ortaya çıkan çeviri, kanonik bir referans çeviriye göre bir LLM hakemi tarafından 0–100 arasında puanlanır.

LLM hakemi: birincil olarak google/gemini-3.8-flash, yedek olarak anthropic/claude-sonnet-5 (Vercel AI Gateway üzerinden). Tüm çiftlerde aynı istem, aynı değerlendirme ölçütü ve aynı referans metinler kullanılır.

Bir ay nasıl toplulaştırılır

  1. Tamamlanan her tam kıyaslama çalıştırması, hedef dil başına puanlarla birlikte demo_test_runs içinde kaydedilir. Tekil çift önizlemeleri hariç tutulur — medyanlara yalnızca tam çok dilli çalıştırmalar dahil edilir.
  2. Her (kaynak dil, hedef dil, test türü, hafta) için en son çalıştırmayı tutarız, ardından aya göre toplulaştırırız — böylece tek bir kaynak, bir hafta içinde aynı çifti tekrarlayarak medyanları saptıramaz.
  3. Tekilleştirilmiş kümeden medyan, minimum, maksimum, p10, p90, ortalama ve örneklem büyüklüğünü hesaplarız.
  4. Bir ay kapandığında, ham çalıştırmalar TTL ile silinse bile sayıların sabit kalması için tekil puanların anlık görüntüsünü alırız.

Bir çift herkese açık dizinde ne zaman yer alır

Bir (çift × test türü × ay) satırı, asgari bir örneklem büyüklüğünü ve bir medyan puan eşiğini (ses için daha düşük bir eşik; çünkü ses kaçınılmaz ASR gürültüsü taşır) aştığında herkese açık dizin ve site haritası için uygun hale gelir. Veri kümesi birçok bağımsız ziyaretçiden değil, tek bir otomatik kaynaktan geldiği için, bu sentetik veride benzersiz kaynak şartı gevşetilmiştir — örneklem büyüklüğü ve kalite eşikleri ise geçerliliğini korur.

Eşiğin altında kalan çiftlere doğrudan bağlantıyla erişilebilir — eşikler yalnızca arama motorlarının gördüklerini sınırlar. Düşük puanları doğrudan isteyen hiç kimseden saklamayız.

Özellikle İDDİA ETMEDİKLERİMİZ

  • Tek bir puan güvenilir değildir. İyi çalışan bir çift bile, ASR ve LLM değerlendirmesi gürültülü olduğundan, çalıştırmalar arasında 30 puan oynayabilir. Bu nedenle her sayfa tek bir sayı değil, bir dağılım gösterir.
  • LLM hakemi de kusursuz değildir. İleride hakemi değiştirebilir veya çift hakem kullanabiliriz; bu olduğunda geçmiş satırlar hakem tanımlayıcısını taşıyacaktır.
  • Kıyaslama gecikmeyi, maliyeti, erişilebilirliği veya kullanıcı memnuniyetini ölçmez. Bunlar başka yerlerde yer alır.
  • Veri kümesi sentetiktir — bağımsız üçüncü taraf trafiğiyle değil, kendi otomatik paketimizle üretilmiştir. Harici bir panel olduğunu ima etmek yerine bunu açıkça belirtiyoruz.

Dürüst yaklaşım

Belirli bir çiftte bir ayın kalitesi düştüğünde — bu görünür kalır. Bir hata düzeltilip sonraki ay yükseldiğinde — iyileşme aynı sayfada görünür. Geçmiş toplulaştırmaları asla yeniden yazmayız. Yöneticiler yalnızca tekil ayları herkese açık dizinden gizleyebilir; daha önce yayımlanmış sayıları değiştiremezler.

Geçmiş verileri etkileyen bilinen sorunlar

  • Sohbet testi altyapısı, 2026-04-23 öncesi: otomatik sohbet testi hattında dil bazlı hatalar vardı. Önceki aylara ait sohbet toplulaştırmaları, o dönemlerin gerçek çeviri kalitesinden daha düşük puanlar gösterebilir. Etkilenen aylar veritabanında tutulur ancak herkese açık dizinden gizlenir; eğilim grafiği düzeltme noktasında bir basamak değişimi gösterecektir.

Sorular

Burada bir şeye katılmıyor musunuz? Bir issue açın veya bize yazın. Bu sayfayı güncelleyip değişikliği not ederiz.