Çeviri kalitesi pazarlaması neden bozuk — ve bunun yerine ne yayınlıyoruz
Herhangi bir canlı çeviri satıcısının sitesini açın. Şu tür sayıları göreceksiniz:
- "200+ dil"
- "6.000+ dil çifti"
- "Dünyada ilk" / "En yüksek doğruluk"
- "%99 doğruluk"
Şimdi bu satıcı sayfalarından herhangi birinde, gerçekleştirmek üzere olduğunuz bir toplantı için bu sayıların ne anlama geldiğini bulmaya çalışın. Dil bazında kalite. Yinelenebilir metodoloji. Örneklem boyutu. Zamana göre skor. Modelin zayıf olduğu yerlerin dürüst ifşası.
Bunu bulamayacaksınız. Ne pazarlama metninde, ne de dokümantasyonda (nadiren de olsa).
Bu, kategorinin denge durumudur. Üç nedenden ötürü var olur:
- Çoğu satıcı kendi çeviri motoruna sahip değildir. OpenAI, Google, DeepL, Microsoft veya bunların bir kombinasyonu üzerinden yönlendirme yaparlar. Dil çifti başına kalite verisi yayınlamak, başka birinin modelini kıyaslamak anlamına gelir — bunun pazarlama değeri yoktur.
- Dürüst kalite verisini bir reklam panosuna sığdırmak zordur. Tek bir skor gürültülüdür. Bir dağılım daha kullanışlıdır ancak sıkıştırması daha zordur.
Son altı ayın trendidaha da kullanışlıdır ve sıkıştırması daha da zordur. - Satın alma departmanları henüz itiraz etmiyor. Alıcılar pazarlama sayılarını oldukları gibi kabul ediyor ve bu nedenle denge bozulmuyor.
Bu denge uzun sürmeyecek. Bir sonraki alıcı sınıfı — ilaç, hukuk, finans, denetim, kamu sektörü — "kaç dil" sorusundan daha zor sorular soracak. /benchmark sayfasını, bir satıcının sözüne güvenmek zorunda kalmamaları gerektiğini düşündüğümüz için oluşturduk.
Pazarlama sayılarının size söylemediği şeyler
"200+ dil", bir satıcının 200 dilde metin üreten bir modele sahip olduğu anlamına gelir. Bu dillerdeki kalite, büyük dil çiftleri (EN↔DE, EN↔ES, EN↔FR) için üretim düzeyinden, düşük kaynaklı çiftler için zar zor kullanılabilir düzeye kadar uzanır. Dil çifti bazında bir döküm olmadan, toplantınızın bu çizginin hangi tarafına düşeceğini söyleyemezsiniz.
"6.000+ dil çifti", 80 kaynak dilinde N × N kombinatoriğidir. 6.000 çifti desteklediğinizi söylemek kolay kısımdır. Belirli bir çiftin bir CAPA incelemesi, sözleşme müzakeresi veya kazanç çağrısı için yeterince iyi olduğunu söylemek ise broşürde olmayan kısımdır.
"%99 doğruluk", neyin ölçüldüğünü, neye göre referans alındığını, hangi örneklemden, hangi jüri tarafından değerlendirildiğini belirtmeden — içeriği boş bir ifadedir. Çeviri kalitesinin evrensel bir skaler değeri yoktur. Dil çiftine, içerik alanına, ses kalitesine (sesli çeviri için), gecikme bütçesine ve belirli kullanım durumu için "yeterince iyi"nin ne anlama geldiğine bağlı bir dağılımı vardır.
Bir alıcının aslında bilmesi gerekenler
Gerçek DPA incelemelerinde ve satın alma değerlendirmelerinde karşınıza çıkan sorular:
- Dil çifti bazında kalite — özellikle DE↔EN, EN↔AR, JA↔KO dillerinde nasıl performans gösteriyor?
- Örneklem boyutu — bildirdiğiniz sayı kaç çalışmaya dayanıyor? On mu? On bin mi?
- Metodoloji — çevirileri kim değerlendiriyor, hangi referansa göre, hangi ölçütlerle?
- Ortalama değil dağılım — en kötü durumdaki %10 nasıl görünüyor? En iyi %10? Medyan?
- Zamana göre kayma — bir sayı yayınladığınızdan bu yana belirli bir çift daha mı iyi yoksa daha mı kötü hale geldi?
- Ölçmediğiniz şeyler — kıyasınızın açıkça hangi şeyleri kapsamadığı?
Bunların hiçbiri cevaplanamaz değil. Sadece kimsenin pazarlama sayfasında yer almıyorlar.
Ne yayınlıyoruz
/benchmark bizim cevabımız. Metodoloji /benchmark/methodology adresindedir — bunu okuyacağınızı bilmeden önce yazıldı.
Onu kategori normlarından ayıran üç şey var.
1. Özenle seçilmiş bir test seti değil, gerçek trafik
Herkese açık kıyastaki her skor, gerçek bir /demo test çalışmasından gelir. İyi performans gösteren çiftleri önceden seçmeyiz. Bir alıcının demosuna hizmet eden aynı işlem hattı, ölçülen işlem hattıdır.
2. Jürinin adı belirtilir
Birincil: google/gemini-3.5-flash. Yedek: anthropic/claude-sonnet-5. İkisi de Vercel AI Gateway üzerinden. Jüri, metodolojinin bir parçasıdır — adıyla açıklanır. Jüriyi değiştirdiğimizde (modeller emekliye ayrıldıkça değiştirdik), geçmiş satırlar onları gerçekten puanlayan jüriyi taşır; eski puanlar asla sessizce yeniden puanlanmaz.
3. Veri ortalama değil dağılımdır
Yayınlanan her satır; medyanı, p10'u, p90'ı, minimumu, maksimumu ve örneklem boyutunu gösterir — tek bir sayıyı değil. Bir çeviri çifti için tek bir sayı gürültüdür. Dağılımın şekli sinyaldir.
Kategorinin benimsemediği uygulamalar
- Düşük puanlı çiftler gizli değildir. Herkese açık dizin
≥ 10 farklı IP, ≥ 10 çalışma, medyan ≥ 60şartına bağlıdır — ancak herkes herhangi bir çifti doğrudan derin bağlantıyla açabilir ve bu ay kötü performans gösteren çiftler de dahil olmak üzere gerçek sayıları görebilir. - Bilinen sorunlar belgelenmiştir. 2026 yılının başlarında chat-test altyapısı birkaç hafta boyunca bozuk olduğunda, bu dönem dizinden bastırılır ve metodoloji sayfasında yazılı olarak belirtilir. Geçmiş sessizce yeniden yazılmaz.
- Kasten iddia etmediğimiz şeyler, metodoloji sayfasında tam bir bölüm olarak yer alır. LLM jürisinin kendisinin nerede kusurlu olduğunu söyleriz. Neyi ölçmediğimizi (gecikme, maliyet, kullanıcı memnuniyeti, çeviri başlamadan önceki ASR tarafı hataları) söyleriz. Kendi otomatik duman testlerimizin trafikten bir parça olduğunu ifşa ederiz.
Bir sonraki satıcı değerlendirmesi için bir filtre
İster bizim ister başka bir çok dilli toplantı platformunu değerlendiriyor olun, metodoloji okumaya değer sayfadır. Sayıların kendisi kolay kısımdır.
Bu kategorideki herhangi bir satıcı için pratik bir filtre:
- Gerçek trafikte dil çifti ve ay bazında kalite verisi isteyin. Özenle seçilmiş bir kıyas değil. Bir toplam değil.
- Jürilerinin ne olduğunu, açıkça neyi ölçmediklerini ve son altı ayda neyin değiştiğini sorun.
- Bir çiftin puanı düştüğünde ne olduğunu sorun — bunu kimseye söylüyorlar mı, yoksa sessizce mi düzeltiyorlar?
Eğer satıcının bu üç cevabın tamamı yazılı olarak mevcutsa, onları ciddiye alın. Yoksa, satın aldığınız şey çeviri kalitesi değil — pazarlamadır.
Kendiniz deneyin
- Canlı demoyu deneyin — sesiniz üzerinden üretim çeviri işlem hattını çalıştırır, herkese açık kıyası puanlayan aynı jüriye göre puanlar ve size çıktıyı gösterir.
- Kıyası inceleyin — yayınlanan her dil çifti, her ay, tam dağılımla.
- Metodolojiyi okuyun — sayıların nasıl hesaplandığı, neleri kapsadığı, neleri kapsamadığı.
Bunların hiçbiri için sözümüze güvenmeniz gerekmeyecek. Asıl mesele de bu.
Kaynaklar: Yukarıdaki jüri tanımlayıcıları, eleme eşikleri ve dışlama kuralları gönderilen koda karşı doğrulanmış olup /benchmark/methodology adresinde yayımlanmıştır; jüriler Vercel AI Gateway üzerinden sunulmaktadır; en üstte alıntılanan pazarlama iddiaları kategoriye özgü tipik ifadeler olup adı geçen bir satıcıdan alıntı değildir; Ağustos 2026'da kontrol edilmiştir.