المنهجية

لماذا تسويق جودة الترجمة معطوب — وما الذي ننشره بدلاً من ذلك

كل بائع ترجمة ينشر عدد اللغات. لا أحد ينشر جودة قابلة للتحقق لكل زوج لغات على حركة مرور حقيقية. لماذا تهم هذه الفجوة في تقييم المشتريات القادم الخاص بك — وما الذي ننشره بدلاً من ذلك.

The Mind.com Team

لماذا تسويق جودة الترجمة معطوب — وما الذي ننشره بدلاً من ذلك

لماذا تسويق جودة الترجمة معطوب — وما الذي ننشره بدلاً من ذلك

افتح موقع أي بائع ترجمة مباشرة. سترى نفس أنواع الأرقام:

  • "+200 لغة"
  • "+6,000 زوج لغوي"
  • "الأول عالمياً" / "الأعلى دقة"
  • "99% دقة"

الآن حاول أن تجد — في أي من صفحات تلك البائعين — ما تعنيه تلك الأرقام لاجتماع أنت على وشك عقده. جودة لكل لغة. منهجية قابلة للتكرار. حجم العينة. النتيجة على مدار الوقت. إفصاح صادق عن نقاط ضعف النموذج.

لن تجده. ليس في النصوص التسويقية، ونادراً في الوثائق.

هذا هو توازن هذه الفئة. وهو موجود بسبب ثلاثة أشياء:

  1. معظم البائعين لا يمتلكون محرك الترجمة الخاص بهم. يقومون بالتوجيه عبر OpenAI أو Google أو DeepL أو Microsoft أو مزيج منها. نشر بيانات جودة كل زوج لغوي سيكون بمثابة قياس أداء لنموذج يعود لطرف آخر — لا توجد قيمة تسويقية في ذلك.
  2. بيانات الجودة الصادقة يصعب وضعها على لوحة إعلانية. النتيجة الفردية مليئة بالضجيج. التوزيع أكثر فائدة ولكنه يصعب اختصاره. واتجاه last-six-months trend لا يزال أكثر فائدة، وأصعب في الاختصار.
  3. لم تدفع المشتريات في الاتجاه المعاكس بعد. يتقبل المشترون الأرقام التسويقية كقيمتها الظاهرية، وبالتالي يظل التوازن قائماً.

لن يظل هذا التوازن قائماً. الفئة القادمة من المشترين — الصيدلية، القانونية، المالية، التدقيق، القطاع العام — سوف تطرح أسئلة أصعب من "كم عدد اللغات". لقد قمنا ببناء /benchmark لأننا نعتقد أنه لا ينبغي عليهم الاكتفاء بكلمة البائع.


ما الذي لا تخبرك به الأرقام التسويقية

"+200 لغة" تعني أن البائع يمتلك نموذجاً يصدر نصاً بـ 200 لغة. تتراوح الجودة عبر هذه اللغات من مستوى جاهز للإنتاج للأزواج الرئيسية (EN↔DE, EN↔ES, EN↔FR) إلى بالكاد قابلة للاستخدام للأزواج ذات الموارد المنخفضة. بدون تفصيل لكل زوج، لا يمكنك معرفة في أي جانب من هذا الخط سيهبط اجتماعك.

"+6,000 زوج لغوي" هي توافيق N × N على 80 لغة مصدر. القول بأنك تدعم 6,000 زوج هو الجزء السهل. القول بأن أي زوج محدد جيد بما يكفي لمراجعة CAPA، أو تفاوض تعاقدي، أو مكالمة أرباح — هذا هو الجزء غير الموجود في الكتيب.

"99% دقة"، دون تحديد ما تم قياسه، وبأي مرجع، وعلى أي عينة، وبواسطة أي مُقيّم — هي عبارة خالية من المحتوى. جودة الترجمة لا تملك قياساً أحادياً عالمياً. بل لها توزيع يعتمد على الزوج اللغوي، ومجال المحتوى، وجودة الصوت (للصوت المنطوق)، وميزانية زمن الاستجابة، وما يعنيه "جيد بما يكفي" لحالة الاستخدام المحددة.


ما يحتاج المشتري معرفته فعلياً

الأسئلة التي تظهر في مراجعات DPA الحقيقية وتقييمات المشتريات:

  1. الجودة لكل زوج — كيف هو الأداء على DE↔EN, EN↔AR, JA↔KO، على وجه التحديد؟
  2. حجم العينة — على كم تشغيلاً تستند النتيجة التي أبلغت عنها؟ عشرة؟ عشرة آلاف؟
  3. المنهجية — من يقيّم الترجمات، وبأي مرجع، وبأي معيار؟
  4. التوزيع، وليس المتوسط — كيف يبدو أسوأ سيناريو 10٪؟ أفضل 10٪؟ الوسيط؟
  5. الانحراف عبر الوقت — هل تحسن زوج معين أم ساء منذ آخر مرة نشرت فيها رقماً؟
  6. ما لا تقيسه — ما الذي لا يلتقطه معيار الأداء الخاص بك صراحةً؟

ليست أي من هذه أسئلة بلا إجابة. إنها ببساطة غير موجودة على صفحة التسويق الخاصة بأي بائع.


ما الذي ننشره

/benchmark هو إجابتنا. المنهجية موجودة في /benchmark/methodology — كُتبت قبل أن نعرف أنك ستقرأ هذا.

ثلاثة أشياء تميزه عن المعايير المعتادة للفئة.

1. حركة مرور حقيقية، وليست مجموعة منسقة

كل نتيجة في معيار الأداء العام تأتي من تشغيل اختبار حقيقي على /demo. نحن لا نختار مسبقاً الأزواج التي تقدم أداءً جيداً. نفس خط المعالجة الذي يخدم العرض التجريبي للمشتري هو الذي يتم قياسه.

2. المُقيّم معروف بالاسم

الأساسي: google/gemini-2.5-flash. الاحتياطي: anthropic/claude-sonnet-4-20250514. كلاهما عبر Vercel AI Gateway. المُقيّم هو جزء من المنهجية — يتم الإفصاح عنه بالاسم. إذا قمنا بتغيير المُقيّم في المستقبل، ستحمل الصفوف التاريخية معرف المُقيّم الأصلي؛ ولن تتم إعادة تقييم النتائج القديمة بصمت.

3. التوزيع هو البيانات، وليس المتوسط

كل صف منشور يُظهر الوسيط، وp10، وp90، وmin، وmax، وحجم العينة — وليس رقماً واحداً. الرقم الواحد لزوج ترجمة ما هو مجرد ضجيج. شكل التوزيع هو الإشارة الحقيقية.


ممارسات لم تتبنها الفئة بعد

  • الأزواج ذات النتائج المنخفضة ليست مخفية. الفهرس العام محدود بـ ≥ 10 distinct IPs, ≥ 10 runs, median ≥ 60 — ولكن يمكن لأي شخص إنشاء رابط مباشر لأي زوج ومشاهدة الأرقام الحقيقية، بما في ذلك الأزواج التي يسوء أداؤها هذا الشهر.
  • المشكلات المعروفة موثقة. عندما كان إطار اختبار الدردشة معطلاً لبضعة أسابيع في أوائل عام 2026، تم استبعاد تلك الفترة من الفهرس وأُشير إليها كتابياً في صفحة المنهجية. لا يتم إعادة كتابة التاريخ بصمت.
  • ما لا ندّعيه عمداً هو قسم كامل في صفحة المنهجية. نوضح أين يكون المُقيّم LLM نفسه غير مثالي. نوضح ما لا نقيسه (زمن الاستجابة، التكلفة، رضا المستخدم، أخطاء ASR قبل تشغيل الترجمة حتى). ونكشف عن أن اختبارات الدخان الآلية الخاصة بنا هي جزء من حركة المرور.

عامل تصفية لتقييم البائع القادم

إذا كنت تقوم بتقييم أي منصة اجتماعات متعددة اللغات — لدينا أو لأي جهة أخرى — فإن المنهجية هي الصفحة التي تستحق القراءة. الأرقام نفسها هي الجزء السهل.

عامل تصفية عملي لأي بائع في هذه الفئة:

  • اطلب بيانات جودة لكل زوج لغوي، شهرياً، على حركة مرور حقيقية. وليس معيار أداء منسق. وليس بيانات مجمعة.
  • اسأل عن هوية المُقيّم الخاص بهم، وما الذي لا يقيسونه صراحةً، وما الذي تغير في آخر ستة أشهر.
  • اسأل عما يحدث عندما تنخفض نتيجة زوج معين — هل يخبرون أحداً، أم يقومون بإصلاحه بصمت؟

إذا كان لدى البائع إجابات كتابية على الأسئلة الثلاثة، فقم بتقييمهم بجدية. إذا لم يكن الأمر كذلك، فأنت تشتري تسويقاً — وليس جودة ترجمة.


جربه بنفسك

  • /demo — يقوم بتشغيل خط معالجة الترجمة الإنتاجي على صوتك، ويقيّمه مقابل نفس المُقيّم الذي يقيّم معيار الأداء العام، ويُظهر لك النتيجة.
  • /benchmark — كل زوج لغوي منشور، كل شهر، مع التوزيع الكامل.
  • /benchmark/methodology — كيف يتم حساب الأرقام، وما الذي تتضمنه، وما لا تتضمنه.

لن تحتاج إلى أن تأخذ كلمتنا على محمل الجد في أي من ذلك. هذا هو الهدف.

احصل على المنشورات الجديدة عبر البريد الإلكتروني

سنرسل لك بريدًا إلكترونيًا عند نشر منشور جديد. يمكنك إلغاء الاشتراك في أي وقت.