Bên trong bốn luồng dịch thuật vận hành InterMIND
Trang /product/overview/how-it-works cũ trên mind.com đã lỗi thời sau nhiều bản phát hành lớn. Trang đó mô tả một "động cơ dịch thuật" đơn nhất giống như hầu hết các trang của nhà cung cấp khác — một mũi tên lớn từ "bạn nói" đến "họ nghe." Hình ảnh đó đã là sự đơn giản hóa từ hai năm trước. Ngày nay, nó sai.
Sự thật là InterMIND vận hành bốn luồng dịch thuật riêng biệt, mỗi luồng giải quyết một vấn đề khác nhau với một động cơ khác nhau, một ngân sách độ trễ khác nhau, và một dải chất lượng khác nhau. Chúng chia sẻ một bộ chọn ngôn ngữ. Chúng không chia sẻ động cơ.
Đây là câu trả lời cập nhật cho câu hỏi "nó hoạt động như thế nào."
Bài viết đồng hành: "Bạn hỗ trợ bao nhiêu ngôn ngữ?" đề cập đến những gì mỗi luồng phủ sóng (23 / 23 / 30 / 17). Bài viết này đề cập đến những gì mỗi luồng làm — và tại sao mỗi luồng là một thực thể riêng biệt.
Tại sao "một động cơ cho mọi thứ" là một lời nói dối
Một nền tảng họp trực tiếp có ít nhất bốn nhiệm vụ phải thực hiện cùng lúc, và chúng kéo theo những hướng không tương thích:
- Giọng nói thời gian thực — âm thanh đầu vào, âm thanh đã dịch đầu ra, dưới một giây, mỗi người xem bằng ngôn ngữ của họ. Ràng buộc khó khăn là độ trễ.
- Văn bản trò chuyện thời gian thực — tin nhắn ngắn, nhanh, với các chỉnh sửa và trích dẫn và cấu trúc HTML được bảo toàn.
- Ghi chú chia sẻ thời gian thực — gõ cộng tác từng ký tự một, với cấu trúc phân cấp (danh sách, tiêu đề, hộp kiểm) phải tồn tại qua quá trình dịch.
- Tệp tài liệu không đồng bộ — một PDF 40 trang được thả vào trò chuyện. Không có ngân sách độ trễ. Ràng buộc khó khăn là độ trung thực — định dạng, bảng, số trang, phông chữ.
Bạn có thể xây dựng một lệnh gọi LLM khổng lồ cố gắng thực hiện cả bốn. Chúng tôi đã thử. Nó làm tệ tất cả bốn việc. Ngân sách độ trễ cho giọng nói có nghĩa là mô hình không thể suy nghĩ; ngân sách độ trung thực cho tài liệu có nghĩa là mô hình phải suy nghĩ. Một chỉnh sửa trò chuyện cần một diff trong ngôn ngữ của người xem; một PDF 40 trang cần bảo toàn định dạng mà không mô hình token-streaming nào cung cấp cho bạn.
Vì vậy, chúng tôi chạy bốn luồng. Dưới đây là từng luồng.