Ghi chú giọng nói trong kênh nhóm: cách hoạt động và cách Copilot, Slack và Teams xử lý một tin nhắn đã ghi
Có những thứ nói ra nhanh hơn là gõ. Một ý nghĩ ngay sau cuộc gọi, một quyết định đưa ra giữa hành lang, một cập nhật trạng thái cho đội ngũ khi bạn đi tới bãi đỗ xe. Mọi công cụ làm việc chính hiện nay đều cho phép bạn ghi lại khoảnh khắc đó: Microsoft đã thêm Record vào ứng dụng di động Copilot, Slack có audio clips, Teams có video and audio clips trong chat. Cách chúng xử lý bản ghi sau đó là nơi chúng khác biệt — và đó là phần quyết định một ghi chú giọng nói trở thành thứ mà đội ngũ có thể hành động theo, hay một tệp mà ai đó phải nghe.
InterMIND cung cấp ghi chú giọng nói như một tính năng của kênh: bạn ghi vào kênh, và ghi chú đến dưới dạng âm thanh phát lại được cộng thêm bản chép lời tự động cộng các ghi chú có cấu trúc — điểm chính, các quyết định, các mục hành động với người chịu trách nhiệm và ngày tháng khi bạn nêu tên. Thành viên đọc các ghi chú bằng ngôn ngữ của họ, như mọi thứ khác trong kênh. Bài viết này trình bày toàn bộ cơ chế, các giới hạn, và so sánh song song với ba nền tảng hiện hữu, chỉ dựa trên những gì tài liệu công khai của họ nêu.
Cách hoạt động
1. Ghi
Trong ứng dụng web và các ứng dụng di động của InterMIND, khung soạn thảo của mọi kênh và chat hiển thị nút microphone thay cho nút send khi trường tin nhắn đang trống. Nhấn vào nút đó, cấp quyền micro ở lần đầu tiên, rồi nói. Trong khi bạn ghi, nút là send và trường vẫn mở — bất cứ thứ gì được gõ cùng lúc sẽ đi ra cùng ghi chú, ghi chú trước rồi đến văn bản. Không có bước dừng riêng: send kết thúc bản ghi và gửi nó đi, giống cách audio clip hoạt động trong Slack và Teams. Một ghi chú có thể kéo dài đến mười phút; khi đến giới hạn, bản ghi tự dừng và chờ send tiếp theo.
2. Bản chép lời và ghi chú, tự động
Ghi chú đến trong kênh dưới dạng tin nhắn âm thanh. Thẻ của nó hiển thị Transcribing…, rồi Preparing summary…, rồi AI summary — cùng dải trạng thái mà các tài liệu chia sẻ có trong InterMIND. Mở nó ra sẽ thấy hai thẻ:
- Summary — một hoặc hai câu nêu điểm chính của ghi chú, sau đó là quyết định, các mục hành động với người chịu trách nhiệm và ngày khi người nói nêu tên, các câu hỏi mở và sự kiện chính. Mỗi gạch đầu dòng liên kết ngược về đoạn văn bản chép lời mà nó lấy từ.
- Transcript — mọi thứ đã được nói, theo từng đoạn văn.
Không có gì cần bật cho từng ghi chú và không ai phải nhấn "generate": việc ghi lại là toàn bộ thao tác.
3. Ai cũng đọc bằng ngôn ngữ của mình
Tóm tắt được phân phát đến từng thành viên bằng ngôn ngữ mà họ đọc kênh, cùng cách mà tóm tắt tài liệu và tóm tắt cuộc họp được. Bản chép lời giữ nguyên ngôn ngữ đã nói — đó là nguồn chân lý về những gì đã được nói. Một đồng đội đọc tiếng Tây Ban Nha nhận các mục hành động bằng tiếng Tây Ban Nha; âm thanh ở đó cho bất cứ ai muốn nghe giọng điệu.
Ghi chú giọng nói hoạt động trong bất kỳ kênh nào, kể cả kênh bạn giữ cho riêng mình — một cách nhanh để đọc các ghi chú để sau và nhận lại dưới dạng văn bản.
Âm thanh đi về đâu
Nhận dạng giọng nói cho ghi chú giọng nói chạy tại Mistral, nhà cung cấp AI lưu trữ tại EU vốn đã viết tóm tắt cuộc họp cho InterMIND. Tệp âm thanh được lưu cùng các tệp khác của kênh và bị xóa khi tin nhắn bị xóa. Bản chép lời và các ghi chú nằm trong cơ sở dữ liệu của kênh, chỉ thành viên của kênh mới đọc được. Mỗi chặng của đường dữ liệu được liệt kê trên trang tin cậy.
Ghi chú giọng nói được bao gồm trên mọi gói, và tài liệu tham chiếu cài đặt nằm trong tài liệu.