VoiVision AI
tech· VoiVision AI Engineering

Chạy các cuộc họp đa ngôn ngữ ngoại tuyến: Bản dịch và đồng bộ phụ đề

Trong một cuộc họp bốn bên bao gồm tiếng Trung, tiếng Anh, tiếng Nhật và tiếng Hàn, phần khó không phải là nhận ra - đó là biết ai đã nói gì, nó nên trở thành gì trong một ngôn ngữ khác, liệu nó có phải là thời gian thực hay không, và liệu âm thanh có thể rời khỏi tòa nhà hay không. Bài viết này chia sẻ các đường dẫn hội nghị đa ngôn ngữ đầy đủ: phát hiện ngôn ngữ, sắp xếp thời gian giữa phát trực tuyến ASR và dịch, đồng bộ phụ đề, tính nhất quán thuật ngữ và lý do tại sao phiên dịch đám mây hiếm khi xóa sự tuân thủ trong các cài đặt chính phủ và doanh nghiệp.


Bản dịch hội nghị đa ngôn ngữ tại chỗ và đồng bộ phụ đề

Một cuộc họp bốn bên bao gồm tiếng Trung, tiếng Anh, tiếng Nhật và tiếng Hàn, mỗi người tham gia nói ngôn ngữ riêng của họ, và cuối cùng một bộ biên bản cuộc họp mọi người có thể đọc với nhãn loa, cộng với một bản ghi dữ liệu cuộc họp.

Nghe có vẻ như chỉ là một bước vượt xa "audio to text". "Trong thực tế, đó là một vấn đề hoàn toàn khác.

Ghi chú dữ liệu: Các con số được đánh dấu "published spec" đến từ sản phẩm công cộng Thông số kỹ thuật; các mô tả về độ trễ và đồng thời là magnitudes tham chiếu trong môi trường điển hình, và các giá trị thực tế thay đổi theo kích thước mô hình, điều kiện âm thanh và chiến lược đồng thời - đo lường trên khối lượng công việc của riêng bạn.

1. Phần khó của các cuộc họp đa ngôn ngữ không phải là dịch thuật

Bản năng đầu tiên của hầu hết mọi người là các cuộc họp đa ngôn ngữ là hai bước - nhận ra, sau đó dịch - và khó khăn là chất lượng dịch. Khi bạn chạy một dự án, bạn sẽ tìm thấy các blockers không bao giờ có chất lượng dịch, nhưng bốn điều này:

Khó khăn thật sựTriệu chứngTại sao nó khó khăn
Quyết định ngôn ngữngười khác nhau; bạn không biết ai nói cái gìMột phát hiện sai làm mất hiệu lực toàn bộ đoạn
Căn chỉnh thời gianChuyển dịch chậm, phụ đề không bao giờ xếp hàngNhận dạng và dịch là hai đường ống, mỗi bộ đệm
Loa ràng buộcPhụ đề được gán cho nhầm ngườiphân tách người nói phải liên kết với dòng phụ đề
Ranh giới dữ liệuCho dù âm thanh có thể rời khỏi intranet hay khôngMột loại tự động quyết định Kiến trúc

Một người ưu tiên trở lại phía sau: như với lựa chọn ASR tại chỗ, ngưỡng thực sự đầu tiên là Liệu dữ liệu có thể rời khỏi mạng, không phải chất lượng dịch.

Dịch tệ hơn một chút là chấp nhận được; âm thanh rời khỏi mạng giết chết dự án.

2. Cấu trúc độ trễ của giải thích đám mây là chết người cho phụ đề trực tiếp

Đây là điểm bị bỏ qua nhiều nhất trong lựa chọn.

Một đường dẫn giải thích đám mây trông như thế này:

[local] capture audio -> upload -> [cloud] queue -> recognize -> translate -> synthesize -> return -> [local] display
                          ^                                                                                ^
                    public jitter                                                                     public jitter

Một bản ghi âm cuộc họp một giờ (16 kHz mono, Về chúng tôi 115 MB) mất khoảng 10 giây để tải lên mạng nội bộ 100 Mbps. Đối với bản dịch sau cuộc họp là không liên quan; đối với phụ đề trực tiếp, đó là một vấn đề nghiêm trọng.

Quan trọng hơn, độ trễ đám mây là không thể kiểm soát được, bởi vì nó phụ thuộc vào chiều dài hàng đợi, jitter công cộng và băng thông trở lại - bất kỳ hiccup nào và phụ đề chia tay.

On-premises là hoàn toàn khác nhau:

[local] capture audio -> streaming ASR -> LLM translation -> subtitle display

Âm thanh không bao giờ chạm vào card mạng; độ trễ chỉ đến từ suy luận cục bộ, với không tải lên, không có hàng đợi, không trở lại, không có jitter công cộng.

Quy tắc ngón tay cái: Nếu bạn cần phụ đề trực tiếp hoặc biên bản cuộc họp trực tiếp, cấu trúc độ trễ đám mây vốn không thuận lợi - thích tại chỗ.

3. Một đường ống trên cơ sở hoàn chỉnh trông như thế nào

Một đường dẫn dịch hội nghị đa ngôn ngữ sản xuất trông như thế này (tất cả địa phương):

Microphone array / meeting audio system
 | 
        v
   [ Language auto-detection ]  <- first sentence or rolling window
 | 
        v
   [ Streaming ASR ]  <- 30 languages + 22 dialects, live punctuation, smart segmentation
 | 
        +-------------+
        v             v
[ Speaker separation ]  [ LLM translation ]  <- glossary constraints
(voiceprint / channel) | 
 | v
        +------> [ Subtitle sync and display ]
                 speaker / time / source / translation

Mỗi giai đoạn đều có những cạm bẫy. Từng cái một.

3.1 Phát hiện ngôn ngữ: một cuộc gọi sai invalidates đoạn văn

Khi những người tham dự được cố định (như "Cuộc họp này là tiếng Trung-Anh "), khóa ngôn ngữ và có được độ chính xác cao nhất.

Khi những người tham dự khác nhau, ASR phải quyết định. Một khuyến nghị thực tế:

Cho phép tự động phát hiện nhưng cho phép khóa thủ công.

Tự động phát hiện hoạt động từ câu đầu tiên hoặc một cửa sổ cuộn, và đánh giá sai trọng điểm nặng, chuyển đổi mã hoặc viết tắt tiếng Anh. Nếu nó là sai, bạn cần một cú nhấp chuột chuyển đổi đó Retroactively sửa chữa các phân đoạn đã được công nhận - nếu không toàn bộ phiên dịch của cuộc họp là lãng phí.

3.2 Streaming ASR: công nhận và dịch không được đệm riêng biệt

Đây là nguyên nhân số một của sự trôi dạt phụ đề.

Nếu nhận dạng và dịch chạy như hai đường ống độc lập, mỗi với bộ đệm riêng của nó, dịch lags nhận dạng bởi một hoặc nhiều chu kỳ bộ đệm và phụ đề là vĩnh viễn phía sau.

Cách tiếp cận đúng là có công nhận, dịch thuật và phân tách người nói chia sẻ một dòng thời gian: thời gian bắt đầu và kết thúc của mỗi phân đoạn được công nhận trở thành neo thời gian của một đơn vị dịch thuật, và bản dịch được điền trở lại vào khe thời gian tương ứng.

3.3 phân tách người nói: phụ đề không được gán sai

Trong các cuộc họp đa đảng, "Ai nói " quan trọng hơn" Những gì đã được nói ". Các tuyến đường điển hình:

  • Nhận dạng vân tay giọng nói: trích xuất dấu vân tay của người nói để phân biệt người tham gia, với quản lý thư viện dấu vân tay (đăng ký / đổi tên / xóa)
  • Tách kênh: tích hợp với các hệ thống âm thanh và cuộc họp địa phương để phân biệt người nói theo kênh
  • Đường thời gian ràng buộc: gắn danh tính người nói vào dòng phụ đề, thay vì đoán sau đó

Dòng phụ đề cuối cùng nên mang cả bốn người nói, thời gian, văn bản nguồn và dịch - đó chính xác là những gì người dùng nhìn thấy khi đầu ra vào màn hình phòng họp trên HDMI.

3.4 Tính nhất quán về thuật ngữ: nhận dạng và dịch thuật phải chia sẻ một danh sách từ

Đây là vấn đề rõ ràng nhất trong các cuộc họp đa ngôn ngữ.

Tên công ty, mã sản phẩm, con người và các thuật ngữ ngành công nghiệp được trình bày không nhất quán bởi các mô hình chung: cùng một tên sản phẩm được dịch một cách trong đoạn đầu tiên và một cách khác trong đoạn thứ ba khiến khán giả mất đi.

Sửa chữa là một cơ sở thuật ngữ được chia sẻ bởi cả công nhận và dịch thuật:

NguồnMục tiêuGiới hạn (Constraint)
Định nghĩa thích hợp / tên sản phẩmHình thức cố định cho mỗi ngôn ngữCưỡng bức bản đồ
Các thuật ngữ ngànhThuật ngữ tiêu chuẩn cho mỗi ngôn ngữCưỡng bức bản đồ
Người / viết tắtGiữ nguồn hoặc transliterateTheo chính sách

Recognition sử dụng danh sách từ khóa để nâng cao độ chính xác của danh từ riêng, translation sử dụng từ điển để khóa rendering - khi cả hai bên đồng ý về cùng một thuật ngữ, nó không biến dạng trong đầu ra.

4. Tám câu hỏi để hỏi Về chúng tôi phiên dịch hội nghị đa ngôn ngữ

Hãy đưa danh sách này đến một nhà cung cấp; những người không thể trả lời được ra ngoài:

  1. Toàn bộ đường ống thực hiện bất kỳ cuộc gọi mạng công cộng có phải không? (mô hình, thuật ngữ và telemetry tất cả tính)
  2. sự công nhận bao gồm những ngôn ngữ nào? Có bao nhiêu người được dịch? Một động cơ hoặc nhiều khâu với nhau?
  3. Ngôn ngữ là Tự động phát hiện hoặc hướng dẫn sử dụng? Một phát hiện sai có thể là đã sửa chữa retroactively?
  4. Thời gian trễ sống là gì? Từ cuối câu đến bản dịch trên màn hình - giây hoặc nhiều hơn?
  5. Bản dịch có hỗ trợ cơ sở thuật ngữ / hạn chế thuật ngữ không? Nó có thể chia sẻ danh sách ASR từ khóa?
  6. phân tách người nói được xây dựng trong hoặc bên ngoài? Làm thế nào để xử lý lời nói chồng chéo?
  7. Phụ đề có hiển thị tất cả bốn yếu tố (người nói / thời gian / nguồn / bản dịch)? Họ có thể xuất qua HDMI không?
  8. Nó có hỗ trợ triển khai không khí-gaped không? Gói ngoại tuyến bao gồm những gì?

Câu hỏi 1 và 3 là điểm nhấn của nước. Thất bại 1 có nghĩa là nó chưa bao giờ được cung cấp trong một môi trường tuân thủ; thất bại 3 có nghĩa là hệ thống chưa bao giờ thực sự chạy một cuộc họp đa ngôn ngữ.

5. Khi nào không nên đi tại chỗ để dịch đa ngôn ngữ

Một vài từ ngược lại, vì vậy điều này không được đọc như một advertorial.

Tránh ở trong cơ sở khi:

  • Bạn chỉ tổ chức một hoặc hai cuộc họp đa ngôn ngữ: giải thích đám mây là trả tiền cho mỗi lần sử dụng và ít rắc rối hơn nhiều
  • Bạn chỉ cần một bản dịch sau cuộc họp: chuyển bản ghi sang dịch vụ đám mây để dịch hàng loạt với chi phí thấp hơn, không cần máy chủ
  • Không yêu cầu tuân thủ và không cần phụ đề trực tiếp: giá trị cốt lõi của hệ thống tại chỗ không chạm vào cả hai, vì vậy nó là đầu tư quá mức

Các kích hoạt đúng cho dịch đa ngôn ngữ tại chỗ là Dữ liệu có thể không rời khỏi mạng hoặc Nhu cầu phụ đề song ngữ trực tiếp - khi một trong hai giữ, nó trả giá.

6. Làm thế nào VoiVision làm điều đó

Dòng sản phẩm của VoiVision được chia thành "Thư ký cuộc họp AI" và "Phiên dịch cuộc họp AI", làm cho dịch đa ngôn ngữ trở thành một khả năng chính thống hơn là một tiện ích bổ sung:

  • Nhận dạng x dịch: tích hợp ASR phát trực tuyến bao gồm 30 ngôn ngữ + 22 phương ngữ -> 100 ngôn ngữ của dịch / tóm tắt thông qua một LLM (được công bố thông số kỹ thuật)
  • Máy dịch với tốc độ 800+ ký tự mỗi giây, file phiên âm giọng nói lúc 10:1 (published spec)
  • Phụ đề bốn yếu tố trên màn hình: HDMI đầu ra đồng bộ loa, dấu thời gian, văn bản nguồn và dịch
  • phân tách người nói + in giọng nói: tích hợp với các hệ thống âm thanh và cuộc họp địa phương để tự động dán nhãn người nói, với quản lý thư viện in giọng nói
  • Đường ống hoàn toàn ngoại tuyến: Phát hiện ngôn ngữ, nhận dạng, dịch thuật, tóm tắt và đầu ra phụ đề tất cả đều chạy trên mạng nội bộ với không có cuộc gọi công cộng, hỗ trợ triển khai không khí
  • Hỗ trợ bản địa cho máy tính trong nước: Ascend 310P / 910B, Cambricon MLU370 / 590, Hygon DCU và toàn bộ phạm vi NVIDIA; suy luận thời gian thực trên CPU một mình
  • Nền tảng kỹ thuật: từ Phòng thí nghiệm xử lý ngôn ngữ tự nhiên NEU được thành lập vào năm 1973 - 200+ bài báo (20+ CCF-A), 110+ bằng sáng chế phát minh (54 cấp); công cụ dịch máy NiuTrans được sử dụng hơn 100.000 lần trên toàn thế giới, chạy nhanh hơn 4 lần so với các mô hình chung chính thống

Lấy tám câu hỏi đó và sử dụng chúng trực tiếp - một nhà cung cấp không thể trả lời chúng là đáng để nhìn lại, bất kể giá.

Cần đánh giá triển khai cho hỗn hợp ngôn ngữ, mức độ đồng thời và tuân thủ của bạn? Book a demo để tham khảo ý kiến một-một, hoặc xem On-Premise ASR Selection và Running On-Premises ASR on Ascend 910B.


  • Lần đầu tiên được xuất bản bởi đội ngũ kỹ thuật AI của VoiVision; vui lòng ghi nhận nguồn khi xuất bản lại. Con số độ trễ và đồng thời là các cường độ tham chiếu trong môi trường điển hình và có thể khác nhau tùy thuộc vào kích thước mô hình và phần cứng.

Câu hỏi thường gặp

Q: Đối với phiên dịch cuộc họp đa ngôn ngữ, tôi chọn cách nào giữa phiên dịch đám mây và triển khai tại chỗ?

A: Hai điều kiện khó khăn quyết định nó: liệu dữ liệu có thể rời khỏi mạng hay không, và liệu bạn có cần phụ đề thời gian thực hay không. Phiên dịch đám mây có cấu trúc độ trễ của tải lên, xếp hàng, nhận dạng, dịch và trả lại, tốt cho bản dịch hàng loạt của bản ghi nhưng gây chết người cho phụ đề trực tiếp. Chính phủ, bí mật và các kịch bản công nghệ trong nước thường không thể để âm thanh rời khỏi intranet. Nếu một trong hai điều kiện được giữ, hãy đi on-premises.

Q: Chuyển dịch hội nghị đa ngôn ngữ tại chỗ có thể đạt được độ trễ nào?

A: Độ trễ của một đường ống tại chỗ chỉ đến từ kết luận cục bộ, không có tải lên hoặc trả lại chân. Thông thường, khoảng cách giữa kết thúc của một câu và bản dịch của nó xuất hiện trên màn hình có thể được giữ trong vòng một giây. Con số chính xác phụ thuộc vào kích thước mô hình, đồng thời và liệu streaming chunking có được bật hay không. Trong đồng thời đa ngôn ngữ, thông lượng dịch thuật (ký tự mỗi giây) thường quan trọng hơn so với trải nghiệm hơn là độ trễ một câu.

Q: Làm thế nào để xác định ngôn ngữ trong một cuộc họp đa ngôn ngữ?

A: Có hai chế độ. Chế độ ngôn ngữ cố định phù hợp với các trường hợp xác định trong đó ' cuộc họp này là tiếng Trung-Anh ', và cung cấp độ chính xác cao nhất. Chế độ tự động phát hiện phù hợp với các cuộc họp nơi người tham dự khác nhau, với ASR quyết định ngôn ngữ từ câu đầu tiên hoặc một cửa sổ cuộn. Trong thực tế, kích hoạt tự động phát hiện nhưng cho phép khóa thủ công - nếu phát hiện sai, bạn có thể chuyển đổi với một cú nhấp chuột, thay vì lãng phí toàn bộ cuộc họp theo hướng sai.

Q: Điều gì xảy ra nếu bản dịch không phù hợp với thuật ngữ của chúng tôi?

A: Các mô hình dịch thuật chung làm tên công ty, mã sản phẩm và thuật ngữ ngành không nhất quán, đó là vấn đề rõ ràng nhất trong các cuộc họp đa ngôn ngữ. Việc sửa chữa là một cơ sở thuật ngữ: bản đồ danh từ thích hợp, tên sản phẩm và viết tắt để các hình thức ngôn ngữ mục tiêu cố định, và để danh sách ASR từ khóa và thuật ngữ dịch chia sẻ một danh sách từ - vì vậy công nhận và dịch thuật đồng ý trên cùng một thuật ngữ và nó không biến dạng trong đầu ra.

Q: Làm thế nào để đồng bộ phụ đề được thực hiện, và tại sao một số hệ thống luôn trôi dạt?

A: Sự trôi dạt thường có hai nguyên nhân: ASR và dịch chạy như các đường ống nối tiếp riêng biệt với bộ đệm riêng của chúng, vì vậy dịch lại bị chậm sau sự nhận dạng; hoặc phân đoạn loa không bị ràng buộc với các dòng phụ đề, vì vậy trong đối thoại đa bên, các phụ đề được gán cho sai người. Cách tiếp cận đúng đắn liên kết nhận dạng, dịch thuật và phân tách người nói trên một dòng thời gian, với mỗi dòng phụ đề mang người nói, dấu thời gian, văn bản nguồn và dịch thuật, tất cả bốn được hiển thị cùng nhau trên đầu ra HDMI.

Q: Những ngôn ngữ nào được hỗ trợ dịch phiên họp đa ngôn ngữ?

A: Phía nhận dạng thường bao gồm hàng chục ngôn ngữ và phương ngữ, và phía dịch thuật nhiều hơn. Ví dụ, tại VoiVision, công nhận bao gồm 30 ngôn ngữ cộng với 22 phương ngữ, dịch thuật và tóm tắt bao gồm 100 ngôn ngữ thông qua một LLM, dịch máy chạy ở tốc độ 800+ ký tự mỗi giây và các cuộc họp có thể xuất phụ đề song ngữ với nguồn và dịch song song.

Q: Bản dịch hội nghị đa ngôn ngữ có cần kết nối internet không?

A: Không. Toàn bộ đường ống - phát hiện ngôn ngữ, ASR, dịch, tóm tắt và đầu ra phụ đề - chạy ngoại tuyến trên mạng nội bộ mà không có cuộc gọi API công cộng, và trọng lượng mô hình được nạp một lần như một gói ngoại tuyến, phù hợp với môi trường không khí.Đây là giá trị cốt lõi của on-premise trên đám mây.

Q: Một hệ thống có thể xử lý bao nhiêu cuộc họp đa ngôn ngữ đồng thời?

A: Nó phụ thuộc vào phần cứng và liệu đường ống đầy đủ có được sử dụng hay không. Pure phiên âm giọng nói và dịch thuật cho phép đồng thời cao hơn; một khi phân tách người nói, chỉnh sửa thuật ngữ và tóm tắt được xếp chồng lên nhau, một máy duy nhất vẫn duy trì nhiều cuộc họp đồng thời, và một cụm quy mô tuyến tính. Lập kế hoạch phần cứng chống lại đồng thời bền vững thay vì đỉnh cao, và để lại chỗ trống cho việc chỉnh sửa thuật ngữ và tóm tắt.

#Cuộc họp đa ngôn ngữ#Phiên dịch cuộc họp#Thông dịch đồng thời#Triển khai ngoại tuyến#Đồng bộ phụ đề

Đặt một bản demo cá nhân

Hãy cho chúng tôi biết kịch bản cuộc họp và nhu cầu tuân thủ của bạn - nhận một kế hoạch phù hợp.

Đặt lịch ngay
Trò chuyện trực tiếp