VoiVision AI
tech· VoiVision AI Engineering

Проведение многоязычных совещаний в оффлайн: предварительный перевод и синхронизация субтитров

На четырехсторонней встрече, охватывающей китайский, английский, японский и корейский языки, сложной частью является не распознавание - это знать, кто сказал что, что должно стать на другом языке, является ли это в реальном времени и может ли аудио покинуть здание.В этой статье рассматривается полный спектр многоязычных встреч: обнаружение языка, синхронизация времени между потоковой передачей ASR и переводом, синхронизация субтитров, последовательность терминологии и почему облачный перевод редко обеспечивает соответствие требованиям в государственных и корпоративных настройках.


Перевод и синхронизация субтитров на местных многоязычных совещаниях

Четырехсторонняя встреча, охватывающая китайский, английский, японский и корейский языки, каждый участник говорит на своем собственном языке, и в конце набора протокол совещания, который каждый может прочитать с этикетками спикера, плюс запись данных встречи.

Это звучит как только один шаг за пределами "аудио в текст". "На практике это совершенно другая проблема.

Записка о данных: Цифры, помеченные "опубликованными спецификациями", взяты из общедоступного продукта Характеристики; описания задержки и параллельности являются исходные величины в типичных средах, а фактические значения варьируются в зависимости от размера модели, условий аудио и стратегии параллельности - измеряется на вашей собственной рабочей нагрузке.

1.Самой трудной частью многоязычных встреч не является перевод.

Первый инстинкт большинства людей заключается в том, что многоязычные встречи состоят из двух этапов - распознавать, затем переводить - и сложность заключается в качестве перевода.Как только вы запустите проект, вы найдете Блокировщики никогда не являются качеством перевода, но эти четыре вещи:

Реальная трудностьСимптомыПочему это трудно
Языковое решениеПрисутствующие разные, вы не знаете, кто говорит что.Одно неправильное обнаружение недействует весь проход
Временное выравниваниеПеревод отстает, субтитры никогда не выстраиваютсяРаспознавание и трансляция - это две трубопроводы, каждая буферная
Связывающий спикерСубтитры присвоены неправильному человекуразделение по спикерам должен привязываться к строке субтитров
Границы данныхМожет ли аудио покинуть интранетАвтоматический дисквалификатор, который решает Архитектура

Первоочередное место людей отстают: как и при выборе локального ASR, первым реальным порогом является Возможность выхода данных из сети, а не качество перевода.

Немного хуже перевод приемлем; аудио, выходящее из сети, убивает проект.

2.Структура задержки облачной интерпретации фатальна для живых субтитров

Это наиболее упускаемый момент в выборе.

Облачный интерпретационный трубопровод выглядит так:

[local] capture audio -> upload -> [cloud] queue -> recognize -> translate -> synthesize -> return -> [local] display
                          ^                                                                                ^
                    public jitter                                                                     public jitter

Запись заседания продолжительностью в один час (16 кГц моно, О нас 115 МБ) занимает примерно 10 секунд, чтобы загрузить в интранет со скоростью 100 Мбит / с. Для пакетного перевода после встречи это не имеет значения; для прямых субтитров это серьезная проблема.

Что еще более важно, облачная задержка неконтролируемый, потому что она зависит от длины очереди, публичной дрожжи и пропускной способности возврата - любая икота и субтитры разрываются.

Например, на территории совершенно иное:

[local] capture audio -> streaming ASR -> LLM translation -> subtitle display

Аудио никогда не касается сетевой платы; задержка происходит только из локального вывода, с no upload, no queue, no return, no public jitter.

Практическое правило: Если вам нужны живые субтитры или живые протокол совещания, структура облачной задержки по своей сути неблагоприятна - предпочтите наpremises.

3.Как выглядит полный трубопровод на месте

Производственный многоязычный перевод конференции выглядит так (все локальные):

Microphone array / meeting audio system
 | 
        v
   [ Language auto-detection ]  <- first sentence or rolling window
 | 
        v
   [ Streaming ASR ]  <- 30 languages + 22 dialects, live punctuation, smart segmentation
 | 
        +-------------+
        v             v
[ Speaker separation ]  [ LLM translation ]  <- glossary constraints
(voiceprint / channel) | 
 | v
        +------> [ Subtitle sync and display ]
                 speaker / time / source / translation

У каждого этапа есть ловушки.Один за другим.

3.1Обнаружение языка: один неправильный вызов недействует прохождению

Когда участники фиксированы (скажите: «это заседание китайско-английское»), заблокируйте язык и получите максимальную точность.

Если участники разнятся, то ASR должен принять решение.Одна практическая рекомендация:

Включить автоматическое обнаружение, но разрешить ручную блокировку.

Автообнаружение работает с первого предложения или раскрывающегося окна, и неправильно оценивает тяжелые акценты, переключение кодов или написание английских аббревиатур.Если это неправильно, вам нужно одним щелчком мыши переключить этот ретроактивно корректирует уже признанные сегменты - в противном случае весь перевод собрания будет потрачен впустую.

3.2Потоковый ASR: распознавание и перевод не должны буферировать отдельно

Это причина номер один дрейфа субтитров.

Если распознавание и перевод выполняются как две независимые трубопроводы, каждая со своим собственным буфером, то перевод отстает от распознавания на один или несколько циклов буфера, а субтитры постоянно отстают.

Правильный подход заключается в том, чтобы иметь recognition, translation and разделение по спикерам share one timeline: время начала и окончания каждого распознанного сегмента становится временной якорью единицы перевода, и перевод заполняется обратно в соответствующий временный интервал.

3.3 разделение по спикерам: субтитры не должны быть неправильно присвоены

На многопартийных встречах «кто это сказал» имеет больше значение, чем «что было сказано».Типические маршруты:

  • Распознавание отпечатков голоса: извлечение отпечатков голоса оратора для различения участников, с управлением библиотекой отпечатков голоса (регистрация / переименование / удаление)
  • Разделение каналов: интеграция с локальными системами собраний и аудио для различения спикеров по каналам
  • Временная связь: привязать идентификацию спикера к строке субтитров, а не догадываться позже

Последняя строка субтитров должна содержать все четыре спикер, время, исходный текст и перевод - что именно то, что пользователи видят при выводе на дисплей в зале заседаний через HDMI.

3.4Согласованность терминологии: распознавание и перевод должны иметь один список слов

Это наиболее заметная проблема в многоязычных встречах.

Названия компаний, коды продукции, люди и отраслевые термины несовместимы с общими моделями: одно и то же название продукта, переведенное одним путем в первом отрывке, а другим путем в третьем, оставляет аудиторию потерянной.

Рекомендация - это терминологическая база, разделяемая как признанием, так и переводом:

ИсточникЦельConstraint
Правильные существительные / наименования продуктовФиксированная форма на языкеПринудительное картирование
Отраслевые терминыСтандартный термин по языкуПринудительное картирование
Лица / сокращенияСохранить источник или транслитерациюПо политике

Признание использует список ключевое слово для повышения точности собственных имен, перевод использует глоссарий для блокировки рендеринга - когда обе стороны соглашаются на один и тот же термин, он не деформируется в выходе.

4.Восемь вопросов, которые нужно задать О нас многоязычный перевод совещаний

Передайте этот список продавцу; те, кто не может ответить, выходят:

  1. А что ж ждёт Весь трубопровод делает любой вызов в общедоступную сеть? (модели, термины и телеметрия - все учитываются)
  2. На каких языках работает признание?Сколько из них охватывает перевод?Один двигатель или несколько сшитых вместе?
  3. Язык Автообнаруженный или руководство?Может ли ошибочное обнаружение быть Ретроактивно исправленный?
  4. Что такое Live latency?От конца предложения до перевода на экране - секунды или больше?
  5. Поддерживает ли перевод терминологическая база / терминологические ограничения?Может ли она поделиться списком ASR ключевое слово?
  6. Является ли разделение по спикерам встроенным или внешним?Как обрабатывается пересекающаяся речь?
  7. Do subtitles show Все четыре элемента (speaker / time / source / translation)?Смогут ли они выйти на?
  8. Поддерживает ли он развертывание air-gapped?Что содержит оффлайн пакет?

Вопросы 1 и 3 - это вопросы, которые являются основными.Неудача 1 означает, что она никогда не была доставлена в соответствующей среде; неудача 3 означает, что система никогда не проводила многоязычную встречу.

5.Когда не нужно идти на локальный перевод для многоязычного перевода

Несколько слов в обратном направлении, так что это не читается как рекламный.

Избегайте работы на месте, когда:

  • Вы проводите только один или два многоязычных совещания: Облачный перевод оплачивается за использование и гораздо меньше проблем
  • Вам нужен только перевод транскрипции после встречи: передать запись в облачный сервис для пакетного перевода по более низкой цене, не требуется сервер
  • Нет требования к соблюдению и нет необходимости в живых субтитрах: основная ценность локальной системы не касается ни одного из них, поэтому это чрезмерные инвестиции

Правильным триггером для локального многоязычного перевода являются Данные, которые не могут выходить из сети или Необходимость в живых двуязычных субтитрах - когда любой из них удерживается, это окупается.

6.Как это делает VoiVision

Сама линейка продуктов VoiVision разделяется на «ИИ-секретарь совещаний» и «ИИ-перевод совещаний», что делает многоязычный перевод основной возможностью, а не дополнением:

  • Перевод x Перевод: встроенный потоковой ASR, охватывающий 30 языков + 22 диалекта - > 100 языков перевода / обобщения через LLM (опубликованные спецификации)
  • Машинный перевод со скоростью более 800 символов в секунду, файл речевая транскрипция в 10: 1 (опубликована спецификация)
  • Четырехэлементные субтитры на экране: HDMI вывод синхронизирует спикер, timestamp, исходный текст и перевод
  • разделение по спикерам + voiceprint: интегрируется с локальными системами собраний и аудио для автоматической маркировки спикеров, с управлением библиотекой голосовых отпечатков
  • Полностью оффлайн трубопровод: Обнаружение языка, распознавание, перевод, резюмирование и выход субтитров работают в интранете с нулевыми публичными вызовами, поддерживая развертывание с воздушным разрывом.
  • Нативная поддержка домашних вычислений: Ascend 310P / 910B, Cambricon MLU370 / 590, Hygon DCU и полный диапазон NVIDIA; вывод в режиме реального времени только на CPU
  • Техническая основа: Лаборатория обработки естественного языка NEU, основанная в 1973 году - более 200 работ (20+ CCF-A), 110+ патентов на изобретения (54 выданных); движок машинного перевода NiuTrans использовался более 100 000 раз по всему миру, работая в 4 раза быстрее, чем основные общие модели

Возьмите эти восемь вопросов и используйте их напрямую - продавец, который не может ответить на них, стоит еще раз взглянуть, какая бы цена ни была.

Нужна оценка развертывания для вашего языкового сочетания, совпадения и уровня соответствия? Book a demo для индивидуальной консультации, или см. On-Premise ASR Selection и Running On-Premises ASR on Ascend 910B.


  • Впервые опубликовано инженерной командой VoiVision AI; пожалуйста, укажите источник при переиздании.Цифры задержки и одновременности являются эталонными величинами в типичных средах и могут варьироваться в зависимости от размера модели и оборудования *.

FAQ

Q: Как выбирать между облачным переводом и локальным развертыванием для многоязычного перевода заседаний?

A: Это решают два жестких условия: могут ли данные покинуть сеть, и нужны ли субтитры в режиме реального времени.Облачная интерпретация имеет структуру задержки загрузки, выхода в очередь, распознавания, перевода и возвращения, что отлично подходит для пакетного перевода записей, но фатально для живых субтитров.Правительственные, секретные и отечественные технологические сценарии обычно не могут позволить аудио покинуть интранет вообще.Если одно из этих условий соблюдается, перейдите на помещения.

Q: Какую задержку может достичь локальный многоязычный перевод заседаний?

A: Задержка локальной трубопроводы происходит только из локального вывода, без загрузки или возврата.Как правило, промежуток между концом предложения и его переводом, появляющимся на экране, может быть удержано в течение секунды.Точная цифра зависит от размера модели, одновременности и включено ли потоковое чанкинг.При одновременном многоязычном переводе пропускная способность перевода (символы в секунду) часто имеет большее значение для опыта, чем задержка однопредложения.

Q: Как определяется язык на многоязычной встрече?

A: Существует два режимаРежим с фиксированным языком подходит для детерминистических случаев, когда "это заседание китайско-английское", и дает наибольшую точность.Режим автоматического обнаружения подходит для встреч, где присутствующие разные, при этом ASR решает язык из первого предложения или перевертывающегося окна.На практике, включите автоматическое обнаружение, но разрешите ручную блокировку - если обнаружение идет не так, вы можете переключить одним щелчком мыши, вместо того, чтобы тратить всю встречу в неправильном направлении.

Q: Что делать, если перевод не соответствует нашей терминологии?

A: В общих моделях перевода названия компаний, коды продуктов и отраслевые термины являются непоследовательными, что является наиболее заметной проблемой на многоязычных встречах.Исправление - это терминологическая база: сопоставьте собственные существительные, наименования продуктов и сокращения с фиксированными формами целевого языка, и позвольте списку ASR ключевое слово и глоссарию перевода делиться одним списком слов - так что распознавание и перевод соглашаются на один и тот же термин, и он не деформируется в выходе.

Q: Как происходит синхронизация субтитров и почему некоторые системы всегда дрейфуют?

A: Дрейф обычно имеет две причины: ASR и перевод выполняются как отдельные последовательные трубопроводы со своими собственными буферами, поэтому перевод отстает от распознавания; или сегментация спикера не связана с строками субтитров, поэтому в многостороннем диалоге субтитровы приписываются неправильному человеку.Правильный подход объединяет распознавание, перевод и разделение по спикерам на одну временную линию, с каждой строкой субтитров, содержащей спикера, временную метку, исходный текст и перевод, все четыре отображаются вместе на выходе HDMI.

Q: Какие языки поддерживает многоязычный перевод заседаний?

A: Распознавание обычно охватывает десятки языков и диалектов, а перевод больше.Например, в VoiVision распознавание охватывает 30 языков плюс 22 диалекта, перевод и резюмирование охватывают 100 языков с помощью LLM, машинный перевод работает со скоростью 800+ символов в секунду, а встречи могут выдавать двуязычные субтитры с источником и переводом бок о бок.

Q: Нужно ли для многоязычного перевода собраний подключение к Интернету?

A: Нет. Весь конвейер - обнаружение языка, ASR, перевод, резюмирование и выход субтитров - работает в оффлайн на интранете без публичных вызовов API, и весовые значения модели загружаются один раз в оффлайн-пакете, который подходит для среды с воздушным разрывом.Это основная ценность наpremises над облаком.

Q: Сколько одновременных многоязычных совещаний может выполнить одна система?

A: Это зависит от оборудования и от того, используется ли полный трубопровод.Чистый речевая транскрипция и перевод обеспечивают более высокую параллельность; после того, как разделение по спикерам, терминологическая коррекция и обобщение накладываются, одна машина все еще поддерживает несколько встреч одновременно, а кластер масштабируется линейным образом.Планируйте аппаратное обеспечение с учетом устойчивого совпадения, а не пика, и оставьте пространство для коррекции терминологии и резюмирования

#Многоязычное совещание#Перевод заседаний#Одновременный устный перевод#Офлайн развертывание#Sync Subtitle

Персонализированная демо-версия

Расскажите нам о вашем сценарии встреч и потребностях в соблюдении стандартов - получите индивидуальный план.

Забронировать
Онлайн-чат