VoiVision AI
tech· VoiVision AI Engineering

오프라인 다국어 미팅 실행: 사전 번역 및 자막 동기화

중국어, 영어, 일본어, 한국어를 포함하는 4 자 회의에서 어려운 부분은 인식이 아닙니다 - 누가 무엇을 말했는지, 다른 언어로 무엇이되어야하는지, 실시간인지, 오디오가 건물 밖으로 나올 수 있는지 아는 것입니다.이 문서에서는 언어 탐지, ASR 스트리밍과 번역 사이의 시간 정렬, 자막 동기화, 용어 일관성, 클라우드 통역이 정부 및 엔터프라이즈 환경에서 규정 준수를 거의 해결하지 못하는 이유 등 다국어 회의의 전체 파이프라인에 대해 설명합니다.


현장 다국어 회의 번역 및 자막 동기화

중국어, 영어, 일본어, 한국어를 포함하는 4 자 회의, 각 참가자는 자신의 언어를 말하고, 마지막에 모두가 읽을 수있는 회의록 세트 스피커 레이블과 회의 데이터의 기록.

그것은 단지 "오디오에서 텍스트로" 한 걸음 이상으로 들립니다. "실제로는 완전히 다른 문제입니다.

데이터 노트:"공개된 사양" 으로 표시된 수치는 일반 제품 사양 에서 가져온 것입니다. 지연 시간 및 동시작업에 대한 설명은 일반적인 환경에서는 참조 크기 이며 실제 값은 모델 크기, 오디오 조건 및 동시작업 전략에 따라 달라집니다. 이는 사용자의 작업 로드에 따라 측정됩니다.

1.다국어 회의의 어려운 부분은 번역이 아닙니다.

대부분의 사람들의 첫 번째 본능은 다국어 회의는 두 단계 - 인식, 다음으로 번역 - 그리고 어려움은 번역의 품질입니다.프로젝트를 실행하면 차단기는 결코 번역 품질이 아니지만, 이 네 가지 사항: 를 찾습니다.

진짜 어려움은증상왜 어려운가?
언어 결정참석자는 다양하다; 당신은 누가 무엇을 말하는지 모른다.한 번의 잘못된 탐지가 전체 통과를 무효화합니다.
시간 정렬Translation lags, subtitles never line up (번역이 지연되고 자막이 정렬되지 않는다)인식과 번역은 각각 버퍼링되는 두 개의 파이프라인입니다.
스피커 바인딩잘못된 사람이 붙인 자막화자 분리 는 자막 행에 바인딩해야 합니다.
데이터 경계오디오가 인트라넷을 떠날 수 있는지 여부아키텍처 를 결정하는 자동 탈격자

우선순위 사람들은 뒤로 물러나다.: 온 - 프레미스 ASR 선택과 마찬가지로 첫 번째 실제 임계값은 데이터가 네트워크를 떠날 수 있는지 여부 이며 번역 품질은 아닙니다.

약간 더 나쁜 번역은 용인됩니다; 오디오가 네트워크를 떠나면 프로젝트를 죽입니다.

2.클라우드 해석의 지연 구조는 라이브 자막에 치명적입니다.

이것은 선택에서 가장 간과되는 점입니다.

클라우드 해석 파이프라인은 다음과 같습니다. Cloud interpretation pipeline looks like this:

[local] capture audio -> upload -> [cloud] queue -> recognize -> translate -> synthesize -> return -> [local] display
                          ^                                                                                ^
                    public jitter                                                                     public jitter

1 시간 회의 녹음 (16 kHz 모노, 회사 소개 115 MB) 은 100 Mbps 인트라넷에 업로드하는 데 약 10 초가 걸립니다. 일괄 회의 후 번역은 관련이 없으며 라이브 자막의 경우 심각한 문제입니다.

더 중요한 것은 클라우드 지연 시간이 큐 길이, 공용 지터 및 반환 대역폭에 따라 달라지기 때문에 통제할 수 없는 입니다 - 모든 hiccup 과 자막이 끊어집니다.

온 - 프레미스는 완전히 다릅니다.

[local] capture audio -> streaming ASR -> LLM translation -> subtitle display

오디오는 네트워크 카드에 닿지 않으며, 지연 시간은 업로드 없음, 대기열 없음, 반환 없음, 공용 지터 없음 로컬 추론에서만 발생합니다.

영문상품명: 라이브 자막이나 라이브 회의록 가 필요한 경우 클라우드 지연 구조는 본질적으로 불리한 것입니다 - 온 - 프레미스를 선호합니다.

3.전체 온 - 프레미스 파이프라인은 어떻게 생겼는지

프로덕션 다국어 회의 번역 파이프라인은 다음과 같습니다 (모두 로컬):

Microphone array / meeting audio system
 | 
        v
   [ Language auto-detection ]  <- first sentence or rolling window
 | 
        v
   [ Streaming ASR ]  <- 30 languages + 22 dialects, live punctuation, smart segmentation
 | 
        +-------------+
        v             v
[ Speaker separation ]  [ LLM translation ]  <- glossary constraints
(voiceprint / channel) | 
 | v
        +------> [ Subtitle sync and display ]
                 speaker / time / source / translation

모든 단계에는 함정이 있다.하나하나.

3.1언어 탐지: 한 번의 잘못된 호출이 구절을 무효화합니다.

참석자가 고정되면 ("이 회의는 중국어 - 영어입니다 " 라고 말함) 언어를 잠그면 가장 높은 정확도를 얻을 수 있습니다.

참석자가 다르면 ASR 가 결정해야합니다.실용적인 권장 사항:

자동 탐지를 활성화하지만 수동 잠금을 허용합니다.

자동 탐지는 첫 문장이나 롤링 창에서 작동하며, 무거운 악센트, 코드 전환 또는 철자가 나온 영어 약어를 잘못 판단합니다.잘못된 경우, 한 번의 클릭으로 이미 인식된 세그먼트를 소급으로 수정합니다. 를 전환해야합니다 - 그렇지 않으면 전체 회의의 번역이 낭비됩니다.

3.2스트리밍 ASR: 인식 및 번역은 별도로 버퍼링되지 않아야 합니다.

이것이 자막이 변하는 가장 큰 원인이다.

인식과 번역은 각각 자체 버퍼가 있는 두 개의 독립적인 파이프라인으로 실행되는 경우, 번역은 하나 이상의 버퍼 사이클으로 인식이 지연되고 자막이 영구적으로 뒤쳐집니다.

올바른 접근 방식은 인식, 번역 및 화자 분리 는 하나의 타임라인을 공유합니다. 를 갖는 것입니다: 각 인식된 세그먼트의 시작 및 종료 시간은 변환 단위의 시간 앵커가되고 변환은 해당 시간 슬롯으로 채워집니다.

3.3 화자 분리: 자막이 잘못 지정되어서는 안 됩니다.

다당 회의에서는 ' 무슨 말을 했는가 ' 보다 ' 누가 말했는가 ' 가 더 중요하다.일반적인 경로:

  • 음성인식 (Voiceprint Recognition): 음성 인쇄 라이브러리 관리 (등록 / 이름 바꾸기 / 삭제) 를 통해 참가자를 구별하기 위해 연사 음성 인쇄를 추출합니다.
  • 채널 분리: 로컬 미팅 및 오디오 시스템과 통합하여 채널별로 연사를 구분합니다.
  • 타임라인 바인딩: 스피커 ID 를 캡션 라인에 바인딩, 나중에 추측하는 대신

마지막 자막 라인은 연사, 시간, 원본 텍스트 및 번역 의 4 개를 모두 가져야하며, 이는 사용자가 HDMI 를 통해 회의실 디스플레이로 출력할 때 정확히 볼 수 있는 것입니다.

3.4용어적 일관성: 인식과 번역은 하나의 단어 목록을 공유해야 합니다.

이것은 다국어 회의에서 가장 눈에 띄는 문제입니다.

회사 이름, 제품 코드, 사람 및 업계 용어는 일반적인 모델에 의해 일관되지 않게 렌더링됩니다: 동일한 제품 이름은 첫 번째 구절에서 한 가지 방식으로 번역되고 세 번째 구절에서 다른 방식으로 번역되어 청중을 잃게합니다.

수정 사항은 인식과 번역이 공유하는 용어 기반 입니다:

출처대상구속조건
적절한 명사 / 제품 이름언어별 고정 양식강제 매핑
업계 용어언어별 표준 용어강제 매핑
사람 / 약어원본을 유지하거나 문역을 유지합니다.정책별

Recognition 은 핫워드 목록을 사용하여 고유명사 정확도를 높이고, translation 은 용어집을 사용하여 렌더링을 잠그고 - 양측이 같은 용어에 동의하면 출력에서 변형되지 않습니다. 를 사용합니다.

4. 회사 소개 다국어 회의 번역에 대한 8 가지 질문

이 목록을 판매자에게 가져 가라; 대답할 수 없는 사람들은 밖으로 나간다:

  1. 전체 파이프라인은 공용 네트워크 호출을 수행합니다. 는 무엇입니까? (모형, 용어 및 원격 측정 모두 계산)
  2. 인정하다. 는 어떤 언어를 지원합니까?번역은 얼마나 많은 것을 다루는가?하나의 엔진이 아니면 여러 개의 엔진이 결합되어 있습니까?
  3. 언어는 자동 탐지됨 또는 수동입니까?잘못된 검출이 소급적으로 수정됨 일 수 있습니까?
  4. 라이브 대기 시간 는 무엇입니까?문장의 끝에서 화면 번역까지 - 초 또는 그 이상?
  5. 번역은 용어 기준 / 용어 제한조건 를 지원합니까? ASR 핫워드 목록을 공유 할 수 있습니까?
  6. 화자 분리 는 내장되어 있습니까?겹치는 연설은 어떻게 처리됩니까?
  7. 자막에 모든 4 가지 요소 (speaker / time / source / translation) 가 표시됩니까?그들은 HDMI 를 통해 출력 할 수 있습니까?
  8. 공기 틈이 끼다. 배포를 지원합니까?오프라인 패키지에는 무엇이 포함되어 있나요?

질문 1 과 3 은 분수지입니다.실패 1 은 규정 준수 환경에서 제공되지 않았음을 의미하며, 실패 3 은 시스템이 실제로 다국어 미팅을 실행하지 않았음을 의미합니다.

5.여러 언어 번역을 위해 현장 방문하지 않는 경우

몇 마디는 반전되어서, 이것은 광고로 읽지 않습니다.

다음과 같은 경우 온 - 프레미스 작업이 수행되지 않도록 하십시오.

  • 한두 개의 다국어 회의를 개최합니다.: 클라우드 통역은 사용당 요금으로 부담이 훨씬 적습니다.
  • 회의 후 성적표 번역만 필요합니다.: 서버 필요 없이 저렴한 비용으로 일괄 번역을 위해 클라우드 서비스에 녹음을 넘겨줍니다.
  • 규정 준수 요건 및 라이브 자막 필요 없음: 온 - 프레미스 시스템의 핵심 가치는 어느 쪽에도 영향을 미치지 않으므로 과도한 투자입니다.

온 - 프레미스 다국어 번역을 위한 올바른 트리거는 네트워크를 떠나지 않을 수 있는 데이터 또는 라이브 이중 언어 자막의 필요성 입니다 - 둘 중 하나가 유지되면 효과가 있습니다.

6. VoiVision 는 어떻게

VoiVision 의 제품 라인 자체는 "AI 회의 비서" 와 "AI 회의 통역" 로 분할되어 다국어 번역을 추가 기능이 아닌 주류 기능으로 만듭니다.

  • Recognition x 번역: 30 개 언어 + 22 개의 방언 -> LLM 을 통해 번역 / 요약의 100 개의 언어 를 커버하는 내장 스트리밍 ASR (공간 사양)
  • 초당 800+ characters per second 기계 번역, 파일 음성 전사 10: 1 (공개된 사양)
  • 스크린에서 4 요소 자막: HDMI 출력은 스피커, 타임스탬프, 원본 텍스트 및 번역을 동기화합니다.
  • 화자 분리 + 음성인쇄: 로컬 미팅 및 오디오 시스템과 통합하여 음성 인쇄 라이브러리 관리를 통해 연사 자동으로 레이블 지정
  • 완전히 오프라인 파이프라인: 언어 탐지, 인식, 번역, 요약 및 자막 출력은 모두 공용 호출 없이 인트라넷에서 실행되며, 에어 게이프 배포 지원
  • 가정용 컴퓨팅을 위한 기본 지원: Ascend 310 P / 910 B, Cambricon MLU370 / 590, Hygon DCU 및 전체 NVIDIA 범위; CPU 단독으로 실시간 추론
  • 기술 기초: 1973 년에 설립된 NEU Natural Language Processing Lab 에서 - 200 개 이상의 논문 (20 개 이상의 CCF - A), 110 개 이상의 발명 특허 (54 개 부여); 전 세계적으로 100, 000 회 이상 사용된 NiuTrans 기계 번역 엔진, 주류 일반 모델보다 4 배 빠른 실행

이 8 가지 질문을 받아 직접 사용하십시오 - 대답 할 수없는 판매자는 가격이 무엇이든간에 다시 살펴볼 가치가 있습니다.

언어 혼합, 동시성 및 규정 준수 수준에 대한 배포 평가가 필요하십니까? Book a demo 는 일대일 상담을 위해, 또는 On-Premise ASR Selection 및 Running On-Premises ASR on Ascend 910B 를 참조하십시오.


  • VoiVision AI 엔지니어링 팀에 의해 처음 출판되었습니다; 재출판 시 출처의 크레딧을 확인하십시오.지연 시간 및 동시성 수치는 일반적인 환경의 기준 값이며 모델 크기 및 하드웨어에 따라 다를 수 있습니다. *

FAQ

Q: 다국어 회의 번역의 경우 클라우드 통역과 온 - 프레미스 배포를 어떻게 선택해야 합니까?

A: 두 가지 어려운 조건이 그것을 결정합니다: 데이터가 네트워크를 떠날 수 있는지 여부, 그리고 실시간 자막이 필요한지 여부.클라우드 해석에는 업로드, 대기열, 인식, 번역 및 반환의 지연 구조가 있으며, 녹음의 배치 번역에는 적합하지만 라이브 자막에는 치명적입니다.정부, 기밀 및 국내 기술 시나리오에서는 일반적으로 오디오가 인트라넷을 떠나도록 허용하지 않습니다.조건 중 하나라도 충족되면 온 - 프레미스 로 이동합니다.

Q: 온 - 프레미스 다국어 회의 번역은 얼마나 많은 지연 시간을 달성할 수 있습니까?

A: 온 - 프레미스 파이프라인의 지연 시간은 로컬 추론에서만 발생하며 업로드 또는 반환 다리는 없습니다.일반적으로 문장의 끝과 화면에 표시되는 번역 사이의 간격은 1 초 이내에 유지될 수 있습니다.정확한 수치는 모델 크기, 동시작업 및 스트리밍 청크링이 활성화되어 있는지 여부에 따라 달라집니다.다국어 동시 실행에서 번역 처리량 (초당 문자) 은 종종 단일 문장 지연 시간보다 경험에 더 중요합니다.

Q: 다국어 회의에서 언어를 식별하는 방법은 무엇입니까?

A: 두 가지 모드가 있습니다.고정 언어 모드는 '이번 회의는 중국어 - 영어' 의 결정적인 경우에 적합하며 가장 높은 정확도를 제공합니다.자동 탐지 모드는 참석자가 다양한 회의에 적합하며, ASR 는 첫 문장이나 롤링 창에서 언어를 결정합니다.실제로는 자동 탐지를 활성화하지만 수동 잠금을 허용합니다 - 탐지가 잘못되면 전체 미팅을 잘못된 방향으로 낭비하는 대신 한 번의 클릭으로 전환 할 수 있습니다.

Q: 번역이 우리의 용어와 일치하지 않으면 어떻게합니까?

A: 일반적인 번역 모델은 회사 이름, 제품 코드 및 업계 용어를 일관성이 없는 방식으로 표시하며, 이는 다국어 회의에서 가장 눈에 띄는 문제입니다.수정 사항은 용어 기반입니다: 고유 명사, 제품 이름 및 약어를 고정 대상 언어 형식에 매핑하고 ASR 핫워드 목록과 번역 용어집이 하나의 단어 목록을 공유하도록하십시오 - 그래서 인식과 번역은 같은 용어에 동의하며 출력에서 변형되지 않습니다.

Q: 자막 동기화는 어떻게 수행되며, 왜 일부 시스템은 항상 표류합니까?

A: 이 드리프는 일반적으로 두 가지 원인이 있습니다: ASR 와 번역은 자체 버퍼를 가진 별도의 직렬 파이프라인으로 실행되므로 번역이 인식에 뒤쳐지거나, 스피커 세그먼트는 자막 라인에 바인딩되지 않으므로 다중 당사자 대화에서 자막이 잘못된 사람에게 부여됩니다.올바른 접근 방식은 인식, 번역 및 화자 분리 를 하나의 타임라인에 정렬하며, 각 자막 라인은 연사, 타임 스탬프, 소스 텍스트 및 번역을 포함하며, 이 네 가지는 모두 HDMI 출력에 함께 표시됩니다.

Q: 다국어 회의 번역은 어떤 언어를 지원합니까?

A: 인식 측면은 일반적으로 수십 개의 언어와 방언을 다루고, 번역 측면은 더 많은 것을 포함합니다.예를 들어, VoiVision 에서는 30 개 언어에 22 개의 방언을 포함하고, LLM 을 통해 100 개 언어를 다루는 번역 및 요약, 기계 번역은 초당 800 자 이상으로 실행되며, 회의는 출처와 번역이 나란히 포함된 이중 언어 자막을 출력할 수 있습니다.

Q: 다국어 회의 번역에는 인터넷 연결이 필요합니까?

A: 아니요. 언어 검색, ASR, 번역, 요약 및 자막 출력 등 전체 파이프라인은 공개 API 호출 없이 인트라넷에서 오프라인으로 실행되며, 모델 가중치는 오프라인 패키지로 한 번 로드되므로 공기 간격이 많은 환경에 적합합니다.이것이 클라우드 기반 온 - 프레미스 (on - premises) 의 핵심 가치입니다.

Q: 한 시스템에서 동시 다국어 미팅을 처리할 수 있는 수는 몇 개입니까?

A: 하드웨어와 전체 파이프라인 사용 여부에 따라 달라집니다. Pure 음성 전사 와 번역은 높은 동시성을 제공합니다. 일단 화자 분리, 용어 교정 및 요약이 스택되면, 단일 컴퓨터는 여전히 여러 회의가 동시에 진행되고 클러스터는 선형으로 확장됩니다.하드웨어를 정점에 맞게 계획하고 용어 교정 및 요약을 위한 여유를 남겨두십시오.

#다국어 회의#회의 번역#동시 통역 (Simultaneous Interpretation)#오프라인 배포#자막 동기화

개인화 된 데모 예약

회의 시나리오와 규정 준수 요구 사항을 알려주세요 - 맞춤형 계획을 받으십시오.

지금 예약
라이브 채팅