온 - 프레미스 ASR 선택: 오픈 소스 셀프 호스팅 vs 클라우드 사설 패키지 vs 상업용 엔진
컴플라이언스 레드 라인, 동시 및 지연 시간, 언어 및 방언 적용 범위, 정확성 및 3 년 TCO 에 이르는 세 가지 경로를 비교해 보세요. 또한 Whisper 자체 호스팅에 대한 5 가지 실제 장벽, 선택 시 MLPS Level 3 의 실제 요구 사항, 8 가지 질문으로 구성된 공급업체 체크리스트를 모두 준비해 보십시오.

여기에 개념이 없습니다 - 하나의 질문: 어떤 경로가 당신의 시나리오에 맞는지.
이는 정부, 금융 및 에너지 고객 사이트에서 수행된 온 - 프레미스 ASR 선택 작업을 결정 테이블, 3 년 비용 모델 및 오픈 소스 셀프 호스팅에 대한 실제 장벽으로 분석합니다.
1.정렬: 순위 The Answer Up Front: One Decision Table
만약 당신이 3 개의 회의록 를 가지고 있다면, 이 테이블은 충분합니다.
| 당신의 상황 | 추천 경로 | 왜? |
|---|---|---|
| ML 엔지니어가 있고, 시나리오는 오류를 허용합니다 (내부 스탠드업, 자막) | 오픈소스 자체 호스팅 (faster-whisper / Paraformer) | 라이센스 비용 제로, 충분히 좋습니다. |
| 이미 하나의 클라우드 공급업체에 대한 약속을 이행하고 있으며, 오디오 출구는 허용됩니다. | 클라우드 API | 가장 빠른 시작, 과잉 구축하지 마십시오. |
| 규정 준수를 요구하지만 분류되지 않으며 동시작업률이 낮습니다. | 클라우드 공급업체 개인 패키지 | 빠른 배송, 친숙한 에코시스템 |
| 데이터 레지던스는 단단한 빨간색 라인 / 신창 / 분류 / 많은 동시 스트림 | 상용 온 - 프레미스 엔진 | 다른 경로는 갈 수 없다. |
| 국내 가속기 (Ascend / Cambricon / Hygon) | 네이티브 지원이 있는 상용 엔진 | 직접 옮기는 것은 매우 비싸다. |
우선 순위 중 하나는 일상적으로 반전됩니다.: 대부분의 구매자는 정확성 를 먼저 비교하지만 실제로 프로젝트를 죽이는 것은 일반적으로 데이터가 도메인을 떠날 수 있는지 여부 입니다.
두 개의 정확도 포인트는 생존 가능하며, 데이터가 도메인을 떠나는 것은 프로젝트가 승인되지 않는다는 것을 의미합니다.따라서 올바른 순서는 다음과 같습니다. The correct order is:
- 규정 준수 Red Line (데이터 레지던스, 신창) → 옵션의 절반을 완전히 제거
- 동시 및 대기 시간 (얼마나 많은 스트림, 실시간 또는 그렇지 않음) → 하드웨어 사양 설정
- 언어와 방언 → 엔진 기능 설정
- 정확성 Accuracy → 1 - 3 을 통과한 옵션 중만 비교
- 총 원가 → 마지막, 하지만 사람들을 계산하는 것을 잊지 마십시오.
2.온 - 프레미스 대 클라우드: 보안뿐만 아니라 세 가지 원장
지연 시간 원장 (Latency Ledger)
클라우드 API 의 대기 시간은: upload + queue + inference + return 입니다.
1 시간 회의 녹음 (16 kHz 모노, 약 115 MB) 은 100 Mbps 인트라넷을 통해 회사 소개 에서 10 초 동안 업로드됩니다; 공용 인터넷을 통해 클라우드 엔드포인트로 업로드하면 지터가 추가됩니다. Batch 음성 전사 의 경우 이것은 중요하지 않습니다.라이브 캡션으로, 그것은 치명적입니다.
온 - 프레미스 오디오는 NIC 를 떠나지 않으므로 로컬 추론 RTF 는 전체 지연 시간 예산입니다.
일반적인 규칙: 라이브 캡션 또는 라이브 회의록 가 필요한 경우 클라우드 지연 구조는 구조적으로 불리합니다 - 온 - 프레미스를 선호합니다.
원가 원장 (가장 자주 잘못 계산되는 원장)
"클라우드 시간당 가격" 과 "일회성 서버 구매" 를 직접 비교하는 것은 잘못된 것입니다. 3 년 TCO 에는 다음이 포함되어야 합니다.
시나리오: 업무일, 3 년 동안 매일 50 시간의 회의 오디오.
| 원가 항목 | 클라우드 API | 오픈소스 자체 호스팅 | 상용 온 - 프레미스 엔진 |
|---|---|---|---|
| 음성 전사 수수료 | 시간당 청구, 3 년 동안 수만 달러 | 0 | 0 |
| 하드웨어 | 0 | 단일 카드 서버 (일회용) | 포함됨 |
| 소프트웨어 라이센스 | 0 | 0 (오픈 소스) | 1 회 라이센스 (동시 계층별) |
| 구현 노력 | 0 | 1-2사람 - 월 | 포함됨 |
| 3-연간 운영 노력 | 0 | 0. 3 - 0. 5 FTE | 대부분 공급업체 지원 |
| 장애 복구 | 공급업체 SLA | On You 에 대하여 | 계약 SLA |
당신은 이것을보고 물어볼 수 있습니다: 자영업이 제일 저렴하지 않나요?
아니요. 셀프 호스팅은 라이센스 수수료 를 절약하고 사람들이 의 비용을 절감합니다.그리고 인건비 는 고정되어 있습니다 - 모델은 업그레이드가 필요하고, 운영자는 적응해야하며, 새로운 고객 하드웨어는 모델을 다시 변환하는 것을 의미합니다.위의 0. 3 - 0. 5 FTE 는 보수적이다; 국내 가속기 및 공기 간격 배포를 사용하면 더 높습니다.
한 줄에서: 규정 준수 제약이 없는 대용량 일반적인 시나리오의 경우 클라우드 API 는 일반적으로 TCO 가 낮습니다.온 - 프레미스 경제의 전환점은 동시성 압력이 높거나 규정 준수가 클라우드를 금지할 때 발생합니다.
위험 원장 (Risk Ledger)
정량화하기 어렵지만 종종 결정적입니다.
- 연결성 위험 - 격리된 인트라넷에서 클라우드 옵션이 즉시 사용할 수 있음
- 공급업체 잠금 - 클라우드 API 전환은 통합을 다시 수행하고, 온 - 프레미스 엔진 전환은 재배포를 의미합니다.
- 감사 책임 - 어떤 것이 고장 났을 때, 클라우드에서는 "벤더의 문제"; 자체 호스팅, 그것은 당신의 것입니다.
3.오픈소스 셀프호스팅에 대한 진정한 장벽
자체 호스팅 Whisper 는 많은 팀이 그것을 고려하고 있음을 알려주는 많은 검색 주제입니다. 우리는 그것을했습니다. 여기에 정직한 버전입니다.
그것을 실행하는 것은 어렵지 않다.
# faster-whisper is the default choice today
pip install faster-whisper
# 8GB VRAM can run large-v3-turbo with INT8 quantization
python -c "
from faster_whisper import WhisperModel
m = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8_float16')
segments, info = m.transcribe('meeting.wav', language='zh')
print(f'language {info.language}, probability {info.language_probability:.2f}')
for s in segments:
print(f'[{s.start:6.1f}s -> {s.end:6.1f}s] {s.text}')
"
10 회의록 에서 실행되는 데모를 가질 수 있습니다. 데모에서 프로덕션으로 전환하는 것은 어려운 부분입니다.
생산에서 만 만나는 5 가지 장애물
1.아니오 핫워드
엔터프라이즈 시나리오에서 가장 고통스러운 것입니다.회사 이름, 제품 코드 이름, 사람 이름, 프로젝트 약어 - Whisper 는 지속적으로 비슷한 소리 문자로 작성합니다. initial_prompt 는 약한 지침을 제공하며 긴 오디오에서 쇠퇴하며 아무것도 강요하지 않는다. 를 제공합니다.
고객의 회의가 적절한 명사로 가득 차 있다면, 당신은 이것을 피할 수 없습니다.
2.기본 제공 화자 분리 없음
Whisper 는 텍스트를 출력하며, "누가 그것을 말했는지가 아닙니다. "회의록 회의 제작은 pyannote 또는 NeMo 스피커 분리 모듈을 별도로 추가하고 직접 타임 스탬프를 정렬하는 것을 의미합니다.모델 하나 더, VRAM 하나 더, 깨질 수 있는 것 하나 더.
3.스트리밍은 구조적 약점입니다.
Whisper 의 아키텍처 는 스트리밍용으로 설계되지 않았습니다.일반적인 해결 방법은 분할점의 경계 오류 의 비용이 드는 덩크 스트리밍 (피드 5 - 10 초 창) 입니다 - 문장은 절반으로 잘라지고 각 절반은 독립적으로 전사되며 이음매는 잘못된 문자를 생성합니다.라이브 캡션에 대한 경험이 좋지 않습니다.
4.기본적으로 방언이 없습니다.
large-v3 에는 yue (광둥어) 토큰이 있지만 품질은 생산 준비가되어 있지 않습니다. Wu, Min Nan, Sichuanese, Central Plains Mandarin - 공식 모델에서 지원되지 않습니다.
5.국내 가속기는 직접 포팅해야 합니다.
Whisper 의 ONNX 내보내기 및 Ascend ATC 변환은 작동하지만 지원되지 않는 오셋 버전, 동적 축 구성, 지원되지 않는 연산자 실패 및 버전 업그레이드 후 재 변환이 필요한 모델이 발생합니다.자세한 내용은 Ascend 910B private ASR walkthrough 를 참조하세요.
오픈 소스 셀프 호스팅이 올바른 전화일 때
공정한 회사 소개 가 맞는 곳:
- 모델을 수정할 수 있는 ML 엔지니어가 있습니다.
- 시나리오에 오류 허용 (내부 회의 노트, 비디오 자막)
- 일반 Mandarin, heavy proper-noun loads 없이
- 실시간 요구 사항 없음
- 국내 가속기 의무 없음
다섯 가지 모두 유지한다면, 셀프 호스팅은 훌륭한 가치입니다.두 명 이상이 그렇지 않으면 인적 비용 수치를 신중하게 실행하십시오.
4. 3 개 경로에서의 성능 비교
| 치수 | 오픈소스 자체 호스팅 | 클라우드 공급업체 개인 패키지 | 상용 온 - 프레미스 엔진 |
|---|---|---|---|
| 라이센스 비용 | 0 | 미디엄 | 높은 |
| 구현 노력 | 높은 (1 - 2 인 - 개월) | 중간 (1 - 2 주) | 낮은 (vendor-delivered) |
| 중국어 정밀도 (회의) | 미디엄 | 중간 - 높음 | 높은 |
| 핫워드 / 고유명사 | 없음 없음 | 예 예 | 예 예 |
| 화자 분리 | 별도의 모듈 필요 | 예 예 | 내장된 |
| 실시간 스트리밍 | 약한 | 예 예 | 예 |
| 방언 지원 | 본질적으로 None | 제한된 | 22 |
| 국내 가속기 지원 | 직접 Port It Yourself | 부분적 | 원주민 |
| 공기 간격 작업 | 직접 포장해 주세요. | 공급업체에 따라 달라집니다. | 지원되는 |
| MLPS / 분류 지원 | 자신의 문서 | 부분적 | 제공된 문서 |
| 운영 책임 | 완전히 yours | 공급업체 | 공급업체 + SLA |
가장 자주 과소평가되는 두 가지 요소는 구현 노력과 운영 책임입니다.그들은 결코 견적에 나타나지 않지만, 그들은 지속적으로 팀을 소비합니다.
5.선택 중에 MLPS 레벨 3 의 요구 사항
이것은 정부와 금융 고객으로부터 가장 일반적인 질문입니다.회의 기록 및 회의록 시스템을위한 MLPS 레벨 3 요구 사항 (GB / T 22239 - 2019) 중에서, 이들은 선택을 형성하는 것입니다:
| 제어 | MLPS L3 요구 사항 | 질문하기 The question to ask |
|---|---|---|
| 데이터 레지던스 | 로컬로 저장된 오디오 및 텍스트, 공개 업로드 없음 | "음성 전사 의 어떤 부분이 공개 네트워크에 전화를 걸는가?라이센스 검사, 모델 다운로드 및 원격 측정 포함 |
| 액세스 제어 | ID 확인, 역할 기반 권한 | 기존 LDAP / OAuth 와 통합할 수 있습니까? " |
| 보안 감사 | 추적 가능한 작업, 로그 보존 | "누가 회의록 를 수출 할 수 있습니까?내보내기가 로그되었습니까?로그는 얼마나 오래 보관되나요? " |
| 전송 암호화 | 암호화된 내부 통신 | "TLS 는 인트라넷에서도 시행되는가, 아니면 공용 측면에서만 시행되는가? " |
| 잔류 정보 보호 | 삭제된 데이터는 복구할 수 없습니다. | "미팅을 삭제한 후 모델 캐시 및 임시 파일도 지워지나요?" " |
첫 번째와 마지막은 가장 자주 놓친 것입니다.
많은 솔루션은 "데이터 유출 없음" 을 주장하지만 라이센스 검증은 공개 인터넷에 도달하고 첫 번째 출시 시 모델 가중치를 다운로드하며 홈 - 단일 공개 전화는 MLPS 평가 중에 출구 금지 주장에 의문을 제기합니다. 전화의 원격 측정에 도달합니다.어려운 답변을 얻을 때까지 이 질문을 해보세요.
마찬가지로, "미팅 삭제" 가 데이터베이스 행만 제거하고 중간 파일과 벡터 캐시를 디스크에 남긴 경우 잔류 정보 보호가 실패합니다.
자세한 내용은 MLPS Level 3 compliance breakdown 를 참조하십시오.
6.선택하기 전에 대답해야 할 8 가지 질문
이 목록을 공급업체에게 보내거나 자신의 팀에 문의하십시오.답변할 수 없는 옵션은 제외됩니다.
- 음성 전사 파이프 라인의 일부인 어떤 가 공용 네트워크 호출을 수행합니까? (라이센스, 모델 및 원격 측정은 모두 계산)
- 서버당 지속하다. 동시 스트림 수는 얼마입니까?피크가 아닌 지속
- 핫워드 가 지원됩니까?하드 제한 또는 부드러운 지침?
- 화자 분리 내장, 또는 별도의 모듈로 추가?겹치는 연설은 어떻게 처리됩니까?
- 어떤 방언 가 지원됩니까?측정된 정확도는 무엇인가요?테스트 세트를 공유할 수 있나요?
- Ascend / Cambricon / Hygon 가 지원됩니까?본국적으로, 또는 사이트에서 포팅?
- 공기 틈이 끼다. 배포가 지원됩니까?오프라인 번들에는 무엇이 포함되어 있나요?
- MLPS 평가에 문서화 가 제공되는 것은 무엇입니까? (배포 위상, 데이터 흐름 다이어그램, 감사 로그 사양)
질문 1 과 7 은 분수점입니다.이러한 질문에 답할 수 없는 공급업체는 실제 규정 준수를 준수하는 환경에서 제공하지 않습니다.
7. On - premise 가 아닌 경우
우리 자신의 이익에 반대하는 단어, 그래서 이것은 피치로 읽지 않습니다.
다음과 같은 경우 온 - 프레미스 건너뛰기
- 일일 볼륨은 작다. (하루 몇 시간) - 사용량당 유료 클라우드, 운영 부담 없이 저렴한 비용
- 규정 준수 요구 사항 없음 - 클라우드를 사용할 수 있다면 보안을 위해 서버에 6 자릿수 지출하지 마십시오.
- 팀에서는 아무도 수술을 하지 않는다. - 온 - 프레미스 전환 후 모델 업그레이드, 하드웨어 장애 및 성능 튜닝을 모두 수행할 수 있습니다.
- 음성 전사 한 번 필요 - 서버를 구입하여 하나의 배치를 기록한 다음 유휴 상태가 되는 것은 나쁜 거래입니다.
온 - 프레미스에 대한 올바른 트리거는 규정 준수를 위한 빨간색 라인 또는 지속적인 동시작업 압력 입니다 - "더 안전하다고 느낍니다. "
8. VoiVision 는 어떻게
VoiVision 는 엔터프라이즈 온 - 프레미스 미팅 음성 전사 를 구축하며, 음성 프런트엔드에서 ASR, 스피커 분리 및 의미 구조화를 통해 사내에서 개발된 전체 스택을 갖습니다.
- NLP 연구의 52년 NLP, 1973 년 NEU NLP Lab 로 설립
- 200+ 논문 출판 (20+ CCF - A), 110 개 이상의 발명 특허 (54 부여)
- NiuTrans, 기계 번역 엔진, 전 세계적으로 100, 000 번 이상 사용
- 동등한 하드웨어에서 일반 LLM 보다 4 배 빠른 속도 추론
- Ascend 310 P / 910 B, Cambricon MLU370 / 590, Hygon DCU 및 NVIDIA T4 / L4 / A10 / A100 에 대한 기본 지원 및 CPU 전용 작동
- 22 개의 방언, 공기 간격 배포
- ≥ 98% 중국어 음성 전사 정확도, 50 개 이상의 동시 스트림을 지원하는 클러스터
위의 여덟 가지 질문을 그대로 사용하십시오.그들에게 대답 할 수없는 모든 해결책은 견적이 얼마나 낮더라도 두 번째 검토를 할 가치가 있습니다.
MLPS 수준 및 동시작업 목표에 대한 평가가 필요하십니까? Book a demo 또는 complete private deployment guide 로 시작합니다.
FAQ
Q: 온 - 프레미스 또는 클라우드 ASR - 어느 것이 더 좋습니까?
A: 일일 볼륨, 규정 준수 요구 사항 및 동시작업 압력 등 세 가지 조건에 따라 달라집니다.일일 볼륨이 낮고 규정 준수 제약이 없는 클라우드 API 는 일반적으로 3 년간의 TCO 가 낮고 운영 부담이 훨씬 줄어듭니다.데이터 레지던스 (Data Residency) 가 어려운 경계선이고, 신창 (Xinchuang) 규칙이 적용되거나, 동시작업 압력이 지속될 경우, 온 - 프레미스 (On - premises) 가 올바른 선택입니다.온 - 프레미스 구축을 위한 트리거는 규정 준수를 위한 적색 라인이나 지속적인 동시작업성입니다. 이는 보다 안전한 것으로 추정되는 모호한 느낌이 아닙니다.
Q: Self-Hosting Whisper 에 대한 장벽은 무엇입니까?
A: 다섯 가지 주요한 것들: no 핫워드 support (proper nouns get written as similar-sounding characters, and initial _ prompt is only weak guidance), no built - in 화자 분리 (you must add pyannote or a similar module and align timestamps yourself), weak streaming (chunking produces boundary errors at split points), no dialect support, and domestic accelerators require porting yourself (ONNX export plus ATC conversion, with plenty of pitfalls).
Q: 온 - 프레미스 ASR 의 3 년 TCO 를 어떻게 계산합니까?
A: 라이센스 수수료만 비교하지 마세요.시간당 음성 전사 비용, 하드웨어, 소프트웨어 라이센스, 구축 작업, 3 년 운영 작업 및 장애 복구 등오픈 소스 셀프 호스팅은 라이센스 비용을 절감하지만 인력 비용을 절감합니다 - 구현은 일반적으로 1 ~ 2 개월 인력 소요되며 운영 시간은 약 0. 3 ~ 0. 5 FTE 이며 국내 가속기 및 에어 가이프 배포가 포함될 경우 더 높습니다.
Q: 회의 회의록 시스템을 선택할 때 MLPS 레벨 3 에 필요한 것은 무엇입니까?
A: 다섯 가지 통제가 중요하다: 데이터 주거 (오디오 및 텍스트가 로컬로 저장되며 공개 업로드가 없음), 액세스 제어 (ID 확인 및 역할 기반 권한), 보안 감사 (추적 가능한 작업, 로그 보존), 전송 암호화 (암호화된 내부 통신), 잔여 정보 보호 (삭제된 데이터는 복구할 수 없어야 함)가장 간과되고 가장 중요한 질문은 파이프 라인의 어느 부분이 공용 네트워크 호출을하는지 여부입니다.
Q: 온 - 프레미스 솔루션이 실제로 데이터를 도메인에 보관하는지 어떻게 확인할 수 있습니까?
A: 음성 전사 파이프 라인의 어떤 부분이 공용 네트워크 호출을 하는지 직접 물어보고 라이센스 검사, 모델 무게 다운로드 및 원격 측정 등을 명시적으로 포함합니다.단일 공개 요청은 MLPS 평가 중에 "데이터 유출 없음" 주장에 의문을 제기 할 것입니다.
Q: 매일 50 시간의 회의, 클라우드 또는 온 - 프레미스?
A: 규정 준수 제약이 없는 유료 클라우드는 일반적으로 3 년 동안 비용이 상당히 낮습니다.데이터 주거, 신창 또는 분류 요구 사항이 적용되거나 동시작업 압력이 지속되는 경우 온 - 프레미스를 선택하십시오.경제성과 규정 준수의 전환점은 일반적으로 동시성 압력이나 클라우드 없는 규정 준수 규칙이 존재할 때 발생합니다.
Q: 온 - 프레미스 ASR 는 Ascend 및 기타 국내 가속기를 지원합니까?
A: 그것은 경로에 달려있다.오픈소스 모델에서는 ONNX 내보내기와 ATC 변환을 직접 완료해야 하며, 이는 많은 함정이 있는 상당한 작업입니다. Ascend 310 P / 910 B, Cambricon MLU370 / 590 및 Hygon DCU 를 기본적으로 지원하는 상용 엔진은 이러한 포팅 작업을 완전히 제거합니다.지원이 기본인지 또는 현장 포팅이 필요한지 항상 확인합니다.
