VoiVision AI
tech· VoiVision AI Engineering

Seleção da ASR On-Premise: Auto-Hospedagem de código aberto vs Pacotes privados de nuvem vs Engines comerciais

Compare as três rotas através de linhas vermelhas de conformidade, concurrença e latência, cobertura de idiomas e dialetos, precisão e TCO de três anos - além das cinco barreiras reais para o Whisper self-hosting, o que o MLPS Level 3 realmente exige durante a seleção e uma lista de verificação de fornecedores de oito perguntas prontas para uso.


Comparação de Seleção ASR On-Premise

Não há conceitos aqui - apenas uma pergunta: Qual rota se encaixa no seu cenário?

Isso divide o trabalho de seleção local da ASR realizado em sites de clientes do governo, finanças e energia em uma tabela de decisão, um modelo de custo de três anos e as barreiras reais para a auto-hospedagem de código aberto.

1. A resposta à frente: uma mesa de decisão

Se você tem três ata de reunião, esta mesa é suficiente.

Sua situaçãoRota recomendadaPorquê
Você tem engenheiros de ML, cenário tolera erros (stand-ups internos, legendas)Auto-hospedagem de código aberto (faster-whisper / paraformer)Custo de licença zero, bom o suficiente
Já comprometido com um fornecedor de nuvem, saída de áudio é aceitávelCloud API (em inglês)Mais rápido para lançar, não overbuild
Requisitos de conformidade, mas não classificados, baixa concorrênciaPacote privado de fornecedores de nuvemEntrega rápida, familiar Ecossistema
A residência de dados é uma linha vermelha dura / Xinchuang / classificada / muitos fluxos concorrentesEnginagem on-premise comercialAs outras rotas não conseguem chegar
Mover para aceleradores domésticos (Ascend / Cambricon / Hygon)Motor comercial com suporte nativoTrazê - lo você mesmo é muito caro

Pessoas prioritárias rotineiramente invertidas: a maioria dos compradores compara precisão primeiro, mas o que realmente mata um projeto é geralmente Se os dados podem sair do domínio.

Dois pontos de precisão são sobreviventes; os dados deixando o domínio significa que o projeto nunca é aprovado. Então, a ordem correta é:

  1. Linha vermelha de conformidade (residência de dados, Xinchuang) → elimina metade das opções
  2. Concurrença e latência (quantos streams, em tempo real ou não) → define especificações de hardware
  3. Língua e Dialeto → define a capacidade do motor
  4. precisão → Compare apenas entre opções que passaram 1 - 3
  5. Custo total → último, mas não se esqueça de contar as pessoas

2. On-Premise vs Cloud: Três registros, não apenas segurança

A latência do Ledger

A latência de uma nuvem API é: upload + fila + inferência + retorno.

Uma gravação de uma hora de uma reunião (16 kHz mono, aproximadamente 115 MB) leva 10 segundos para carregar em uma intranet de 100 Mbps; através da internet pública para um endpoint em nuvem, você adiciona jitter em cima. Para o lote transcrição de fala isso não importa. Para as legendas ao vivo é fatal. (em inglês)

O áudio on-premise nunca deixa a NIC, portanto, o RTF de inferência local é todo o orçamento de latência.

Regra geral: se você precisar de legendas ao vivo ou minutos ao vivo, a estrutura de latência da nuvem é estruturalmente desvantajosa - prefira on-premise.

O livro de custos (o que mais frequentemente é mal calculado)

Comparar "preços de nuvem por hora " diretamente com" compra de servidor única " é errado. O TCO de três anos deve incluir:

cenário: 50 horas de áudio de reuniões por dia, dias úteis, horizonte de três anos

Custo itemCloud API (em inglês)Open Source Self-Hosting (em inglês)Enginagem on-premise comercial
transcrição de fala taxasFaturamento por hora, dezenas de milhares ao longo de 3 anos00
Hardware0Servidor de cartão único (one-off)Incluído
Licença de software00 (source aberto)Licença única (por nível de concurrença)
Esforço de Implementação01-2 Pessoas-mesesIncluído
3-Ano de Operação Esforço00,3 - 0,5 FTEPrincipalmente suportado por vendedores
Falha FallbackVendedores SLASobre vocêContratação SLA

Você pode olhar para isso e perguntar: O self-hosting não é o mais barato?

A auto-hosting economiza Taxas de licença e custa pessoas. E que o custo de pessoal é fixo - os modelos precisam ser atualizados, os operadores precisam se adaptar e o novo hardware do cliente significa reconverter os modelos. O FTE de 0,3 a 0,5 acima é conservador; com aceleradores domésticos e implantação com ar-gap, ele vai mais alto.

Em uma linha: Para cenários gerais de baixo volume sem restrições de conformidade, as APIs de nuvem geralmente têm o TCO mais baixo. O ponto de inflexão econômico para o on-premise chega quando a pressão de concurrença é alta ou a conformidade proíbe a nuvem.

O risco Ledger

Difícil de quantificar, mas muitas vezes decisivo:

  • Risco de conectividade - em uma intranet isolada, as opções de nuvem estão imediatamente fora da mesa
  • Vendedor Lock-in - mudar de APIs em nuvem significa refazer a integração; mudar de motores on-premise significa redistribuir
  • Responsabilidade de auditoria - quando algo quebra, com a nuvem é "o problema do vendedor"; auto-hospedado, é seu

3. As barreiras reais para o self-hosting de código aberto

Self-hosting Whisper é um tópico pesquisado, o que lhe diz que muitas equipes estão considerando isso. Nós fizemos isso. Aqui está a versão honesta.

Fazer correr não é difícil

# faster-whisper is the default choice today
pip install faster-whisper

# 8GB VRAM can run large-v3-turbo with INT8 quantization
python -c "
from faster_whisper import WhisperModel
m = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8_float16')
segments, info = m.transcribe('meeting.wav', language='zh')
print(f'language {info.language}, probability {info.language_probability:.2f}')
for s in segments:
    print(f'[{s.start:6.1f}s -> {s.end:6.1f}s] {s.text}')
"

Você pode ter uma demonstração em em dez ata de reunião. Passar da demo para a produção é a parte mais difícil. (em inglês)

5 barreiras que você só encontra na produção

1. Não palavra-chave

O mais doloroso em cenários empresariais. Nomes de empresas, nomes de código de produtos, nomes de pessoas, abreviaturas de projetos - o Whisper os escreverá consistentemente como caracteres semelhantes. O initial_prompt dá apenas orientação fraca, decae em áudio longo e Não impõe nada.

Se as reuniões do seu cliente estiverem cheias de substantivos apropriados, você não evitará isso.

2. Sem separação de falantes incorporado

O sussurro produz texto, não "quem disse isso. "Produzir uma reunião ata de reunião significa adicionar pyannote ou um módulo de separação de alto-falantes NeMo separadamente e alinhar os carimbos de tempo você mesmo. Mais um modelo, mais uma fatia de VRAM, mais uma coisa que pode quebrar.

3. O streaming é uma fraqueza estrutural

O Arquitetura do Whisper não foi projetado para streaming. A solução comum é o streaming por pedaços (feed janelas de 5 a 10 segundos), o que custa Erros de fronteira em pontos de divisão - uma sentença é cortada pela metade, cada metade é transcrita de forma independente, e a costura produz caracteres errados. Experiência pobre para legendas ao vivo.

4. Não há dialetos

O large-v3 tem um token yue (Cantonês), mas a qualidade não está em nenhum lugar perto de pronta para produção. Wu, Min Nan, Sichuanese, Mandarim das Planícies Centrais - nenhum deles é suportado pelos modelos oficiais.

5. Os aceleradores domésticos precisam portá - lo você mesmo

A exportação ONNX do Whisper mais a conversão Ascend ATC funciona, mas você encontrará: versões de opset não suportadas, configuração de eixo dinâmico, falhas silenciosas de operador não suportado e modelos que precisam de reconversão após atualizações de versão. Veja o Ascend 910B private ASR walkthrough para detalhes.

Quando o self-hosting de código aberto é a chamada certa

Ser justo Sobre nós onde se encaixa:

  • Você tem engenheiros de ML que podem modificar modelos
  • O cenário tolera erros (notas de reuniões internas, legendas de vídeo)
  • Mandarin geral, sem pesadas cargas de substantivo próprio
  • Nenhum requisito de tempo real
  • Nenhum mandato de acelerador doméstico

Se todos os cinco mantiverem, a auto-hosting é um excelente valor. Se dois ou mais não o fazem, execute os números de custo de pessoas com cuidado.

4. Comparação de capacidade entre as três rotas

DimensãoOpen Source Self-Hosting (em inglês)Pacote privado de fornecedores de nuvemEnginagem on-premise comercial
Custo da licença0MédioAlta
Esforço de ImplementaçãoAlta (1 - 2 pessoas-meses)Média (1 - 2 semanas)Baixa (entregue pelo vendor)
Precisão chinesa (reuniões)MédioMédio-altoAlta
palavra-chave / Proper NounsNenhum.Sim simSim sim
separação de falantesMódulo separado necessárioSim simConstruída em
Streaming em Tempo RealFraquezaSim simSim
Suporte DialetoEssencialmente nenhumLimitado22
Suporte ao acelerador domésticoPortá - lo você mesmoParcialnativos
Operação Air-gappedPacote você mesmoDepende do vendedorapoiado
MLPS / suporte classificadoSeu próprio papeladoParcialDocumentação fornecida
Responsabilidade OperacionalTotalmente seuvendedorVendedor + SLA

As duas linhas mais frequentemente subestimadas são o esforço de implementação e a responsabilidade das operações. Eles nunca aparecem em uma cotação, mas consomem a equipe continuamente.

5. O que o MLPS nível 3 exige durante a seleção

Esta é a pergunta mais frequente dos clientes do governo e das finanças. Dos requisitos do Nível 3 da MLPS (GB / T 22239 - 2019) para sistemas de gravação e ata de reunião, estes são os que moldam a seleção:

ControleRequisitos MLPS L3A pergunta a fazer
Residência de dadosÁudio e texto armazenados localmente, sem upload públicoQualquer parte da transcrição de fala faz uma chamada de rede pública? - incluindo verificações de licença, downloads de modelos e telemetria
Controle de acessoVerificação de identidade, permissões baseadas em funçõesEle pode se integrar com o nosso LDAP / OAuth existente? "
Auditoria de SegurançaOperações rastreáveis, logs retidosQuem pode exportar ata de reunião? A exportação é registrada? Por quanto tempo os logs são mantidos? "
Criptografia de transporteComunicação interna encriptada"O TLS é imposto na intranet também, ou apenas no lado público? "
Proteção da informação residualOs dados excluídos devem ser irrecuperáveisDepois de excluir uma reunião, os caches do modelo e os arquivos temporários também são limpos? "

O primeiro e o último são os que mais frequentemente se perdem.

Muitas soluções afirmam "sem saída de dados ", mas a validação da licença atinge a internet pública, pesos de modelo para download no primeiro lançamento, e telefones de telemetria Início - Qualquer chamada pública coloca a alegação de não saída em questão durante uma avaliação da MLPS.. Pergunte até que você tenha uma resposta difícil.

Da mesma forma, se "delete meeting" apenas remover uma linha de banco de dados e deixar arquivos intermediários e caches vetoriais no disco, a proteção de informações residuais falha.

Veja o MLPS Level 3 compliance breakdown para os detalhes completos.

6. 8 perguntas para responder antes de escolher

Envie esta lista para os fornecedores ou pergunte à sua própria equipe. Qualquer opção que não possa ser respondida está fora:

  1. O qualquer faz parte do pipeline transcrição de fala fazer uma chamada de rede pública? (Licença, modelo e telemetria contam)
  2. Qual é a contagem de fluxos simultâneos sustentado por servidor? Sustentado, não peak
  3. O palavra-chave é suportado? Constrangimento duro ou orientação suave?
  4. O separação de falantes é Integrado ou adicionado como um módulo separado? Como é tratado o discurso sobreposto?
  5. Quais Dialetos são suportados? O que é a precisão medida? Você pode compartilhar um conjunto de teste?
  6. O Ascend / Cambricon / Hygon (em inglês) é suportado? Nativamente ou portado no local?
  7. A implantação do Air-gapped (em inglês) é suportada? O que o pacote offline contém?
  8. O que Documentação é fornecido para avaliação MLPS? (topologia de implantação, diagrama de fluxo de dados, especificação de log de auditoria)

As questões 1 e 7 são o divisor de águas. Um fornecedor que não consegue responder a essas perguntas não entregou em um ambiente de conformidade real.

7. Quando não ir ao local

Uma palavra contra o nosso próprio interesse, então isso não se lê como um discurso.

Skip on-premise se:

  • O volume diário é pequeno (algumas horas por dia) - a nuvem paga por uso é mais barata e não carrega carga operacional
  • Não há exigência de conformidade - se você pode usar a nuvem, não gaste seis dígitos em servidores por uma sensação de segurança
  • Ninguém na equipe faz operações - depois de entrar no local, atualizações de modelos, falhas de hardware e ajuste de desempenho são todas suas
  • Você precisa de transcrição de fala uma vez - comprar um servidor para transcrever um lote e depois ficar ocioso é um mau comércio

O gatilho certo para on-premise é um Linha vermelha de conformidade ou Pressão competitiva sustentada - não "parece mais seguro. "

8. Como o VoiVision faz isso

O VoiVision constrói a reunião empresarial on-premise transcrição de fala, com a pilha completa desenvolvida internamente desde o frontend de fala até o ASR, separação de alto-falantes e estruturação semântica:

  • 52 anos de PLN da pesquisa NLP, fundada em 1973 como o NEU NLP Lab
  • Mais de 200 documentos publicado (20+ CCF-A), 110+ patentes de invenção (54 concedido)
  • NiuTrans, o mecanismo de tradução automática, usado mais de 100.000 vezes em todo o mundo
  • Inferência 4x mais rápido do que os LLMs de propósito geral tradicionais em hardware equivalente
  • Suporte nativo para Ascend 310P / 910B, Cambricon MLU370 / 590, Hygon DCU e NVIDIA T4 / L4 / A10 / A100, além de operação apenas CPU
  • 22 dialetos, e implantação com espaço aéreo
  • ≥ 98% de precisão transcrição de fala chinesa, com clusters suportando mais de 50 fluxos concorrentes

Utilize as oito perguntas acima como está. Qualquer solução que não possa responder merece uma segunda olhada, não importa quão baixa seja a cotação.

Precisa de uma avaliação em relação ao seu nível de MLPS e meta de concurrença? Book a demo, ou comece com o complete private deployment guide.

FAQ

Q: On-premise ou cloud ASR - qual é melhor?

A: Depende de três condições: volume diário, requisitos de conformidade e pressão de concorrência. Com baixo volume diário e sem restrições de conformidade, as APIs de nuvem geralmente têm um TCO de três anos mais baixo e uma carga operacional muito menor. Quando a residência de dados é uma linha vermelha dura, as regras da Xinchuang se aplicam, ou a pressão de concurrença é sustentada, o on-premise é a chamada certa. O gatilho para o on-premise é uma linha vermelha de conformidade ou concurrença sustentada - não uma sensação vaga de que é mais seguro.

Q: Quais são as barreiras para o self-hosting Whisper?

A: Os cinco principais: Não há suporte palavra-chave (sunsuns apropriados são escritos como caracteres de som semelhante, e initial _ prompt é apenas uma orientação fraca), não há separação de falantes incorporado (você deve adicionar pyannote ou um módulo semelhante e alinhar timestamps sozinho), fluxo fraco (chunking produz erros de fronteira em pontos de divisão), essencialmente não há suporte de dialeto, e aceleradores domésticos exigem porting você mesmo (exportação ONNX mais conversão ATC, com muitas armadilhas).

Q: Como você calcula o TCO de três anos para o ASR on-premise?

A: Não compare as taxas de licença sozinho. Incluir custos por hora de transcrição de fala, hardware, licenciamento de software, esforço de implementação, esforço operacional de três anos e falha de backup. A auto-hospedagem de código aberto economiza em licenciamento, mas custa em pessoas - a implementação normalmente leva de um a dois meses de pessoa e operações em torno de 0,3 a 0,5 FTE, maior quando aceleradores domésticos e implantação de ar-gapped estão envolvidos.

Q: O que o MLPS Nível 3 requer ao selecionar um sistema de reunião ata de reunião?

A: Cinco controlos são importantes: Residência de dados (áudio e texto armazenados localmente, sem upload público), controle de acesso (verificação de identidade e permissões baseadas em funções), auditoria de segurança (operações rastreáveis, logs retidos), criptografia de transporte (comunicação interna criptografada) e proteção de informações residuais (dados excluídos devem ser irrecuperáveis). A questão mais negligenciada e mais crítica é se qualquer parte do pipeline faz uma chamada de rede pública.

Q: Como posso verificar se uma solução on-premise realmente mantém os dados no domínio?

A: Pergunte diretamente se qualquer parte do pipeline transcrição de fala faz uma chamada de rede pública, e inclua explicitamente verificações de licença, downloads de peso de modelo e telemetria. Qualquer chamada pública coloca a alegação de "sem saída de dados" em questão durante uma avaliação da MLPS.

Q: Para 50 horas de reuniões por dia, na nuvem ou no local?

A: Sem restrições de conformidade, a nuvem paga por uso geralmente custa significativamente menos em três anos. Se os requisitos de residência de dados, Xinchuang ou classificados forem aplicados, ou se a pressão de concorrência for sustentada, escolha o local. O ponto de inflexão em termos de economia e conformidade geralmente chega quando a pressão de concorrência ou uma regra de conformidade sem nuvem está presente.

Q: A ASR local suporta a Ascend e outros aceleradores domésticos?

A: Depende da rota. Os modelos de código aberto exigem que você complete a exportação ONNX e a conversão ATC sozinho, o que é um trabalho substancial com muitas armadilhas. Os motores comerciais que suportam nativo Ascend 310P / 910B, Cambricon MLU370 / 590 e Hygon DCU removem esse esforço de portação inteiramente. Confirme sempre se o suporte é nativo ou requer portação no site.

#Implementação on-prem#Seleção ASR#sussurro#MLPS L3 (em inglês)#TCO

Reserve uma demo personalizada

Conte-nos o seu cenário de reunião e as necessidades de conformidade - obtenha um plano personalizado.

Agendar agora
Live Chat