VoiVision AI
tech· VoiVision AI Engineering

Selección de ASR on-premise: auto-hosting de código abierto vs paquetes privados en la nube vs motores comerciales

Compare las tres rutas a través de las líneas rojas de cumplimiento, concurrencia y latencia, cobertura de idiomas y dialectos, precisión y TCO de tres años, además de las cinco barreras reales para el auto-hosting de Whisper, lo que MLPS Nivel 3 realmente exige durante la selección, y una lista de verificación de proveedores de ocho preguntas listas para usar.


Comparación de selección ASR On-Premise

No hay conceptos aquí - sólo una pregunta: ¿Qué ruta se adapta a tu escenario?

Esto descompone el trabajo de selección de ASR en las instalaciones realizadas en sitios de clientes gubernamentales, financieros y energéticos en una tabla de decisión, un modelo de costo de tres años y las barreras reales para el auto-hosting de código abierto.

1. La respuesta al frente: una mesa de decisión

Si tienes tres acta de reunión, esta mesa es suficiente.

Su situaciónRuta recomendada¿Por qué
Tienes ingenieros de ML, escenario que tolera errores (stand-ups internos, subtítulos)Auto-hospedado de código abierto (faster-whisper / paraformer)Cero costo de licencia, lo suficientemente bueno
Ya comprometido con un proveedor de la nube, la salida de audio es aceptableNube APILo más rápido para lanzar, no sobreconstruya
Requisitos de cumplimiento, pero no clasificados, baja concurrenciaPaquete privado de proveedores de nubeEntrega rápida, familiar Ecosistema
La residencia de datos es una línea roja dura / Xinchuang / clasificado / muchos flujos concurrentesMotor on-premise comercialLas otras rutas no pueden llegar
Movimiento a aceleradores nacionales (Ascend / Cambricon / Hygon)Motor comercial con soporte nativoLlevarlo usted mismo es muy caro

Una prioridad las personas rutinariamente invierten: la mayoría de los compradores comparan primero a Precisión, pero lo que realmente mata a un proyecto suele ser Si los datos pueden salir del dominio.

Dos puntos de precisión son supervivivibles; los datos que salen del dominio significan que el proyecto nunca se aprueba. Por lo tanto, el orden correcto es:

  1. Línea roja de cumplimiento (residencia de datos, Xinchuang) → elimina la mitad de las opciones
  2. Concurrencia y latencia (cuántos flujos, en tiempo real o no) → establece especificaciones de hardware
  3. Idioma y dialecto establece la capacidad del motor
  4. Precisión → comparar sólo entre opciones que pasaron 1 - 3
  5. Costo total → último, pero no olvides contar a la gente

2. On-Premise vs Cloud: Tres libros de contabilidad, no solo seguridad

El latencia Ledger

La latencia de una nube API es: upload + queue + inferencia + retorno.

Una grabación de una hora de una reunión (16 kHz mono, aproximadamente 115 MB) toma 10 segundos en Nosotros para cargar a través de una intranet de 100 Mbps; a través de Internet público a un punto final en la nube se agrega jitter en la parte superior. por Para el lote transcripción de voz esto no importa. Para los subtítulos en vivo es fatal.

El audio on-premise nunca sale de la NIC, por lo que la RTF de inferencia local es todo el presupuesto de latencia.

Regla general: si necesita subtítulos en vivo o minutos en vivo, la estructura de latencia en la nube está estructuralmente desvenenada, prefiere on-premise.

El libro mayor de costos (el que más a menudo se calcula mal)

Comparar "precios de la nube por hora " directamente con" compra de servidor única " es incorrecto. El TCO de tres años incluye:

Escenario: 50 horas de audio de reuniones por día, días hábiles, horizonte de tres años

Costo ItemNube APIOpen Source Self-HostingMotor on-premise comercial
transcripción de voz tarifasFacturación por hora, decenas de miles en 3 años00
Hardware0Servidor de tarjeta única (one-off)Incluido
Licencia de software00 (fuente abierta)Licencia única (por nivel de concurrencia)
Esfuerzo de implementación01-2 Personas-mesesIncluido
3-Año de Operaciones Esfuerzo00.3 - 0.5 FTEMayormente soportado por vendedores
Fallo de fallbackVendedor SLASobre tiContrato SLA

Puedes mirar esto y preguntar: ¿No es el auto-hosting el más barato?

No. El auto-hosting ahorra a Tarifas de licencia y cuesta a La gente Y que costo de personal es fijo: los modelos necesitan actualizarse, los operadores necesitan adaptarse, y el nuevo hardware de los clientes significa reconvertir los modelos. El FTE de 0.3 - 0.5 anterior es conservador; con aceleradores domésticos y despliegue con brechas de aire va más alto.

En una sola línea: Para escenarios generales de bajo volumen sin restricciones de cumplimiento, las API de la nube generalmente tienen un TCO más bajo. El punto de inflexión económico para on-premise llega cuando la presión de concurrencia es alta o el cumplimiento prohíbe la nube.

El riesgo Ledger

Difícil de cuantificar, pero a menudo decisivo:

  • Riesgo de conectividad: en una intranet aislada, las opciones de nube están fuera de la mesa inmediatamente
  • Vendedor Lock-in: cambiar las API en la nube significa volver a hacer la integración; cambiar los motores on-premise significa redistribuir
  • Responsabilidad de auditoría - cuando algo se rompe, con la nube es "el problema del vendedor"; auto-alojado, es tuyo

3. Las barreras reales para el auto-hospedado de código abierto

Self-hosting Whisper es un tema muy buscado, lo que le dice que muchos equipos lo están considerando. Lo hemos hecho. Aquí está la versión honesta.

Hacer correr no es difícil

# faster-whisper is the default choice today
pip install faster-whisper

# 8GB VRAM can run large-v3-turbo with INT8 quantization
python -c "
from faster_whisper import WhisperModel
m = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8_float16')
segments, info = m.transcribe('meeting.wav', language='zh')
print(f'language {info.language}, probability {info.language_probability:.2f}')
for s in segments:
    print(f'[{s.start:6.1f}s -> {s.end:6.1f}s] {s.text}')
"

Puedes tener una demostración que se ejecuta en diez acta de reunión. por Pasar de la demo a la producción es lo más difícil.

Cinco barreras que solo encuentras en la producción

1. No hay palabra clave

El más doloroso en los escenarios empresariales. Nombres de empresas, nombres en clave de productos, nombres de personas, abreviaturas de proyectos: Whisper los escribirá consistentemente como caracteres de sonido similar. initial_prompt sólo da una guía débil, decae en audio largo, y No impone nada.

Si las reuniones de sus clientes están llenas de sustantivos propios, no evitará esto.

2. Sin separación de hablantes incorporado

Whisper emite texto, no "quién lo dijo. Producir una reunión acta de reunión significa agregar pyannote o un módulo de separación de altavoces NeMo por separado y alinear las marcas de tiempo usted mismo. Un modelo más, una porción más de VRAM, una cosa más que puede romperse.

3. El streaming es una debilidad estructural

Whisper 's Arquitectura no fue diseñado para la transmisión. La solución común es la transmisión por pedazos (alimentación de ventanas de 5 a 10 segundos), que cuesta Errores de límite en puntos de división: una oración se corta a la mitad, cada mitad se transcribe de forma independiente, y la costura produce caracteres incorrectos. Poca experiencia para subtítulos en vivo.

4. Casi ningún dialecto

large-v3 tiene un token yue (Cantonés), pero la calidad no está lista para la producción. Wu, Min Nan, Sichuanese, Mandarin de las Llanuras Centrales - ninguno de ellos es compatible con los modelos oficiales.

5. Los aceleradores domésticos requieren portarlo usted mismo

La exportación ONNX de Whisper más la conversión Ascend ATC funciona, pero encontrará: versiones de opset no compatibles, configuración de eje dinámico, fallas silenciosas de operadores no compatibles y modelos que necesitan reconversión después de actualizaciones de versión. Véase el Ascend 910B private ASR walkthrough para detalles.

Cuando el auto-hosting de código abierto es la llamada correcta

Ser justo Nosotros donde encaja:

  • Hay ingenieros de ML que pueden modificar los modelos
  • El escenario tolera errores (notas de reuniones internas, subtítulos de video)
  • Mandarín general, sin pesadas cargas de sustantivo propio
  • No requiere tiempo real
  • Ningún mandato de acelerador doméstico

Si los cinco se mantienen, el auto-hosting es un excelente valor. Si dos o más no lo hacen, ejecute cuidadosamente los números de costo de personas.

4. Comparación de capacidades en las tres rutas

DimensiónOpen Source Self-HostingPaquete privado de proveedores de nubeMotor on-premise comercial
Costo de licencia0MediumAlta
Esfuerzo de implementaciónAlta (1 - 2 personas-meses)Mediano (1 - 2 semanas)Bajo (entregue por el proveedor)
Precisión china (reuniones)MediumMediano-altoAlta
palabra clave / Sustantivos PropiosNingunoSíSí
separación de hablantesSe requiere un módulo separadoSíConstruido en
Streaming en tiempo realdébilesSíSí
Soporte dialectalEsencialmente ningunoLimitación22
Apoyo al acelerador domésticoPortarlo usted mismoparcialnativos
Operaciones Air-gappedPaquete usted mismoDepende del vendedorApoyado
MLPS / soporte clasificadoTu propio papeleoparcialDocumentación proporcionada
Operaciones ResponsabilidadTotalmente suyoVendedorVendedor + SLA

Las dos líneas más a menudo subestimadas son el esfuerzo de implementación y la responsabilidad de las operaciones. Nunca aparecen en una cotización, pero consumen al equipo continuamente.

5. Lo que exige el nivel 3 de MLPS durante la selección

Esta es la pregunta más frecuente de los clientes gubernamentales y financieros. De los requisitos del Nivel 3 de MLPS (GB / T 22239 - 2019) para los sistemas de registro y de acta de reunión, estos son los que dan forma a la selección:

El controlRequisitos de MLPS L3La pregunta a hacer
Datos de residenciaAudio y texto almacenados localmente, sin carga pública¿Alguna parte de transcripción de voz hace una llamada a la red pública? - incluidos los controles de licencias, descargas de modelos y telemetría
Control de accesoVerificación de identidad, permisos basados en roles¿Puede integrarse con nuestro LDAP / OAuth existente? "
Auditoría de seguridadOperaciones rastreables, registros retenidos¿Quién puede exportar acta de reunión?¿Está registrada la exportación?¿Cuánto tiempo se mantienen los logs? "
Encriptación de transporteComunicación interna encriptada"¿Se aplica TLS también en la intranet, o solo en el lado público? "
Protección de la información residualLos datos eliminados deben ser irrecuperablesDespués de eliminar una reunión, ¿también se borran los archivos temporales y los cachés de modelos? "

El primero y el último son los que más se pierden.

Muchas soluciones afirman "no salida de datos", sin embargo, la validación de la licencia llega a la Internet pública, los pesos del modelo descargar en el primer lanzamiento, y los teléfonos de telemetría Inicio - Cualquier llamada pública pone en duda la reclamación de no salida durante una evaluación de MLPS.. Pregunte esto hasta que obtenga una respuesta dura.

Del mismo modo, si "eliminar reunión" sólo elimina una fila de la base de datos y deja archivos intermedios y caché de vectores en el disco, la protección de la información residual falla.

Vea el MLPS Level 3 compliance breakdown para el detalle completo.

6. 8 preguntas que debes responder antes de elegir

Envíe esta lista a los proveedores, o pregunte a su propio equipo. Cualquier opción que no pueda responder está fuera:

  1. ¿cualquiera parte de la tubería transcripción de voz hace una llamada a la red pública? (Licencia, modelo y telemetría todos cuentan)
  2. ¿Cuál es el conteo de flujos concurrentes de sostenido por servidor? Sostenido, no peak
  3. ¿Es compatible con palabra clave?¿Constracción dura o orientación suave?
  4. ¿Es separación de hablantes Integrado, o añadido como un módulo separado?¿Cómo se maneja el discurso de superposición?
  5. ¿Qué Los dialectos son compatibles?¿Qué es la precisión medida?¿Puedes compartir una prueba?
  6. ¿Es compatible con Ascend / Cambricon / Hygon?¿Nato o portado en el sitio?
  7. ¿Es compatible el despliegue de Air-gapped?¿Qué contiene el paquete offline?
  8. ¿Qué se proporciona Documentación para la evaluación de MLPS? (topología de despliegue, diagrama de flujo de datos, especificación de registro de auditoría)

Las preguntas 1 y 7 son el punto de partida. Un vendedor que no puede responderlas no ha entregado en un entorno de cumplimiento real.

7. Cuándo no ir a la premisa

Una palabra en contra de nuestro propio interés, por lo que esto no se lee como un discurso.

Skip on-premise si:

  • El volumen diario es pequeño (un par de horas al día): la nube de pago por uso es más barata y no implica ninguna carga de operaciones
  • No hay requisitos de cumplimiento: si puede usar la nube, no gaste seis cifras en servidores por una sensación de seguridad
  • Nadie en el equipo realiza operaciones - después de ir en las instalaciones, las actualizaciones de modelos, fallos de hardware y ajuste de rendimiento son todos suyos
  • Necesitas transcripción de voz una vez: comprar un servidor para transcribir un lote y luego dejarlo inactivo es un mal comercio

El desencadenante adecuado para las instalaciones es un Línea roja de cumplimiento o Presión competitiva sostenida - no "se siente más seguro. "

8. Cómo lo hace VoiVision

VoiVision construye la reunión empresarial on-premise transcripción de voz, con la pila completa desarrollada internamente desde el frontend de voz a través de ASR, separación de altavoces y estructuración semántica:

  • 52 años de PNL de investigación de NLP, fundada en 1973 como el NEU NLP Lab
  • 200+ documentos publicado (20+ CCF-A), 110+ patentes de invención (54 concedido)
  • NiuTrans, el motor de traducción automática, utilizado más de 100.000 veces en todo el mundo
  • Inferencia 4x más rápido que los LLM de propósito general convencionales en hardware equivalente
  • Soporte nativo para Ascend 310P / 910B, Cambricon MLU370 / 590, Hygon DCU y NVIDIA T4 / L4 / A10 / A100, además de operación solo CPU
  • 22 dialectos, y despliegue con espacio aéreo
  • ≥ 98% de precisión transcripción de voz china, con clústeres que soportan más de 50 flujos concurrentes

Utilice las ocho preguntas anteriores tal como están. Cualquier solución que no pueda responderles merece una segunda mirada, no importa cuán baja sea la cotización.

¿Necesita una evaluación contra su nivel de MLPS y su objetivo de concurrencia? Book a demo, o empieza con el complete private deployment guide.

FAQ

Q: On-premise o cloud ASR: ¿cuál es mejor?

A: Depende de tres condiciones: volumen diario, requisitos de cumplimiento y presión de concurrencia. Con un bajo volumen diario y sin restricciones de cumplimiento, las API en la nube generalmente tienen un TCO de tres años más bajo y una carga operativa mucho menor. Cuando la residencia de datos es una línea roja dura, se aplican las reglas de Xinchuang, o se mantiene la presión de concurrencia, on-premise es la opción correcta. El desencadenante para el on-premise es una línea roja de cumplimiento o concurrencia sostenida, no una vaga sensación de que es más seguro.

Q: ¿Cuáles son las barreras para el auto-hosting de Whisper?

A: Los cinco principales: No hay soporte de palabra clave (los sustantivos apropiados se escriben como caracteres de sonido similar, y initial _ prompt es solo una guía débil), no hay separación de hablantes incorporado (debe agregar pyannote o un módulo similar y alinear las marcas de tiempo usted mismo), transmisión débil (el chunking produce errores de límite en los puntos de división), esencialmente no hay soporte de dialectos, y los aceleradores nacionales requieren portarse a sí mismos (exportación ONNX más conversión ATC, con muchos problemas).

Q: ¿Cómo se calcula el TCO de tres años para ASR on-premise?

A: No compares las tarifas de licencia por sí solas. Incluye el costo por hora de transcripción de voz, hardware, licencias de software, esfuerzo de implementación, esfuerzo de operaciones de tres años y retroceso por fallas. El auto-hosting de código abierto ahorra en licencias, pero cuesta en personas: la implementación suele tomar de uno a dos meses de persona y las operaciones alrededor de 0,3 a 0,5 FTE, más alto cuando se involucran aceleradores nacionales y despliegue con brechas de aire.

Q: ¿Qué requiere MLPS Nivel 3 al seleccionar un sistema de reuniones acta de reunión?

A: Cinco controles importan: Residencia de datos (audio y texto almacenados localmente, sin carga pública), control de acceso (verificación de identidad y permisos basados en roles), auditoría de seguridad (operaciones trazables, registros retenidos), encriptación de transporte (comunicación interna encriptada) y protección de información residual (los datos eliminados deben ser irrecuperables). La pregunta más pasada por alto y más crítica es si alguna parte del oleoducto realiza una llamada a la red pública.

Q: ¿Cómo puedo verificar si una solución on-premise realmente mantiene los datos en el dominio?

A: Pregunte directamente si alguna parte de la tubería transcripción de voz realiza una llamada a la red pública, e incluya explícitamente las comprobaciones de licencias, descargas de peso de modelo y telemetría. Cualquier convocatoria pública pondrá en duda la afirmación de "no salida de datos" durante una evaluación de MLPS.

Q: ¿Para 50 horas de reuniones al día, en la nube o en las instalaciones?

A: Sin restricciones de cumplimiento, la nube de pago por uso suele costar significativamente menos en tres años. Si se aplican requisitos de residencia de datos, Xinchuang o clasificados, o si se mantiene la presión de concurrencia, elija on-premise. El punto de inflexión tanto en la economía como en el cumplimiento generalmente llega cuando hay presión de concurrencia o una regla de cumplimiento sin nube.

Q: ¿El ASR local admite a Ascend y a otros aceleradores nacionales?

A: Depende de la ruta. Los modelos de código abierto requieren que complete la exportación ONNX y la conversión ATC usted mismo, lo que es un trabajo sustancial con muchas dificultades. Los motores comerciales que soportan de forma nativa Ascend 310P / 910B, Cambricon MLU370 / 590 y Hygon DCU eliminan ese esfuerzo de portabilidad por completo. Confirme siempre si el soporte es nativo o requiere un portaje en el sitio.

#Despliegue on-prem#Selección ASR#El susurro#El MLPS L3#TCO

Escribir una demo personalizada

Cuéntanos su escenario de reunión y sus necesidades de cumplimiento - obtenga un plan a medida.

Reservar ahora
Chat en vivo