Sélection ASR sur site: auto-hébergement open source vs Cloud Private Packs vs moteurs commerciaux
Comparez les trois itinéraires à travers les lignes rouges de conformité, la concurrence et la latence, la couverture linguistique et dialectale, la précision et le TCO de trois ans - ainsi que les cinq barrières réelles à l'auto-hébergement de Whisper, ce que MLPS Level 3 exige réellement lors de la sélection, et une liste de contrôle de fournisseurs de huit questions prêtes à utiliser.

Pas de concepts ici - juste une question: Quel itinéraire correspond à votre scénario.
Cela décompose le travail de sélection sur site de ASR effectué sur les sites des clients gouvernementaux, financiers et énergétiques en une table de décision, un modèle de coût de trois ans et les véritables obstacles à l'auto-hébergement open source.
1. La réponse à l'avant: une table de décision
Si vous avez trois compte rendu de réunion, cette table est suffisante.
| Votre situation | itinéraire recommandé | Pourquoi |
|---|---|---|
| Vous avez des ingénieurs ML, le scénario tolère les erreurs (des stand-ups internes, sous-titres) | Auto-hébergement open source (faster-whisper / paraformer) | Coût de licence zéro, assez bon |
| Déjà engagé avec un fournisseur de cloud, la sortie audio est acceptable | Cloud API | Le plus rapide à lancer, ne surconstruisez pas |
| Exigences de conformité mais non classées, faible concurrency | Pack privé Cloud vendor | Livraison rapide, Écosystème familier |
| La résidence des données est une ligne rouge dure / Xinchuang / classifié / plusieurs flux concurrents | Moteur commercial on-premise | Les autres routes ne peuvent pas l'atteindre |
| Accélérateurs nationaux (Ascend / Cambricon / Hygon) | Moteur commercial avec support natif | Le porter soi-même est très cher |
Les personnes prioritaires inversent régulièrement: la plupart des acheteurs comparent Accuracité en premier, mais ce qui tue réellement un projet est généralement Si les données peuvent quitter le domaine.
Deux points de précision sont survivants; les données quittant le domaine signifient que le projet n'est jamais approuvé. L'ordre correct est donc:
- Ligne rouge de conformité (résidence des données, Xinchuang) → élimine la moitié des options
- Concurrence et latence (combien de flux, en temps réel ou non) → définit les spécifications matérielles
- Langue et dialecte définit la capacité du moteur
- Accurate → comparez uniquement entre les options qui ont passé 1 - 3
- Coût total → Dernier, mais n'oubliez pas de compter les gens
2. On-Premise vs Cloud: trois registres, pas seulement la sécurité
Le latence ledger
La latence d'un cloud API est: upload + queue + inference + return.
Un enregistrement de réunion d'une heure (16 kHz mono, environ 115 Mo) prend 10 secondes pour télécharger sur un intranet de 100 Mbps; sur Internet public vers un point de terminaison cloud, vous ajoutez de la jitter au dessus. Pour le lot transcription vocale, cela n'a pas d'importance. Pour les sous-titres en direct, c'est fatal.
L'audio sur site ne quitte jamais le NIC, de sorte que le RTF d'inférence locale représente l'ensemble du budget de latence.
Règle générale: si vous avez besoin de Captions en direct ou live compte rendu de réunion, la structure de latence cloud est structurellement désavantagée - préférez l'on-premise.
Le livre de coûts (le plus souvent mal calculé)
Comparer le « prix horaire du cloud » directement à « l'achat unique de serveur » est faux. Le TCO de trois ans devrait inclure:
scénario: 50 heures d'audio de réunion par jour, jours ouvrables, horizon de trois ans.
| Coût élément | Cloud API | Auto-hébergement open source | Moteur commercial on-premise |
|---|---|---|---|
| Les frais de transcription vocale | facturation horaire, des dizaines de milliers sur 3 ans | 0 | 0 |
| Hardware | 0 | Serveur à carte unique (one-off) | inclus |
| Licence logicielle | 0 | 0 (open source) | Licence unique (par niveau de concurrence) |
| Effort de mise en œuvre | 0 | 1-2 Personnes-mois | inclus |
| 3-Année d'effort opérationnel | 0 | 0,3 - 0,5 FTE | Principalement supporté par les vendeurs |
| Échec du fallback | Vendeur SLA | sur toi | Contrats SLA |
Vous pouvez regarder ceci et demander: L'hébergement n'est-il pas le moins cher?
Le self-hébergement économise Frais de licence et coûte Les gens. Et que coût en personnel est fixe - les modèles doivent être mis à niveau, les opérateurs doivent s'adapter, et le nouveau matériel client signifie reconvertir les modèles. Le FTE de 0,3 à 0,5 ci-dessus est conservateur; avec des accélérateurs domestiques et un déploiement à air-gap, il va plus élevé.
Pour les scénarios généraux à faible volume sans contraintes de conformité, les API cloud ont généralement un TCO inférieur. Le point de basculement économique pour l'on-premise arrive lorsque la pression de la concurrence est élevée ou que la conformité interdit le cloud.
Le Risk Ledger
Difficile à quantifier, mais souvent décisif:
- Risque de connectivité - sur un intranet isolé, les options cloud sont immédiatement hors de la table
- Vendeur Lock-In - la commutation des API cloud signifie une intégration de reprise; la commutation des moteurs sur site signifie un redéploiement
- Responsabilité d'audit - quand quelque chose tombe en panne, avec le cloud c'est « le problème du fournisseur »; auto-hébergé, c'est à vous
3. Les véritables obstacles au self-hébergement open source
Auto-hébergement Whisper est un sujet fortement recherché, ce qui vous dit beaucoup d'équipes l'envisagent. Nous l'avons fait. Voici la version honnête.
Le faire courir n'est pas difficile
# faster-whisper is the default choice today
pip install faster-whisper
# 8GB VRAM can run large-v3-turbo with INT8 quantization
python -c "
from faster_whisper import WhisperModel
m = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8_float16')
segments, info = m.transcribe('meeting.wav', language='zh')
print(f'language {info.language}, probability {info.language_probability:.2f}')
for s in segments:
print(f'[{s.start:6.1f}s -> {s.end:6.1f}s] {s.text}')
"
Vous pouvez avoir une démo en cours d'exécution en dix compte rendu de réunion. Passer de la démo à la production est le plus difficile.
5 obstacles que vous ne rencontrerez que dans la production
1. Pas de mot-clé
Le plus douloureux dans les scénarios d'entreprise. Noms de sociétés, noms de code de produits, noms de personnes, abréviations de projets - Whisper les écrira constamment comme des caractères semblables. initial_prompt ne donne que des orientations faibles, se décompose sur de longs sons, et Rien n'impose.
Si les réunions de votre client sont pleines de noms propres, vous n'éviterez pas cela.
2. Pas de séparation des locuteurs intégré
Whisper produit du texte, pas « qui l'a dit. "Producer une réunion compte rendu de réunion signifie ajouter séparément un module de séparation de pyannote ou de NeMo et aligner vous-même les horodatages. Un modèle de plus, une tranche de VRAM de plus, une chose de plus qui peut casser.
3. Le streaming est une faiblesse structurelle
Le Architecture de Whisper n'a pas été conçu pour le streaming. La solution de contournement courante est le streaming par morceaux (feeds de fenêtres de 5 à 10 secondes), ce qui coûte erreurs de frontière aux points de fractionnement - une phrase est coupée en deux, chaque moitié est transcrite indépendamment, et la couture produit de mauvais caractères. Mauvaise expérience pour les sous-titres live.
4. Essentiellement pas de dialectes
large-v3 a un jeton yue (cantonese), mais la qualité n'est pas proche de la production. Wu, Min Nan, Sichuan, Mandarin des plaines centrales - aucun n'est pris en charge par les modèles officiels.
5. Les accélérateurs domestiques doivent être portés vous-même
L'exportation ONNX de Whisper et la conversion Ascend ATC fonctionnent, mais vous rencontrerez: des versions d'opset non prises en charge, une configuration d'axe dynamique, des défaillances silencieuses de l'opérateur non pris en charge et des modèles nécessitant une reconversion après les mises à jour de version. Voir Ascend 910B private ASR walkthrough pour plus de détails.
Quand l'auto-hébergement open source est le bon appel
Être juste À propos où il convient:
- Vous avez des ingénieurs ML qui peuvent modifier les modèles
- Le scénario tolère les erreurs (notes de réunion interne, sous-titres vidéo)
- Mandarin général, sans lourdes charges de noms propres
- Pas d'exigence en temps réel
- Pas de mandat d'accélérateur national
Si les cinq tiennent, le self-hébergement est un excellent rapport qualité - prix. Si deux ou plus ne le font pas, exécutez soigneusement les chiffres du coût des personnes.
4. Comparaison des capacités sur les trois routes
| dimension | Auto-hébergement open source | Pack privé Cloud vendor | Moteur commercial on-premise |
|---|---|---|---|
| Coût de licence | 0 | Medium | haut |
| Effort de mise en œuvre | Haute (1 - 2 personnes-mois) | Moyenne (1 - 2 semaines) | Faible (fourni par le fournisseur) |
| Précision chinoise (réunions) | Medium | Moyen-haut | haut |
| mot-clé / Propriet Nouns | Aucune | Oui | Oui |
| séparation des locuteurs | Module séparé requis | Oui | Construit en |
| Streaming en temps réel | Faible | Oui | Oui |
| Support dialectique | Essentiellement aucun | limitée | 22 |
| Accélérateur domestique | Portez vous-même | partiellement | natifs |
| Opération Air-Gapped | Package vous-même | dépend du vendeur | Supporté |
| MLPS / Support classifié | Votre propre paperasse | partiellement | Documentation fournie |
| Responsabilité opérationnelle | Entièrement vôtre | Vendeur | Vendeur + SLA |
Les deux lignes les plus souvent sous-estimées sont l'effort de mise en œuvre et la responsabilité opérationnelle. Ils n'apparaissent jamais sur un devis, mais ils consomment l'équipe en permanence.
5. Ce que le niveau MLPS 3 exige lors de la sélection
C'est la question la plus fréquemment posée par les clients du gouvernement et de la finance. Parmi les exigences du niveau 3 de la MLPS (GB / T 22239 - 2019) pour les systèmes d'enregistrement de la réunion et de la compte rendu de réunion, ce sont celles qui façonnent la sélection:
| Contrôle | Exigences MLPS L3 | La question à poser |
|---|---|---|
| Résidence des données | Audio et texte stockés localement, pas de téléchargement public | « Est-ce qu ' une partie de transcription vocale effectue un appel public au réseau? - y compris les vérifications de licence, les téléchargements de modèles et la télémétrie |
| Contrôle d'accès | Vérification d'identité, autorisations basées sur les rôles | « Peut-il s'intégrer à notre LDAP / OAuth existant? " |
| Audit de sécurité | Opérations traçables, logs conservés | Qui peut exporter compte rendu de réunion? Les exportations sont-elles enregistrées? Combien de temps les logs sont-ils conservés? " |
| Encryptage de transport | Communication interne cryptée | « Est-ce que le TLS est appliqué sur l'intranet aussi, ou seulement du côté public? " |
| Protection des informations résiduelles | Les données supprimées doivent être irrécupérables | Après avoir supprimé une réunion, les caches de modèle et les fichiers temporaires sont-ils également effacés? " |
Le premier et le dernier sont ceux qui sont le plus souvent manqués.
De nombreuses solutions prétendent « pas de fuite de données », mais la validation de la licence atteint l'Internet public, les poids de modèle téléchargés au premier lancement, et les téléphones de télémétrie Accueil - tout appel public unique remet en question la prétention de non-issue lors d'une évaluation de la MLPS. Demandez-le jusqu'à ce que vous obtenez une réponse difficile.
De même, si « supprimer la réunion » ne supprime qu 'une ligne de base de données et laisse des fichiers intermédiaires et des caches vectorielles sur le disque, la protection des informations résiduelles échoue.
Voir le MLPS Level 3 compliance breakdown pour les détails complets.
6. 8 questions à répondre avant de choisir
Envoyez cette liste aux fournisseurs, ou demandez à votre propre équipe. Toute option qui ne peut pas répondre est exclu:
- Est-ce que Any fait partie du pipeline transcription vocale effectue un appel public au réseau? (licence, modèle et télémétrie comptent tous)
- Quel est le nombre de flux concurrents par serveur? Soutenue, pas de pic
- mot-clé est-il supporté? Constraint dur ou orientation douce?
- Est-ce que séparation des locuteurs Intégré, ou ajouté en tant que module distinct? Comment est-il géré le chevauchement du discours?
- Quels Les dialectes sont pris en charge? Quelle est la précision mesurée? Pouvez-vous partager un test de série?
- Ascend / Cambricon / Hygon est-il supporté? Nationalement ou porté sur site?
- Le déploiement de Air-gapped est-il pris en charge? Que contient le bundle offline?
- Qu ' est-ce que documentation est fourni pour l'évaluation MLPS? (topologie de déploiement, diagramme de flux de données, spécification du journal d'audit)
Les questions 1 et 7 sont le bassin d'eau. Un fournisseur qui ne peut y répondre n'a pas livré dans un environnement de conformité réel.
7. Quand ne pas aller on-premise
Un mot contre notre propre intérêt, donc cela ne se lit pas comme un pitch.
Sauter on-premise si:
- Le volume quotidien est petit (quelques heures par jour) - le cloud pay-per - use est moins cher et n'impose aucune charge opérationnelle
- Aucune exigence de conformité - si vous pouvez utiliser le cloud, ne dépensez pas six chiffres sur des serveurs pour un sentiment de sécurité
- Personne dans l'équipe ne fait des opérations - après avoir été sur site, les mises à niveau des modèles, les défaillances matérielles et le réglage des performances sont tous à vous
- Vous avez besoin de transcription vocale une fois - acheter un serveur pour transcrire un lot puis le faire inactif est un mauvais métier
Le bon déclencheur pour sur site est un Ligne rouge de conformité ou Pression de concurrence soutenue - pas "il se sent plus sûr. "
8. Comment VoiVision le fait
VoiVision construit la réunion d'entreprise sur site transcription vocale, avec la pile complète développée en interne depuis le frontend de la parole jusqu'à ASR, la séparation des locuteurs et la structuration sémantique:
- 52 ans de NLP de la recherche NLP, fondée en 1973 sous le nom de NEU NLP Lab
- 200+ documents publié (20+ CCF-A), 110+ brevets d'invention (54 accordés)
- NiuTrans, le moteur de traduction automatique, utilisé plus de 100 000 fois dans le monde entier
- Inference 4x plus rapide que les LLM à usage général traditionnels sur matériel équivalent
- Prise en charge native pour Ascend 310P / 910B, Cambricon MLU370 / 590, Hygon DCU et NVIDIA T4 / L4 / A10 / A100, plus fonctionnement CPU uniquement
- 22 dialectes, et déploiement à air-gapped
- Précision transcription vocale chinoise ≥ 98%, avec des grappes prenant en charge plus de 50 flux simultanés
Utilisez les huit questions ci-dessus telles que. Toute solution qui ne peut pas répondre à ces questions mérite un deuxième regard, peu importe la faible cote.
Besoin d'une évaluation par rapport à votre niveau de MLPS et à votre objectif de concurrency? Book a demo, ou commencez par le complete private deployment guide.
FAQ
Q: On-premise ou Cloud ASR: lequel est le meilleur?
A: Cela dépend de trois conditions: le volume quotidien, les exigences de conformité et la pression concurrentielle. Avec un faible volume quotidien et aucune contrainte de conformité, les APIs cloud ont généralement un TCO plus faible sur trois ans et une charge opérationnelle beaucoup moins importante. Lorsque la résidence des données est une ligne rouge dure, que les règles de Xinchuang s'appliquent, ou que la pression de la concurrence est soutenue, l'on-premise est le bon appel. Le déclencheur de l'installation sur site est une ligne rouge de conformité ou une concurrency soutenue, et non un sentiment vague qu ' elle est plus sûre.
Q: Quels sont les obstacles à l'auto-hébergement de Whisper?
A: Cinq principaux: pas de support mot-clé (les noms appropriés sont écrits comme des caractères semblables, et initial _ prompt n'est qu 'un guide faible), pas de séparation des locuteurs intégré (vous devez ajouter pyannote ou un module similaire et aligner les horodatages vous-même), faible streaming (chunking produit des erreurs de limite aux points de fractionnement), essentiellement pas de support dialectal, et les accélérateurs domestiques nécessitent un portage vous-même (exportation ONNX plus conversion ATC, avec beaucoup de pièges).
Q: Comment calculez-vous le TCO sur trois ans pour ASR sur site?
A: Ne comparez pas les frais de licence seuls. Inclure le coût horaire de transcription vocale, le matériel, les licences logicielles, les efforts de mise en œuvre, les efforts opérationnels de trois ans et la secours en cas de défaillance. L'auto-hébergement open source permet d'économiser des licences mais des coûts en personnel - la mise en œuvre prend généralement un à deux mois-personne et les opérations sont d'environ 0,3 à 0,5 FTE, plus élevé lorsque des accélérateurs nationaux et un déploiement à airspace sont impliqués.
Q: Qu 'est-ce que le niveau MLPS 3 exige lors de la sélection d'un système de réunion compte rendu de réunion?
A: Cinq contrôles sont importants: la résidence des données (audio et texte stockés localement, aucun téléchargement public), le contrôle d'accès (vérification d'identité et autorisations basées sur les rôles), l'audit de sécurité (opérations traçables, journaux conservés), le chiffrement du transport (communication interne chiffrée) et la protection des informations résiduelles (les données supprimées doivent être irrécupérables). La question la plus négligée et la plus critique est de savoir si une partie du pipeline effectue un appel public au réseau.
Q: Comment puis-je vérifier qu ' une solution sur site maintient réellement les données dans le domaine?
A: Demandez directement si une partie du pipeline transcription vocale effectue un appel au réseau public, et incluez explicitement les vérifications de licence, les téléchargements de poids de modèle et la télémétrie. Tout appel public unique remettra en question l'allégation « pas de fuite de données » lors d'une évaluation MLPS.
Q: Pour 50 heures de réunions par jour, cloud ou sur site?
A: Sans contraintes de conformité, le cloud pay-per - usage coûte généralement beaucoup moins sur trois ans. Si la résidence des données, Xinchuang ou les exigences classifiées s'appliquent, ou si la pression de la concurrence est soutenue, choisissez sur site. Le point de basculement sur l'économie et la conformité arrive généralement lorsque la pression de la concurrence ou une règle de conformité sans cloud est présente.
Q: Le ASR sur site prend-il en charge Ascend et d'autres accélérateurs nationaux?
A: Cela dépend de l'itinéraire Les modèles open source vous obligent à effectuer vous-même l'exportation ONNX et la conversion ATC, ce qui est un travail substantiel avec de nombreux pièges. Les moteurs commerciaux qui prennent en charge nativement le Ascend 310P / 910B, le Cambricon MLU370 / 590 et le Hygon DCU éliminent complètement cet effort de portation. Vérifiez toujours si le support est natif ou nécessite un portage sur site.
