オンプレミスの ASR 選択: オープンソースのセルフホスティング vs クラウドプライベートパッケージ vs 商用エンジン
コンプライアンスレッドライン、並行性とレイテンシー、言語と方言のカバレッジ、精度、 3 年間の TCO にわたる 3 つのルートを比較してください。さらに、 Whisper のセルフホスティングに対する 5 つの本当の障壁、 MLPS レベル 3 の選択時に実際に要求するもの、およびすぐに使用できる 8 つの質問からなるベンダーのチェックリストを比較してください。

ここには概念はありません — 1 つの質問だけです: あなたのシナリオに合ったルートです
これは、政府、金融、エネルギーの顧客サイトで行われたオンプレミスの ASR 選定作業を、意思決定テーブル、 3 年間のコストモデル、およびオープンソースのセルフホスティングに対する真の障壁に分解します。
1.前面の答え: 1 つの決定テーブル
議事録が 3 つある場合は、このテーブルで十分です。
| あなたの状況 | 推奨ルート | なぜ |
|---|---|---|
| ML エンジニアがいる場合、シナリオはエラーを許容します ( 内部スタンドアップ、字幕 ) | オープンソースのセルフホスティング ( ファスター · ウィスパー / Paraformer ) | ライセンスコストゼロ、十分です |
| すでに 1 つのクラウドベンダーにコミットしている、オーディオエグセスは受け入れられます | クラウド API | 最速で起動し、過剰ビルドしないでください |
| コンプライアンス要件が分類されていない、低並行性 | クラウドベンダープライベートパック | 速い配達、おなじみのエコシステム |
| データレジデンスはハードレッドライン / Xinchuang / 分類 / 多くの同時ストリームです | 商用オンプレミスエンジン | 他のルートでは到達できません |
| 国内アクセラレータ ( Ascend / Cambricon / Hygon ) への移行 | ネイティブサポートの商用エンジン | 自分で移植するのはとても高価です |
1 つの優先順位の人々は日常的に逆転する: ほとんどのバイヤーはまず 精度 を比較しますが、実際にプロジェクトを殺すものは通常 データがドメインを外れるかどうか です。
2 つの精度ポイントは生き残ります。データがドメインを離れると、プロジェクトは承認されません。正しい順序は次の通りです。
- コンプライアンスレッドライン ( データレジデンス、 Xinchuang ) → オプションの半分を完全に排除
- 同時性とレイテンシー ( ストリーム数、リアルタイムか否か ) → ハードウェア仕様を設定します
- 言語 · 方言 → エンジン能力設定
- 精度 → 1 〜 3 に合格したオプションのみ比較
- 総コスト → 最後ですが、人を数えることを忘れないでください
2.オンプレミス vs クラウド: セキュリティだけでなく 3 つの元帳
レイテンシー元帳
クラウド API のレイテンシは、アップロード + キュー + 推論 + 戻りです。
1 時間のミーティング録音 ( 16 kHz モノ、約 115 MB ) は、 100 Mbps のイントラネット上にアップロードするのに会社概要で 10 秒かかります。パブリックインターネット経由でクラウドエンドポイントにアップロードすると、その上にジッターが加えられます。バッチ音声文字起こしでは、これは関係ありません。ライブキャプションでは致命的です。
オンプレミスのオーディオは NIC を離れることはありませんので、ローカル推論 RTF はレイテンシー予算全体となります。
経験則: ライブキャプションまたはライブ議事録 を必要とする場合は、クラウドのレイテンシー構造は構造的に不利です。
原価元帳 ( 最も頻繁に誤算されるもの )
「クラウド時給価格」と「ワンタイムサーバー購入」を直接比較するのは間違いです。3 年間の TCO は以下のとおりです。
シナリオ: 1 日 50 時間の会議音声、営業日、 3 年間の地平線。
| コスト項目 | クラウド API | オープンソースのセルフホスティング | 商用オンプレミスエンジン |
|---|---|---|---|
| 音声文字起こし料金 | 1 時間あたりの課金、 3 年間にわたって数万 | 0 | 0 |
| ハードウェア | 0 | シングルカードサーバ ( ワンオフ ) | 含む |
| ソフトウェアライセンス | 0 | 0 ( オープンソース ) | 1 回限ライセンス ( コンカレンス層別 ) |
| 実施努力 | 0 | 1 〜 2 人月 | 含む |
| 3-年間業務努力 | 0 | 0.3 — 0.5 FTE | 主にベンダーサポート |
| 障害フォールバック | ベンダー SLA | あなたについて | 契約 SLA |
これを見て尋ねるかもしれません: セルフホスティングが最も安くないですか?
いいえ。セルフホスティングは ライセンス料 を節約し、コストは 人々の。モデルはアップグレードする必要があり、オペレータは適応する必要があり、新しい顧客ハードウェアはモデルの再変換を意味します。上記の 0.3 〜 0.5 FTE は控えめであり、国内アクセラレータとエアギャップ展開ではより高くなります。
一行で: コンプライアンス制約のない低容量の一般的なシナリオでは、クラウド API は通常 TCO が低いです。オンプレミスの経済的転換点は、並行圧力が高い場合や、コンプライアンスがクラウドを禁止する場合に訪れます。
リスク元帳
定量化するのは難しいが、しばしば決定的です。
- 接続性リスク— 孤立したイントラネットでは、クラウドオプションはすぐにテーブルから外れます。
- ベンダーロックイン— クラウド API の切り替えは統合のやり直しを意味し、オンプレミスエンジンの切り替えは再デプロイを意味します。
- 監査責任— 何かが故障すると、クラウドでは「ベンダーの問題」です。セルフホスティングでは、それはあなたのものです。
3.オープンソースのセルフホスティングへの真の障壁
セルフホスティングの Whisper は、多くのチームがそれを検討していることを教えてくれる非常に検索されたトピックです。私たちはそれをしました。ここは正直なバージョンです。
稼働させるのは難しくない
# faster-whisper is the default choice today
pip install faster-whisper
# 8GB VRAM can run large-v3-turbo with INT8 quantization
python -c "
from faster_whisper import WhisperModel
m = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8_float16')
segments, info = m.transcribe('meeting.wav', language='zh')
print(f'language {info.language}, probability {info.language_probability:.2f}')
for s in segments:
print(f'[{s.start:6.1f}s -> {s.end:6.1f}s] {s.text}')
"
10 議事録でデモを実行できます。デモからプロダクションへの移行は難しい部分です。
生産でしか遭遇しない 5 つの障壁
1.いいえホットワード
エンタープライズシナリオで最も痛みを伴うものです。会社名、製品のコードネーム、人の名前、プロジェクトの略語 —Whisper は一貫して類似した音の文字としてそれらを書きます。initial_prompt は弱いガイダンスしか与えず、長いオーディオで崩壊し、 強制しない。
顧客のミーティングが適切な名詞でいっぱいであれば、これを避けることはできません。
2.組み込み話者分離なし
ウィスパーがテキストを出力するのではなく、誰が言った。「ミーティング議事録を制作するには、 pyannote や NeMo スピーカー分離モジュールを別々に追加し、タイムスタンプを自分で調整する必要があります。もう 1 つのモデル、 VRAM のもう 1 つのスライス、もう 1 つの壊れるもの。
3.ストリーミングは構造的弱点
Whisper のアーキテクチャはストリーミング用に設計されていません。一般的な回避策はチャンクストリーミング ( 5 — 10 秒のウィンドウをフィード ) で、 分割点の境界誤差 のコストがかかります — 文は半分にカットされ、各半分は独立して転写され、継ぎ目は間違った文字を生成します。ライブキャプションの経験が不良。
4.基本的に方言なし
large-v3 には yue ( 広東語 ) トークンがありますが、品質は生産準備に近づいています。Wu 、 Min Nan 、四川語、 Central Plains Mandarin — いずれも公式モデルでサポートされていません。
5.国内アクセラレータは自分で移植する必要がある
Whisper の ONNX エクスポートと Ascend ATC 変換は動作しますが、サポートされていないオセットバージョン、動的軸構成、サイレントのサポートされていないオペレータ障害、バージョンアップグレード後の再変換が必要なモデルがあります。詳細は Ascend 910B private ASR walkthrough を参照してください。
オープンソースのセルフホスティングが正しいコールである場合
公正な会社概要にフィットする:
- モデルを変更できる ML エンジニアがいます
- シナリオはエラーを許容します ( 内部会議のメモ、ビデオ字幕 )
- 普通マンダリン、重い固有名詞負荷なし
- リアルタイム要件なし
- 国内アクセラレータ委任なし
5 つすべて保持すれば、セルフホスティングは優れた価値です。2 つ以上がない場合は、人件費の数値を慎重に実行します。
4. 3 路線の能力比較
| ディメンション | オープンソースのセルフホスティング | クラウドベンダープライベートパック | 商用オンプレミスエンジン |
|---|---|---|---|
| ライセンスコスト | 0 | ミディアム | ハイ |
| 実施努力 | 高 ( 1 〜 2 人月 ) | 中間 ( 1 〜 2 週間 ) | 低 ( ベンダー納品 ) |
| 中国語精度 ( 会議 ) | ミディアム | 中高 | ハイ |
| ホットワード / 固有名詞 | なしです | はい | はい |
| 話者分離 | 必要な別モジュール | はい | 組み込み |
| リアルタイムストリーミング | 弱い | はい | はい |
| 方言サポート | 基本的になし | 限定 | 22 |
| 国内アクセラレータサポート | 自分でポート | 部分的 | ネイティブ |
| エアギャップ操作 | 自分でパッケージ | ベンダーによる | サポート |
| MLPS / 分類サポート | あなた自身の書類 | 部分的 | 提供文書 |
| 業務責任 | 完全にあなたの | ベンダー | ベンダー + SLA |
最も過小評価される 2 つの行は、実装努力と運用責任です。彼らは決して見積もりに出ないが、チームを継続的に消費する。
5. MLPS レベル 3 の選考要求事項
これは政府や金融のお客様から最も一般的な質問です。録音と議事録システムを満たすための MLPS レベル 3 の要件 ( GB / T 22239 — 2019 ) のうち、以下のものが選択を形作ります。
| コントロール | MLPS L3 の要件 | 聞くべき質問 |
|---|---|---|
| データレジデンス | オーディオとテキストはローカルに保存され、パブリックアップロードなし | 「 音声文字起こしの一部はパブリックネットワーク通話しますか?“— ライセンスチェック、モデルダウンロード、テレメトリを含む |
| アクセス制御 | アイデンティティ検証、ロールベースのアクセス権 | “既存の LDAP / OAuth と統合できますか?" |
| セキュリティ監査 | 追跡可能なオペレーション、保持されたログ | “誰が議事録を輸出できるか?エクスポートはログに記録されますか?ログはどのくらい保存されますか?" |
| 輸送暗号化 | 暗号化された内部通信 | 「 TLS はイントラネットでも適用されますか、それともパブリック側でのみ適用されますか?" |
| 残留情報保護 | 削除されたデータは復元不可能であること | 「ミーティングを削除した後、モデルキャッシュとテンポファイルもクリアされますか?" |
最初と最後は、最も頻繁に見逃されるものです。
多くのソリューションは「 データ流出はない」と主張しているが、ライセンス検証はパブリックインターネット、最初のローンチでモデルの重みダウンロード、テレメトリ電話ホーム—単一の公募は MLPS 評価中に出口禁止の主張に疑問を投げかけます に達している。難しい答えが得られるまでこれを尋ねなさい。
同様に、「削除ミーティング」がデータベース行のみを削除し、中間ファイルとベクトルキャッシュをディスクに残した場合、残留情報保護に失敗します。
詳細は MLPS Level 3 compliance breakdown を参照してください。
6.選択前に答えるべき 8 つの質問
このリストをベンダーに送るか、自分のチームに尋ねてください。答えられないオプションはアウトです:
- 音声文字起こしパイプラインの一部 どれでも はパブリックネットワークコールを行いますか?( ライセンス、モデル、テレメトリはすべてカウント )
- サーバーあたりの 持続 同時ストリーム数は何ですか?ピークではなく持続
- ホットワード はサポートされますか?ハード制約かソフトガイダンスか?
- 話者分離 内置 は別モジュールとして追加されましたか?オーバーラップスピーチの処理は?
- どの 方言 がサポートされますか?測定精度とは何ですか?テストセットを共有できますか?
- Ascend / Cambricon / Hygon はサポートされますか?ネイティブ、またはサイトで移植?
- エアギャップ のデプロイメントはサポートされますか?オフラインバンドルには何が含まれますか?
- MLPS 評価に ドキュメンテーション が提供されるものは何ですか?( デプロイメントトポロジー、データフロー図、監査ログ仕様 )
質問 1 と 7 は分水岭です。答えられないベンダーは、真のコンプライアンス環境で納品していません。
7.オンプレミスに行かないとき
私たち自身の利益に反する単語なので、これはピッチとして読みません。
オンプレミスのスキップ:
- 1 日あたりの量は小さい ( 1 日数時間 ) — ペイパーユースクラウドは安価で、運用負担がかかりません
- コンプライアンス要件なし— クラウドを使用できる場合は、安全感のためにサーバーに 6 桁を費やさないでください。
- チームの誰も操作しません— オンプレミス後、モデルのアップグレード、ハードウェア障害、パフォーマンスのチューニングはすべてあなたのものです。
- 音声文字起こしは一度必要— サーバーを購入して 1 バッチを転写し、アイドル化することは悪い取引です
オンプレミスの適切なトリガーは コンプライアンスレッドライン または 持続的な並行圧力 です。"
8. VoiVision の仕組み
VoiVision は、スピーチフロントエンドから ASR 、スピーカー分離、セマンティック構造化を通じて社内で開発されたフルスタックで、エンタープライズオンプレミスミーティング音声文字起こしを構築します。
- NLP の 52年のNLP リサーチ 、 1973 年に NEU NLP Lab として設立
- 200 以上の論文 公開 ( 20+ CCF—A ) 、 110 以上の発明特許 公開 ( 54 件付与 )
- 世界中で 10 万回以上使用されている機械翻訳エンジン NiuTrans
- 同等のハードウェア上の 主流の汎用 LLM よりも 4 倍高速 推論
- Ascend 310P / 910B 、 Cambricon MLU370 / 590 、 Hygon DCU 、 NVIDIA T4 / L4 / A10 / A100 のネイティブサポート、 CPU 専用操作
- 22 の方言とエアギャップ展開
- ≥ 98% 中国の音声文字起こし精度、 50+ 同時ストリームをサポートするクラスタ
上記の 8 つの質問をそのまま使用します。それらに答えられないソリューションは、見積もりが低くても、もう一度見る価値がある。
MLPS レベルと並行性目標に対する評価が必要ですか?Book a demo 、または complete private deployment guide から始めます。
FAQ
Q: オンプレミスとクラウド ASR— どちらが良いですか?
A: 1 日あたりのボリューム、コンプライアンス要件、並行圧力の 3 つの条件に依存します。1 日あたりのボリュームが少なく、コンプライアンス制約がないため、クラウド API は通常、 3 年間の TCO が低く、運用負担がはるかに少なくなります。データレジデンスがハードレッドラインであり、 Xinchuang ルールが適用される場合、または並行プレッシャーが持続する場合、オンプレミスが正しいコールです。オンプレミスの引き金となるのは、コンプライアンスレッドラインや持続的な並行性です。
Q: セルフホスティングの Whisper の障壁は何ですか?
A: 5 つの主なもの:ホットワードのサポートがない ( 適切な名詞は類似した音の文字で書かれ、 initial_prompt は弱いガイダンスのみ ) 、 話者分離の組み込みがない ( pyannote または類似のモジュールを追加し、タイムスタンプを自分で整列する必要があります ) 、ストリーミングが弱い ( チャンキングは分割点で境界エラーを生成します ) 、基本的に方言のサポートがない、国内アクセラレータは自分で移植する必要があります ( ONNX エクスポートと ATC 変換、多くの落とし穴があります )。
Q: オンプレミスの ASR の 3 年間の TCO をどのように計算しますか?
A: ライセンス料のみを比較しないでください。1 時間あたりの音声文字起こしコスト、ハードウェア、ソフトウェアライセンス、実装作業、 3 年間の運用作業、障害フォールバックが含まれます。オープンソースのセルフホスティングはライセンスコストを節約しますが、人件コストは削減されます。実装は通常、 1 ~ 2 人で 1 ヶ月かかり、運用時間は約 0.3 ~ 0.5 FTE で、国内アクセラレータやエアギャップ展開が関与している場合はより高くなります。
Q: ミーティング議事録システムを選択する際に MLPS レベル 3 に必要なものは何ですか?
A: 5 つのコントロールが重要です:データ常駐性 ( オーディオとテキストがローカルに保存され、パブリックなアップロードなし ) 、アクセス制御 ( アイデンティティ検証とロールベースの権限 ) 、セキュリティ監査 ( トレース可能な操作、保持されたログ ) 、トランスポート暗号化 ( 暗号化された内部通信 ) 、および残留情報保護 ( 削除されたデータは復元不可能でなければなりません )。最も見落とされ、最も重要な問題は、パイプラインのどの部分がパブリックネットワークコールを行うかどうかです。
Q: オンプレミスソリューションが実際にデータをドメイン内に保持していることを確認するには?
A: 音声文字起こしパイプラインのいずれかの部分がパブリックネットワークコールを行うかどうかを直接尋ね、ライセンスチェック、モデルウェイトのダウンロード、テレメトリを明示的に含めます。単一の公開コールは、 MLPS 評価中に「 データ流出なし」の主張に疑問を呈します。
Q: 1 日 50 時間のミーティング、クラウドまたはオンプレミス?
A: コンプライアンス制約がなければ、ペイパーユースクラウドは通常、 3 年間でコストが大幅に削減されます。データレジデンス、 Xinchuang または機密要件が適用される場合、または並行性の圧力が持続する場合は、オンプレミスを選択します。経済性とコンプライアンスの両方の転換点は、通常、並行圧力またはクラウドなしのコンプライアンスルールのいずれかが存在するときに到来します。
Q: オンプレミスの ASR は Ascend や国内のアクセラレータをサポートしますか?
A: ルートによって異なります。オープンソースモデルでは、 ONNX のエクスポートと ATC 変換を自分で完了する必要があります。Ascend 310 P / 910 B 、 Cambricon MLU370 / 590 、 Hygon DCU をネイティブでサポートする商用エンジンは、移植作業を完全に削除します。サポートがネイティブであるか、オンサイトでの移植が必要かどうかを常に確認します。
