VoiVision AI
tech· VoiVision AI Engineering

Pilihan ASR On-Premise: Open-Source Self-Hosting vs Paket Pribadi Cloud vs Mesin Komersial

Bandingkan tiga rute di garis merah kepatuhan, concurrency dan latency, cakupan bahasa dan dialek, akurasi dan TCO tiga tahun - ditambah lima hambatan nyata untuk self-hosting Whisper, apa yang sebenarnya dituntut oleh MLPS Level 3 selama seleksi, dan daftar periksa vendor delapan pertanyaan yang siap digunakan.


Perbandingan Seleksi ASR On-Premise

Tidak ada konsep di sini - hanya satu pertanyaan: Laluan mana yang sesuai dengan skenario Anda.

Ini memecah pekerjaan seleksi ASR on-premise yang dilakukan pada situs pelanggan pemerintah, keuangan dan energi menjadi tabel keputusan, model biaya tiga tahun, dan hambatan nyata untuk self-hosting open source.

1. Jawaban di Depan: Satu Meja Keputusan

Jika Anda memiliki tiga notulen rapat, maka tabel ini sudah cukup.

Situasi AndaRoute yang direkomendasikanMengapa
Anda memiliki insinyur ML, skenario mentolerir kesalahan (stand-up internal, subtitle)Open-source self-hosting (faster-whisper / Paraformer)Biaya lisensi nol, cukup baik
Sudah berkomitmen untuk satu vendor cloud, output audio dapat diterimaCloud APICepat untuk meluncurkan, jangan overbuild
Persyaratan kepatuhan tetapi tidak diklasifikasikan, concurrency rendahPaket pribadi vendor awanPengiriman cepat, Ekosistem yang akrab
Data residency adalah garis merah keras / Xinchuang / diklasifikasikan / banyak aliran bersamaanMesin Komersial On-PremiseJalan-jalan lain tidak dapat menjangkaunya.
Pindah ke akselerator domestik (Ascend / Cambricon / Hygon)Mesin komersial dengan dukungan asliMembawa sendiri sangat mahal.

Orang-orang yang diprioritaskan secara rutin dibalik: kebanyakan pembeli membandingkan Akurasi terlebih dahulu, tetapi apa yang sebenarnya membunuh sebuah proyek biasanya Apakah data dapat meninggalkan domain.

Dua titik akurasi dapat bertahan hidup; data yang meninggalkan domain berarti proyek tidak pernah disetujui. Jadi urutan yang benar adalah:

  1. Garis Merah Kepatuhan (data residency, Xinchuang) → menghilangkan setengah dari pilihan langsung
  2. Koncurrency dan latency (berapa banyak aliran, real-time atau tidak) → menetapkan spesifikasi perangkat keras
  3. Bahasa dan Dialek → menetapkan kemampuan mesin
  4. Akurasi (accuracy) → bandingkan hanya di antara opsi yang lulus 1 - 3
  5. Total biaya → terakhir, tetapi jangan lupa untuk menghitung orang

2. On-Premise vs Cloud: Tiga Ledger, Bukan Sekedar Keamanan

The latency ledger adalah

Sebuah awan API latensi adalah: upload + antrian + inferensi + return.

Rekaman pertemuan satu jam (16 kHz mono, kira-kira 115 MB) membutuhkan waktu Tentang Kami 10 detik untuk mengunggah intranet 100 Mbps; melalui internet publik ke titik akhir awan Anda menambahkan jitter di atas. Untuk batch transkripsi suara ini tidak masalah. Untuk live captions itu fatal.

Audio on-premise tidak pernah meninggalkan NIC, sehingga inferensi lokal RTF adalah seluruh anggaran latensi.

Aturan praktis: jika Anda membutuhkan live caption atau live notulen rapat, struktur latensi cloud secara struktural kurang menguntungkan - lebih suka on-premise.

Pembukuan biaya (yang paling sering salah perhitungan)

Membandingkan "harga cloud per jam " secara langsung dengan" pembelian server satu kali " adalah salah. TCO 3 tahun harus mencakup:

Skenario: 50 jam audio pertemuan per hari, hari kerja, cakrawala tiga tahun.

Biaya itemCloud APISelf-hosting sumber terbukaMesin Komersial On-Premise
Biaya transkripsi suaraPenagihan per jam, puluhan ribu lebih dari 3 tahun00
Perangkat keras (hardware)0Single-card server (one-off)Termasuk
Lisensi perangkat lunak00 (Open Source)Lisensi satu kali (dengan tingkat concurrency)
Upaya pelaksanaan01-2 orang-bulanTermasuk
3-Usaha Operasi Tahun00.3 - 0.5 FTESebagian besar didukung oleh vendor
kegagalan fallbackVendor SLAPada Anda, pada AndaKontrak SLA

Anda mungkin melihat ini dan bertanya: Apakah self-hosting yang paling murah?

Tidak. Hosting mandiri menghemat Biaya lisensi dan biaya Orang-orang. Dan bahwa biaya personel diperbaiki - model perlu ditingkatkan, operator perlu beradaptasi, dan perangkat keras pelanggan baru berarti mengubah model. FTE 0,3 - 0,5 di atas adalah konservatif; dengan akselerator domestik dan penyebaran udara-gapped itu akan lebih tinggi.

Untuk skenario umum volume rendah tanpa kendala kepatuhan, API cloud biasanya memiliki TCO yang lebih rendah. Titik kritis ekonomi untuk on-premise tiba ketika tekanan concurrency tinggi atau kepatuhan melarang cloud.

The Risk Ledger (Risk Ledger)

Sulit untuk diukur, tetapi seringkali menentukan:

  • Risiko Konektivitas - pada intranet yang terisolasi, opsi cloud segera dihapus dari meja
  • Penjual Lock-in - mengalihkan API cloud berarti melakukan integrasi ulang; mengalihkan mesin on-premise berarti menyebarkan kembali
  • Tanggung jawab Audit (Audit Responsibility) - ketika sesuatu rusak, dengan cloud itu adalah "masalah vendor"; self-hosted, itu milik Anda

3. Hambatan Sejati untuk Self-Hosting Open-Source

Self-hosting Whisper adalah topik yang banyak dicari, yang memberi tahu Anda banyak tim yang mempertimbangkannya. Kami telah melakukannya. Berikut adalah versi yang jujur.

Membuatnya berjalan tidak sulit

# faster-whisper is the default choice today
pip install faster-whisper

# 8GB VRAM can run large-v3-turbo with INT8 quantization
python -c "
from faster_whisper import WhisperModel
m = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8_float16')
segments, info = m.transcribe('meeting.wav', language='zh')
print(f'language {info.language}, probability {info.language_probability:.2f}')
for s in segments:
    print(f'[{s.start:6.1f}s -> {s.end:6.1f}s] {s.text}')
"

Anda dapat memiliki demo yang berjalan di sepuluh notulen rapat. Mendapatkan dari demo ke produksi adalah bagian yang sulit.

5 Hambatan yang hanya Anda temui dalam produksi

1. Tidak ada kata kunci

Yang paling menyakitkan dalam skenario perusahaan. Nama perusahaan, nama kode produk, nama orang, singkatan proyek - Whisper akan secara konsisten menulisnya sebagai karakter yang terdengar mirip. initial_prompt hanya memberikan bimbingan yang lemah, membusuk pada audio yang panjang, dan Tidak memaksakan apapun.

Jika pertemuan pelanggan Anda penuh dengan kata benda yang tepat, Anda tidak akan menghindarinya.

2. Tidak ada built-in pemisahan pembicara

Whisper akan menghasilkan teks, bukan "yang mengatakannya. " "Memproduksi pertemuan notulen rapat berarti menambahkan pyannote atau modul pemisahan speaker NeMo secara terpisah dan menyelaraskan timestamp sendiri. Satu lagi model, satu lagi irisan VRAM, satu lagi hal yang bisa rusak.

3. Streaming adalah kelemahan struktural.

Whisper 's Arsitektur tidak dirancang untuk streaming. Solusi umum adalah chunked streaming (feed 5 - 10 jendela kedua), yang biaya Kesalahan batas pada titik split - kalimat akan dipotong setengahnya, masing-masing setengah ditranskripsi secara independen, dan jahitan menghasilkan karakter yang salah. Pengalaman yang buruk untuk captions live.

4. Pada dasarnya tidak ada dialek

large-v3 memiliki token yue (Kanton), tetapi kualitasnya tidak dekat dengan produksi. Wu, Min Nan, Sichuanese, Central Plains Mandarin - tidak ada yang didukung oleh model resmi.

5. Akselerator domestik memerlukan porting sendiri

Ekspor ONNX Whisper ditambah konversi Ascend ATC memang berfungsi, tetapi Anda akan bertemu: versi opset yang tidak didukung, konfigurasi sumbu dinamis, kegagalan operator yang tidak didukung secara diam-diam, dan model yang membutuhkan rekonversi setelah upgrade versi. Lihat Ascend 910B private ASR walkthrough untuk detailnya.

Ketika self-hosting sumber terbuka adalah panggilan yang tepat

Menjadi adil Tentang Kami di mana ia cocok:

  • Anda memiliki engineer ML yang dapat memodifikasi model
  • Skenario mentolerir kesalahan (catatan rapat internal, subtitle video)
  • Mandarin Umum, tanpa beban proper-noun yang berat
  • Tidak ada persyaratan real-time
  • Tidak ada mandat akselerator domestik

Jika kelima dari mereka memegang, self-hosting adalah nilai yang sangat baik. Jika dua atau lebih tidak, jalankan angka-angka biaya orang dengan hati-hati.

4. Perbandingan Kemampuan di Tiga Rute

Dimension (dimensi)Self-hosting sumber terbukaPaket pribadi vendor awanMesin Komersial On-Premise
Biaya Lisensi0Medium (Medium)Tinggi Tinggi
Upaya pelaksanaanTinggi (1 - 2 orang-bulan)Medium (1 - 2 minggu)Rendah (pengiriman oleh vendor)
Akurasi Cina (pertemuan)Medium (Medium)Menengah-tinggiTinggi Tinggi
kata kunci / Proper NounsTidak ada satu punYaYa
pemisahan pembicaraModul terpisah diperlukanYaDibangun di
Real-time streamingyang lemahYaYa
Dukungan dialekPada dasarnya tidak adaTerbatas (limited)22
Dukungan akselerator domestikPort itu sendiriparsialNative Native Native
Operasi udara-gappedPaket itu sendiriTergantung pada vendordidukung oleh
MLPS / Dukungan rahasiaDokumen Anda sendiriparsialDokumentasi yang disediakan
Tanggung jawab OperasiSepenuhnya milikmuVendor (penjual)Vendor + SLA

Dua baris yang paling sering diremehkan adalah upaya implementasi dan tanggung jawab operasi. Mereka tidak pernah muncul di sebuah kutipan, tetapi mereka mengkonsumsi tim secara terus-menerus.

5. Apa yang Tuntutan MLPS Level 3 Selama Seleksi

Ini adalah pertanyaan yang paling umum dari klien pemerintah dan keuangan. Dari persyaratan MLPS Level 3 (GB / T 22239 - 2019) untuk perekaman pertemuan dan sistem notulen rapat, ini adalah yang membentuk pemilihan:

Kontrol Kontrol Kontrol KontrolPersyaratan MLPS L3Pertanyaan yang harus ditanyakan
Data Residensi Data ResidensiAudio dan teks disimpan secara lokal, tidak ada unggahan publik"Apakah ada bagian dari transkripsi suara yang melakukan panggilan jaringan publik? - termasuk pemeriksaan lisensi, unduhan model dan telemetri
Kontrol akses (access control)Verifikasi identitas, izin berbasis peran"Bisakah itu terintegrasi dengan LDAP / OAuth yang ada? "
Audit keamanan (security audit)Operasi yang dapat dilacak, log yang dipertahankan"Siapa yang bisa mengekspor notulen rapat? Apakah ekspor tercatat? Berapa lama log disimpan? "
Enkripsi Transportasi (Transport Encryption)Komunikasi internal yang terenkripsi"Apakah TLS ditegakkan di intranet juga, atau hanya di sisi publik? "
Perlindungan Informasi ResidualData yang dihapus harus tidak dapat dipulihkanSetelah menghapus rapat, apakah cache model dan file temp juga dibersihkan? "

Yang pertama dan yang terakhir adalah yang paling sering terlewatkan.

Banyak solusi mengklaim "tidak ada kebocoran data, " namun validasi lisensi mencapai internet publik, bobot model diunduh pada peluncuran pertama, dan telepon telemetri Beranda - Setiap panggilan publik tunggal menempatkan klaim tidak keluar dipertanyakan selama penilaian MLPS. Tanyakan hal ini sampai Anda mendapatkan jawaban yang kuat.

Demikian pula, jika "delete meeting" hanya menghapus baris database dan meninggalkan file perantara dan cache vektor pada disk, perlindungan informasi residual gagal.

Lihat MLPS Level 3 compliance breakdown untuk detail lengkapnya.

6. 8 Pertanyaan yang Harus Dijawab Sebelum Memilih

Kirimkan daftar ini ke vendor, atau tanyakan pada tim Anda sendiri. Setiap pilihan yang tidak dapat dijawab adalah keluar:

  1. Apakah Setiap bagian dari pipa transkripsi suara membuat panggilan jaringan publik? (Lisensi, model dan telemetri semuanya dihitung)
  2. Berapakah jumlah aliran bersamaan berkelanjutan per server? Bertahan, bukan peak
  3. Apakah kata kunci didukung? Kendala keras atau bimbingan lembut?
  4. Apakah pemisahan pembicara Tertanam, atau ditambahkan sebagai modul terpisah? Bagaimana Overlapping Speech ditangani?
  5. Dialek (dialek) mana yang didukung? Apa yang dimaksud dengan accuracy yang diukur? Dapatkah Anda berbagi satu set tes?
  6. Apakah Ascend / Cambricon / Hygon / Cambricon / Hygon didukung? Secara lokal, atau porting ke situs?
  7. Apakah penyebaran udara-gapped didukung? Apa yang terkandung dalam paket offline?
  8. Apa dokumentasi yang disediakan untuk penilaian MLPS? (topologi penyebaran, diagram aliran data, spesifikasi log audit)

Pertanyaan 1 dan 7 adalah titik air. Seorang vendor yang tidak dapat menjawab mereka belum memberikan dalam lingkungan kepatuhan yang nyata.

7. Kapan tidak pergi on-premise

Sebuah kata yang bertentangan dengan kepentingan kita sendiri, jadi ini tidak dibaca sebagai sebuah pitch.

Skip on-premise jika:

  • Volume harian sangat kecil. (beberapa jam sehari) - cloud bayar per penggunaan lebih murah dan tidak membawa beban operasi
  • Tidak ada persyaratan kepatuhan (compliance requirements) - jika Anda dapat menggunakan cloud, jangan menghabiskan enam angka pada server untuk rasa aman
  • Tidak ada seorang pun di tim yang melakukan operasi. - setelah pergi di tempat, upgrade model, kegagalan perangkat keras dan penyetelan kinerja semuanya milik Anda
  • Anda perlu transkripsi suara sekali - membeli server untuk mentranskripsi satu batch dan kemudian menganggur itu adalah perdagangan yang buruk

Pemicu yang tepat untuk on-premise adalah Garis Merah Kepatuhan atau Tekanan persaingan yang berkelanjutan - bukan "merasa lebih aman. "

8. Bagaimana VoiVision Melakukan Ini

VoiVision membangun pertemuan on-premise perusahaan transkripsi suara, dengan tumpukan penuh yang dikembangkan di rumah dari frontend ucapan melalui ASR, pemisahan speaker dan penataan semantik:

  • 52 tahun NLP dari penelitian NLP, didirikan pada tahun 1973 sebagai NEU NLP Lab
  • 200+ kertas diterbitkan (20+ CCF-A), 110+ paten penemuan (54 diberikan)
  • NiuTrans, mesin terjemahan mesin, digunakan lebih dari 100.000 kali di seluruh dunia
  • Inferensi 4x lebih cepat daripada LLM umum utama pada perangkat keras yang setara
  • Dukungan asli untuk Ascend 310P / 910B, Cambricon MLU370 / 590, Hygon DCU dan NVIDIA T4 / L4 / A10 / A100, ditambah operasi CPU-satunya
  • 22 dialek, dan penyebaran udara-gapped
  • ≥ 98% akurasi transkripsi suara Cina, dengan cluster yang mendukung 50+ aliran bersamaan

Gunakan delapan pertanyaan di atas as-is. Setiap solusi yang tidak dapat menjawab mereka layak melihat kedua, tidak peduli seberapa rendah kutipan.

Perlu penilaian terhadap tingkat MLPS dan target concurrency Anda? Book a demo, atau mulai dengan complete private deployment guide.

FAQ

Q: On-premise atau cloud ASR - mana yang lebih baik?

A: Hal ini tergantung pada tiga kondisi: volume harian, persyaratan kepatuhan, dan tekanan concurrency. Dengan volume harian yang rendah dan tidak ada kendala kepatuhan, API cloud biasanya memiliki TCO tiga tahun yang lebih rendah dan beban operasional yang jauh lebih sedikit. Ketika residensi data adalah garis merah yang keras, aturan Xinchuang berlaku, atau tekanan concurrency berkelanjutan, on-premise adalah panggilan yang tepat. Pemicu untuk on-premise adalah garis merah kepatuhan atau concurrency yang berkelanjutan - bukan perasaan samar bahwa itu lebih aman.

Q: Apa hambatan-hambatan untuk self-hosting Whisper?

A: Lima orang utama: tidak ada dukungan kata kunci (noun yang tepat ditulis sebagai karakter yang terdengar serupa, dan initial _ prompt hanya panduan yang lemah), tidak ada built-in pemisahan pembicara (Anda harus menambahkan pyannote atau modul serupa dan menyelaraskan timestamp sendiri), streaming yang lemah (chunking menghasilkan kesalahan batas pada titik perpecahan), pada dasarnya tidak ada dukungan dialek, dan akselerator domestik memerlukan porting sendiri (ekspor ONNX ditambah konversi ATC, dengan banyak jebakan).

Q: Bagaimana Anda menghitung TCO tiga tahun untuk on-premise ASR?

A: Jangan hanya membandingkan biaya lisensi saja. Termasuk biaya transkripsi suara per jam, perangkat keras, lisensi perangkat lunak, upaya implementasi, upaya operasi tiga tahun dan kegagalan. Open-source self-hosting menghemat perizinan tetapi biaya pada orang-orang - implementasi biasanya membutuhkan waktu satu hingga dua orang-bulan dan operasi sekitar 0,3 - 0,5 FTE, lebih tinggi ketika akselerator domestik dan penyebaran udara yang celah terlibat.

Q: Apa yang diperlukan oleh MLPS Level 3 ketika memilih sistem notulen rapat pertemuan?

A: Lima kontrol yang penting: Residensi data (audio dan teks yang disimpan secara lokal, tidak ada unggahan publik), kontrol akses (verifikasi identitas dan izin berbasis peran), audit keamanan (operasi yang dapat dilacak, log yang disimpan), enkripsi transportasi (komunikasi internal yang terenkripsi), dan perlindungan informasi residual (data yang dihapus harus tidak dapat dipulihkan). Pertanyaan yang paling diabaikan dan paling penting adalah apakah bagian dari pipa membuat panggilan jaringan publik.

Q: Bagaimana saya memverifikasi bahwa solusi on-premise benar-benar menyimpan data di dalam domain?

A: Tanyakan secara langsung apakah ada bagian dari pipa transkripsi suara yang melakukan panggilan jaringan publik, dan secara eksplisit menyertakan pemeriksaan lisensi, unduhan berat model dan telemetri. Setiap panggilan publik tunggal akan menempatkan klaim "tidak ada kebocoran data" dipertanyakan selama penilaian MLPS.

Q: Untuk 50 jam pertemuan per hari, cloud atau on-premise?

A: Tanpa kendala kepatuhan, cloud pay-per - use biasanya biaya yang signifikan lebih sedikit selama tiga tahun. Jika residensi data, Xinchuang atau persyaratan rahasia berlaku, atau tekanan concurrency berkelanjutan, pilih on-premise. Titik tipping pada ekonomi dan kepatuhan biasanya tiba ketika tekanan bersamaan atau aturan kepatuhan tanpa awan hadir.

Q: Apakah ASR on-premise mendukung Ascend dan akselerator domestik lainnya?

A: Itu tergantung pada rute. Model open source mengharuskan Anda untuk menyelesaikan ekspor ONNX dan konversi ATC sendiri, yang merupakan pekerjaan yang substansial dengan banyak jebakan. Mesin komersial yang secara native mendukung Ascend 310P / 910B, Cambricon MLU370 / 590 dan Hygon DCU menghapus upaya porting itu sepenuhnya. Selalu pastikan apakah dukungan adalah native atau memerlukan porting di tempat.

#Pengerahan on-prem#Pilihan ASR#Whisper (bisik)#MLPS L3 MLPS L3#TCO adalah

Memesan Demo yang Dipersonalisasi

Beritahu kami tentang skenario pertemuan dan kebutuhan kepatuhan Anda - dapatkan rencana yang disesuaikan.

Pesan sekarang
Live Chat