VoiVision AI
tech· VoiVision AI Engineering

Lựa chọn ASR tại chỗ: Tự lưu trữ nguồn mở so với các gói riêng tư đám mây so với các công cụ thương mại

So sánh ba tuyến đường trên các đường đỏ tuân thủ, đồng thời và độ trễ, phạm vi phủ sóng ngôn ngữ và phương ngữ, độ chính xác và TCO ba năm - cộng với năm rào cản thực sự đối với Whisper tự lưu trữ, những gì MLPS Level 3 thực sự yêu cầu trong quá trình lựa chọn và danh sách kiểm tra nhà cung cấp tám câu hỏi sẵn sàng sử dụng.


So sánh lựa chọn trên cơ sở ASR

Không có khái niệm ở đây - chỉ một câu hỏi: Con đường nào phù hợp với kịch bản của bạn.

Điều này phân tích công việc lựa chọn ASR tại chỗ được thực hiện trên các trang web của khách hàng chính phủ, tài chính và năng lượng thành một bảng quyết định, mô hình chi phí ba năm và các rào cản thực sự đối với tự lưu trữ nguồn mở.

1. Câu trả lời lên phía trước: Một bảng quyết định

Nếu bạn có ba biên bản cuộc họp, bảng này là đủ.

Tình huống của anhĐề xuất tuyến đườngTại sao
Bạn có các kỹ sư ML, kịch bản chịu lỗi (stand-up nội bộ, phụ đề)Tự lưu trữ mã nguồn mở (nhanh hơn - thì thầm / Paraformer)Chi phí giấy phép bằng không, đủ tốt
Đã cam kết với một nhà cung cấp đám mây, lối ra âm thanh là chấp nhận đượcĐám mây APINhanh nhất để khởi động, đừng xây dựng quá mức
Yêu cầu tuân thủ nhưng không được phân loại, đồng thời thấpGói riêng của nhà cung cấp đám mâyGiao hàng nhanh, quen thuộc Hệ sinh thái
Dữ liệu cư trú là một đường đỏ cứng / Xinchuang / phân loại / nhiều luồng đồng thờiCông cụ thương mại tại chỗCác con đường khác không thể đến được
Chuyển sang máy gia tốc trong nước (Ascend / Cambricon / Hygon)Công cụ thương mại với hỗ trợ bản địaTự mang theo rất đắt

Một người ưu tiên thường xuyên đảo ngược: hầu hết người mua so sánh độ chính xác trước, nhưng những gì thực sự giết chết một dự án thường là Dữ liệu có thể rời khỏi miền.

Hai điểm chính xác là sống sót; dữ liệu rời khỏi miền có nghĩa là dự án không bao giờ được chấp thuận. Vì vậy, trật tự chính xác là:

  1. Tuân thủ đường đỏ (dữ liệu cư trú, Xinchuang) → loại bỏ một nửa các tùy chọn hoàn toàn
  2. Đồng thời và độ trễ (có bao nhiêu luồng, thời gian thực hay không) → đặt thông số kỹ thuật phần cứng
  3. Ngôn ngữ và phương ngữ → thiết lập khả năng động cơ
  4. Độ chính xác → chỉ so sánh giữa các tùy chọn đã vượt qua 1-3
  5. Tổng chi phí → cuối cùng, nhưng đừng quên đếm người

2. On-Premise vs Cloud: Ba sổ cái, không chỉ bảo mật

Lịch tính latency Ledger

Độ trễ của một đám mây API là: upload + queue + inference + return.

Một bản ghi âm cuộc họp kéo dài một giờ (16 kHz mono, khoảng 115 MB) mất 10 giây để Về chúng tôi tải lên mạng nội bộ 100 Mbps; qua internet công cộng đến điểm cuối đám mây bạn thêm jitter trên đầu. Đối với batch phiên âm giọng nói điều này không quan trọng.Đối với các chú thích sống, nó là chết người.

Âm thanh tại chỗ không bao giờ rời khỏi NIC, vì vậy RTF suy luận cục bộ là toàn bộ ngân sách độ trễ.

Quy tắc ngón tay cái: nếu bạn cần Live Captions hoặc Live biên bản cuộc họp, cấu trúc độ trễ đám mây là bất lợi về cấu trúc - thích tại chỗ.

Chi phí sổ cái (một trong những thường tính sai)

So sánh "giá điện toán đám mây mỗi giờ" trực tiếp với "mua máy chủ một lần" là sai. TCO ba năm bao gồm:

Scenario (Kịch bản): 50 giờ âm thanh cuộc họp mỗi ngày, ngày làm việc, tầm nhìn ba năm.

Mục chi phíĐám mây APITự lưu trữ nguồn mởCông cụ thương mại tại chỗ
Phí phiên âm giọng nóiThanh toán hàng giờ, hàng chục ngàn trong 3 năm00
Phần cứng0Máy chủ thẻ đơn (một lần)Bao gồm
Giấy phép phần mềm00 (Nguồn mở)Giấy phép một lần (theo cấp đồng thời)
Nỗ lực thực hiện01-2 người-thángBao gồm
3-Năm hoạt động nỗ lực00,3 - 0,5 FTEHầu hết được hỗ trợ bởi nhà cung cấp
Phòng chống thất bạiNhà cung cấp SLATrên anhSLA theo hợp đồng

Bạn có thể nhìn vào điều này và hỏi: Không phải là tự chủ là rẻ nhất?

Không. Tự lưu trữ tiết kiệm Phí giấy phép và chi phí người dân. Và chi phí nhân sự là cố định - các mô hình cần được nâng cấp, các nhà khai thác cần thích nghi và phần cứng của khách hàng mới có nghĩa là chuyển đổi lại các mô hình. 0,3-0,5 FTE ở trên là bảo thủ; với máy gia tốc trong nước và triển khai không khí, nó sẽ cao hơn.

Trong một dòng: Đối với các kịch bản chung với khối lượng thấp mà không có ràng buộc tuân thủ, các API đám mây thường có TCO thấp hơn.Điểm bùng nổ kinh tế cho on-premise đến khi áp lực đồng thời cao hoặc tuân thủ cấm đám mây.

Rủi ro Ledger

Khó định lượng, nhưng thường là quyết định:

  • Rủi ro kết nối - trên một mạng nội bộ cô lập, các tùy chọn đám mây ngay lập tức được đưa ra khỏi bảng
  • Nhà cung cấp khóa-in - chuyển đổi API đám mây có nghĩa là tích hợp làm lại; chuyển đổi các công cụ tại chỗ có nghĩa là triển khai lại
  • Trách nhiệm kiểm toán - khi một cái gì đó bị hỏng, với đám mây đó là "vấn đề của nhà cung cấp"; tự lưu trữ, đó là của bạn

3. Những rào cản thực sự đối với tự lưu trữ nguồn mở

Tự lưu trữ Whisper là một chủ đề được tìm kiếm nhiều, cho bạn biết rất nhiều nhóm đang xem xét nó. Chúng tôi đã làm điều đó. Đây là phiên bản trung thực.

Làm cho nó chạy không khó

# faster-whisper is the default choice today
pip install faster-whisper

# 8GB VRAM can run large-v3-turbo with INT8 quantization
python -c "
from faster_whisper import WhisperModel
m = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8_float16')
segments, info = m.transcribe('meeting.wav', language='zh')
print(f'language {info.language}, probability {info.language_probability:.2f}')
for s in segments:
    print(f'[{s.start:6.1f}s -> {s.end:6.1f}s] {s.text}')
"

Bạn có thể có một bản demo chạy trong mười biên bản cuộc họp. Việc chuyển từ demo sang sản xuất là phần khó khăn.

5 rào cản mà bạn chỉ gặp trong sản xuất

1. Không từ khóa

Một trong những đau đớn nhất trong các kịch bản doanh nghiệp. Tên công ty, tên mã sản phẩm, tên của mọi người, viết tắt của dự án - Whisper sẽ luôn viết chúng như các ký tự âm thanh tương tự. initial_prompt chỉ đưa ra hướng dẫn yếu, phân rã trên âm thanh dài và Không áp dụng gì cả.

Nếu các cuộc họp của khách hàng của bạn đầy đủ các danh từ thích hợp, bạn sẽ không tránh được điều này.

2. Không có phân tách người nói tích hợp

Whisper ra văn bản, không phải "Ai đã nói nó. Sản xuất cuộc họp biên bản cuộc họp có nghĩa là thêm pyannote hoặc mô-đun tách loa NeMo riêng biệt và tự sắp xếp timestamp. Thêm một mô hình, thêm một miếng VRAM, thêm một thứ có thể bị phá vỡ.

3. Streaming là một điểm yếu cấu trúc

Kiến trúc của Whisper không được thiết kế để phát trực tuyến. Phương pháp giải quyết phổ biến là phát trực tuyến phân mảnh (cửa sổ cấp dữ liệu 5-10 giây), chi phí Lỗi biên giới tại các điểm phân chia - một câu được cắt một nửa, mỗi nửa được phiên âm độc lập, và đường may tạo ra các ký tự sai. Trải nghiệm kém cho các chú thích trực tiếp.

4. Về cơ bản không có phương ngữ

large-v3 có token yue (Tiếng Quảng Đông), nhưng chất lượng không gần với sản xuất. Wu, Min Nan, Tứ Xuyên, Trung bình Quan Thoại - không có được hỗ trợ bởi các mô hình chính thức.

5. Các gia tốc trong nước yêu cầu tự port nó

Whisper xuất ONNX cộng với Ascend ATC chuyển đổi làm việc, nhưng bạn sẽ gặp: phiên bản opset không được hỗ trợ, cấu hình trục động, im lặng không được hỗ trợ các lỗi vận hành, và các mô hình cần tái chuyển đổi sau khi nâng cấp phiên bản. Xem Ascend 910B private ASR walkthrough cho chi tiết.

Khi tự lưu trữ nguồn mở là cuộc gọi đúng đắn

Là Về chúng tôi công bằng nơi nó phù hợp:

  • Các kỹ sư ML có thể sửa đổi các mô hình
  • Kịch bản chịu lỗi (ghi chú cuộc họp nội bộ, phụ đề video)
  • General Mandarin, without heavy proper-noun loads (Tiếng Mandarin tổng quát, không có trọng lượng danh từ)
  • Không yêu cầu thời gian thực
  • Không có nhiệm vụ gia tốc trong nước

Nếu cả năm đều giữ, tự lưu trữ là giá trị tuyệt vời. Nếu hai hoặc nhiều hơn không, hãy chạy các con số chi phí con người một cách cẩn thận.

4. Khả năng so sánh trên ba tuyến đường

Kích thướcTự lưu trữ nguồn mởGói riêng của nhà cung cấp đám mâyCông cụ thương mại tại chỗ
Chi phí giấy phép0Trung bìnhCao
Nỗ lực thực hiệnCao (1-2 người-tháng)Trung bình (1-2 tuần)Thấp (do nhà cung cấp cung cấp)
Tiếng Trung chính xác (cuộc họp)Trung bìnhTrung bình-caoCao
từ khóa / danh từ thích hợpKhông cóVâng, cóVâng, có
phân tách người nóiCần có mô-đun riêng biệtVâng, cóĐược xây dựng trong
Phát trực tuyến thời gian thựcyếu kémVâng, cóCó
Hỗ trợ phương ngữVề cơ bản không cógiới hạn22
Hỗ trợ gia tốc trong nướcTự mang nó điMột phầnBản địa
Hoạt động không khíTự đóng gói nóTùy thuộc vào nhà cung cấpHỗ trợ
MLPS / hỗ trợ phân loạigiấy tờ của riêng bạnMột phầnTài liệu được cung cấp
Trách nhiệm hoạt độngHoàn toàn của anhNhà cung cấpNhà cung cấp + SLA

Hai hàng thường bị đánh giá thấp nhất là nỗ lực thực hiện và trách nhiệm hoạt động. Họ không bao giờ xuất hiện trên một báo giá, nhưng họ tiêu thụ đội liên tục.

5. Yêu cầu của MLPS Level 3 trong quá trình lựa chọn

Đây là câu hỏi phổ biến nhất của khách hàng chính phủ và tài chính. Trong số các yêu cầu của MLPS Cấp 3 (GB / T 22239 - 2019) cho các hệ thống ghi âm và biên bản cuộc họp, đây là những điều định hình lựa chọn:

Kiểm soátYêu cầu MLPS L3Câu hỏi để hỏi
Dữ liệu cư trúÂm thanh và văn bản được lưu trữ cục bộ, không tải lên công khai"Có bất kỳ phần nào của phiên âm giọng nói thực hiện cuộc gọi mạng công cộng không? - bao gồm kiểm tra giấy phép, tải về mô hình và telemetry
Kiểm soát truy cậpXác minh danh tính, quyền dựa trên vai tròNó có thể tích hợp với LDAP / OAuth hiện tại của chúng tôi không? "
Kiểm toán an ninhCác hoạt động có thể truy xuất nguồn gốc, các bản ghi được giữ lại"Ai có thể xuất khẩu biên bản cuộc họp? Xuất khẩu có được đăng nhập không? Các log được giữ bao lâu? "
Mã hóa vận chuyểnGiao tiếp nội bộ được mã hóaTLS có được thực thi trên mạng nội bộ hay chỉ ở phía công cộng? "
Bảo vệ thông tin dư thừaDữ liệu bị xóa phải không thể khôi phục được"Sau khi xóa một cuộc họp, bộ nhớ đệm mô hình và các tệp tạm thời cũng được xóa? "

Thứ nhất và cuối cùng là những thứ thường bị bỏ lỡ nhất.

Nhiều giải pháp tuyên bố "không có rò rỉ dữ liệu," nhưng giấy phép xác nhận đạt đến internet công cộng, mô hình trọng lượng tải về khi ra mắt đầu tiên, và điện thoại từ xa Trang chủ-bất kỳ cuộc gọi công khai nào đặt câu hỏi về yêu cầu không thoát trong quá trình đánh giá của MLPS. Hỏi cho đến khi bạn nhận được một câu trả lời khó khăn.

Tương tự như vậy, nếu "delete meeting" chỉ loại bỏ một hàng cơ sở dữ liệu và để lại các tập tin trung gian và bộ nhớ đệm vector trên đĩa, bảo vệ thông tin dư lại không thành công.

Xem MLPS Level 3 compliance breakdown để biết chi tiết đầy đủ.

6. 8 câu hỏi cần trả lời trước khi lựa chọn

Gửi danh sách này cho các nhà cung cấp, hoặc hỏi nhóm của riêng bạn. Bất kỳ lựa chọn nào không thể trả lời được:

  1. bất kỳ là một phần của đường ống phiên âm giọng nói có thực hiện cuộc gọi mạng công cộng không? (Giấy phép, mô hình và telemetry tất cả tính)
  2. Số luồng đồng thời được duy trì trên mỗi máy chủ là bao nhiêu? Sức mạnh, không phải Peak
  3. từ khóa được hỗ trợ? Hướng dẫn cứng hay hướng dẫn mềm?
  4. Là phân tách người nói Tích hợp, hoặc được thêm vào như một mô-đun riêng biệt? Làm thế nào để xử lý lời nói chồng chéo?
  5. tiếng địa phương nào được hỗ trợ?Độ chính xác đo được là gì? Bạn có thể chia sẻ một bài kiểm tra không?
  6. Ascend / Cambricon / Hygon được hỗ trợ?Địa phương, hoặc ported trên trang web?
  7. Có hỗ trợ triển khai không khí-gaped không? Gói offline bao gồm những gì?
  8. tài liệu được cung cấp cho đánh giá MLPS? (tốp học triển khai, sơ đồ dòng dữ liệu, đặc tả nhật ký kiểm toán)

Câu hỏi 1 và 7 là điểm nhấn. Một nhà cung cấp không thể trả lời họ đã không giao hàng trong một môi trường tuân thủ thực sự.

7. Khi nào không nên đi On-Premise

Một từ chống lại lợi ích riêng của chúng ta, vì vậy điều này không được đọc như một sân.

Bỏ qua on-premise nếu:

  • Khối lượng hàng ngày rất nhỏ (vài giờ một ngày) - đám mây trả tiền cho mỗi lần sử dụng rẻ hơn và không mang gánh nặng hoạt động
  • Không có yêu cầu tuân thủ - nếu bạn có thể sử dụng đám mây, đừng chi tiêu sáu con số cho máy chủ để cảm thấy an toàn
  • Không ai trong đội làm việc - sau khi đi trên cơ sở, nâng cấp mô hình, lỗi phần cứng và điều chỉnh hiệu suất là tất cả của bạn
  • Bạn cần phiên âm giọng nói một lần - mua một máy chủ để phiên âm một lô và sau đó nhàn rỗi đó là một giao dịch xấu

Các kích hoạt phù hợp cho trên cơ sở là một Tuân thủ đường đỏ hoặc Áp lực cạnh tranh bền vững - không phải "nó cảm thấy an toàn hơn. "

8. Làm thế nào VoiVision làm điều đó

VoiVision xây dựng doanh nghiệp tại chỗ họp phiên âm giọng nói, với đầy đủ ngăn xếp phát triển trong nhà từ frontend nói thông qua ASR, tách loa và cấu trúc ngữ nghĩa:

  • 52 năm NLP của nghiên cứu NLP, được thành lập vào năm 1973 với tên gọi NEU NLP Lab
  • 200+ giấy tờ đã xuất bản (20+ CCF-A), + 110 bằng sáng chế phát minh (54 cấp)
  • NiuTrans, công cụ dịch máy, được sử dụng hơn 100.000 lần trên toàn thế giới
  • Inference Nhanh hơn 4x so với LLM đa năng chính thống trên phần cứng tương đương
  • Hỗ trợ bản địa cho Ascend 310P / 910B, Cambricon MLU370 / 590, Hygon DCU và NVIDIA T4 / L4 / A10 / A100, cộng với hoạt động chỉ dành cho CPU
  • 22 phương ngữ, và triển khai không khí
  • Độ chính xác ≥98% phiên âm giọng nói của Trung Quốc, với các cụm hỗ trợ 50+ luồng đồng thời

Sử dụng 8 câu hỏi trên như vậy. Bất kỳ giải pháp nào không thể trả lời họ đều xứng đáng được xem xét lần thứ hai, bất kể mức báo giá thấp như thế nào.

Cần đánh giá mức độ MLPS và mục tiêu đồng thời của bạn? Book a demo, hoặc bắt đầu với complete private deployment guide.

Câu hỏi thường gặp

Q: On-premise hoặc đám mây ASR - cái nào tốt hơn?

A: Nó phụ thuộc vào ba điều kiện: khối lượng hàng ngày, yêu cầu tuân thủ và áp lực đồng thời. Với khối lượng hàng ngày thấp và không có ràng buộc tuân thủ, các API đám mây thường có TCO ba năm thấp hơn và gánh nặng vận hành ít hơn nhiều. Khi cư trú dữ liệu là một đường đỏ cứng, các quy tắc Xinchuang được áp dụng, hoặc áp lực đồng thời được duy trì, tại chỗ là cuộc gọi đúng đắn.Điều kích hoạt cho on-premise là một đường đỏ tuân thủ hoặc đồng thời bền vững - không phải là cảm giác mơ hồ rằng nó an toàn hơn.

Q: Những rào cản đối với Whisper tự lưu trữ là gì?

A: Năm cái chính: không hỗ trợ từ khóa (được viết bằng các ký tự có âm thanh tương tự, và initial_prompt chỉ là hướng dẫn yếu), không có phân tách người nói tích hợp (bạn phải thêm pyannote hoặc một mô-đun tương tự và tự sắp xếp timestamp), streaming yếu (chunking tạo ra lỗi ranh giới tại các điểm chia tách), về cơ bản không hỗ trợ phương ngữ, và các bộ gia tốc trong nước yêu cầu bản thân chuyển đổi (ONNX xuất cộng với chuyển đổi ATC, với rất nhiều cạm bẫy).

Q: Làm thế nào để bạn tính toán TCO ba năm cho ASR tại chỗ?

A: Đừng so sánh phí giấy phép một mình. Bao gồm chi phí phiên âm giọng nói mỗi giờ, phần cứng, giấy phép phần mềm, nỗ lực thực hiện, nỗ lực hoạt động ba năm và sự cố. Tự lưu trữ mã nguồn mở tiết kiệm được giấy phép nhưng chi phí về con người - thực hiện thường mất một đến hai tháng người và hoạt động khoảng 0,3-0,5 FTE, cao hơn khi gia tốc trong nước và triển khai không khí có liên quan.

Q: MLPS Level 3 yêu cầu gì khi chọn hệ thống biên bản cuộc họp?

A: Năm điều khiển quan trọng: Dữ liệu cư trú (audio và văn bản được lưu trữ cục bộ, không tải lên công khai), kiểm soát truy cập (xác minh danh tính và quyền dựa trên vai trò), kiểm toán bảo mật (hoạt động có thể truy xuất, nhật ký được giữ lại), mã hóa vận chuyển (tiếng liên lạc nội bộ được mã hóa) và bảo vệ thông tin dư (dữ liệu bị xóa phải không thể khôi phục). Câu hỏi bị bỏ qua và quan trọng nhất là liệu bất kỳ phần nào của đường ống có thực hiện cuộc gọi mạng công cộng hay không.

Q: Làm thế nào để tôi xác minh một giải pháp tại chỗ thực sự giữ dữ liệu trong miền?

A: Hỏi trực tiếp liệu bất kỳ phần nào của đường ống phiên âm giọng nói có thực hiện cuộc gọi mạng công cộng hay không, và rõ ràng bao gồm kiểm tra giấy phép, tải về trọng lượng mô hình và đo từ xa. Bất kỳ cuộc gọi công khai nào sẽ đặt câu hỏi về yêu cầu "không có rò rỉ dữ liệu" trong quá trình đánh giá MLPS.

Q: Đối với 50 giờ họp mỗi ngày, đám mây hay tại chỗ?

A: Nếu không có các hạn chế tuân thủ, đám mây trả tiền cho mỗi lần sử dụng thường có chi phí ít hơn đáng kể trong ba năm. Nếu dữ liệu cư trú, Xinchuang hoặc các yêu cầu phân loại được áp dụng, hoặc áp lực đồng thời được duy trì, hãy chọn tại chỗ.Điểm bùng nổ về cả kinh tế và tuân thủ thường đến khi áp lực đồng thời hoặc quy tắc tuân thủ không có đám mây có mặt.

Q: ASR tại chỗ có hỗ trợ Ascend và các bộ gia tốc trong nước khác không?

A: Nó phụ thuộc vào con đường. Các mô hình mã nguồn mở yêu cầu bạn tự hoàn thành xuất ONNX và chuyển đổi ATC, đó là công việc đáng kể với nhiều cạm bẫy. Các công cụ thương mại hỗ trợ Ascend 310P / 910B, Cambricon MLU370 / 590 và Hygon DCU loại bỏ hoàn toàn nỗ lực chuyển đổi. Luôn luôn xác nhận liệu hỗ trợ là bản địa hay yêu cầu porting tại chỗ.

#triển khai tại chỗ#Lựa chọn ASR#Lời bài hát: Whisper#MLPS L3#TCO

Đặt một bản demo cá nhân

Hãy cho chúng tôi biết kịch bản cuộc họp và nhu cầu tuân thủ của bạn - nhận một kế hoạch phù hợp.

Đặt lịch ngay
Trò chuyện trực tiếp