VoiVision AI
tech· VoiVision AI Engineering

Выбор на месте ASR: самохостинга с открытым исходным кодом против облачных частных пакетов против коммерческих движек

Сравните три маршрута по красным линиям соответствия, параллельности и задержке, языковому и диалектному покрытию, точности и трехлетней TCO - плюс пять реальных барьеров для самохостинга Whisper, что MLPS Level 3 действительно требует во время отбора, и готовый к использованию контрольный список поставщиков из восьми вопросов.


Сравнение выбора на месте ASR

Здесь нет концепций - только один вопрос: Какой маршрут подходит вашему сценарию.

Это расчленяет работу по выбору локальных ASR, выполненную на сайтах правительственных, финансовых и энергетических клиентов, на таблицу решений, трехлетнюю модель затрат и реальные барьеры для открытого хостинга.

1.Ответ вперед: один таблица решений

Если у вас есть три протокол совещания, этого стола достаточно.

Ваша ситуацияРекомендуемый маршрутПочему
У вас есть инженеры ML, сценарий допускает ошибки (внутренние стенд-апы, субтитры)Открытый собственный хостинг (faster-whisper / Paraformer)Нулевая стоимость лицензии, достаточно хорошо
Уже привержены одному облачному поставщику, аудиовыход приемлемCloud APIБыстрее запускать, не перестраивать
Требования к соблюдению, но не классифицированные, низкая параллельностьОблачный поставщик частный пакетБыстрая доставка, знакомый Экосистема
Резиденция данных - это жесткая красная линия / Xinchuang / секретные / много одновременных потоковКоммерческий On-premise двигательДругие маршруты не могут добраться до него.
Переход на отечественные акселераторы (Ascend / Cambricon / Hygon)Коммерческий двигатель с нативной поддержкойНосить его самостоятельно - очень дорого.

Одно приоритетное лицо рутинно перевертывается: большинство покупателей сначала сравнивают точность, но то, что на самом деле убивает проект, обычно Возможность выхода данных из домена.

Две точки точности выживут; данные, покидающие домен, означают, что проект никогда не будет одобрен.Таким образом, правильный порядок:

  1. Красная линия (data residency, Xinchuang) → полностью устраняет половину опций
  2. Конкурентность и латента (колько потоков, в режиме реального времени или нет) → устанавливает характеристики оборудования
  3. Язык и диалект → устанавливает мощности двигателя
  4. Точность → сравнить только среди вариантов, которые прошли 1 - 3
  5. Общая стоимость → последнее, но не забудьте подсчитать людей

2. On-premise vs. Cloud: три реестра, а не только безопасность

Латентность Ledger

Задержка облака API: upload + queue + inference + return.

Запись заседания продолжительностью в один час (16 кГц моно, примерно 115 МБ) занимает О нас 10 секунд, чтобы загрузить через интранет со скоростью 100 Мбит / с; через общедоступный интернет в облачную конечную точку вы добавляете jitter на вершине. Для партии речевая транскрипция это не имеет значения.Для живых субтитров это фатально.

Настроенный аудио никогда не покидает сетевую платформу, поэтому RTF локального вывода составляет весь бюджет задержки.

Практическое правило: если вам нужен Live Captions или Live протокол совещания, структура облачной латенты структурно невыгодна - предпочтите наpremises.

Расчет расходов (чаще всего ошибочно рассчитанный)

Сравнение «облачной стоимости в час» непосредственно с «одноразовой покупкой сервера» неправильно.Трехлетний TCO должен включать в себя:

Сценарий: 50 часов аудиозаписи в день, рабочие дни, трехлетний горизонт.

Статья расходовCloud APISelf-hosting с открытым исходомКоммерческий On-premise двигатель
речевая транскрипция feesЧасовой счет, десятки тысяч за 3 года00
Оборудование0Однокарточный сервер (однократный)Included
Лицензия на программное обеспечение00 (открытый исходный код)Единовременная лицензия (по уровню параллельности)
Усилия по осуществлению01-2человеко-месяцыIncluded
3-Год операций00,3 - 0,5 ОТСВ основном поддерживаются поставщиками
Отсутствие возможностиПродавцы SLAО тебеКонтрактные ССО

Вы можете посмотреть и спросить: Разве самохостинг не самый дешевый?

Нет. Самохостинг экономит лицензионные сборы и затрат people.И что затраты на персонал фиксирован - модели нуждаются в модернизации, операторы нуждаются в адаптации, а новое оборудование клиентов означает переоборудование моделей.Вышеперечисленные 0,3 - 0,5 FTE являются консервативными; с отечественными ускорителями и развертыванием с воздушным зазором они выше.

В одной строке: Для общих сценариев малого объема без ограничений соответствия, облачные API, как правило, имеют более низкий TCO.Экономический переломный момент для локального производства наступает, когда либо давление на одновременность высокое, либо соответствие запрещает облачное использование.

Книга риска

Трудно поддаться количественному определению, но зачастую решающее:

  • Риск подключения - на изолированной интранете, облачные опции немедленно выходят из стола
  • Блокировка поставщика - переключение облачных API означает повторную интеграцию; переключение локальных двигателей означает перераспределение
  • Ответственность за ревизию - когда что-то сломается, с облаком это «проблема продавца»; самохостинг - это ваша

3.Реальные барьеры для открытого собственного хостинга

Самохостинг Whisper является темой, которая очень часто ищет, что говорит вам, что множество команд рассматривают это. Мы сделали это. Вот честная версия.

Пустить его в бегство не сложно

# faster-whisper is the default choice today
pip install faster-whisper

# 8GB VRAM can run large-v3-turbo with INT8 quantization
python -c "
from faster_whisper import WhisperModel
m = WhisperModel('large-v3-turbo', device='cuda', compute_type='int8_float16')
segments, info = m.transcribe('meeting.wav', language='zh')
print(f'language {info.language}, probability {info.language_probability:.2f}')
for s in segments:
    print(f'[{s.start:6.1f}s -> {s.end:6.1f}s] {s.text}')
"

Вы можете иметь демо, работающий в десяти протокол совещания. Переход от демо к производству - это сложная часть.

Пять барьеров, с которыми вы сталкиваетесь только в производстве

1. No ключевое слово

Наиболее болезненный в корпоративных сценариях.Названия компаний, кодовые названия продуктов, имена людей, аббревиатуры проектов - Whisper будет последовательно писать их как похожие звучащие символы. initial_prompt дает только слабое руководство, распадается на длинный аудио, и Ничего не принуждает.

Если встречи вашего клиента полны собственных существительных, вы не избежите этого.

2.Нет встроенного разделение по спикерам

Whisper выводит текст, а не «кто сказал это».«Производство заседания протокол совещания означает отдельно добавление модуля pyannote или NeMo для разделения спикеров и выравнивание временных штампов самостоятельно.Еще одна модель, еще один кусочек VRAM, еще одна вещь, которая может сломаться.

3.Поток - это структурная слабость

Whisper ' s Архитектура не был разработан для потокового использования.Общепринятым решением является блокпостная потоковая передача (питание 5 - 10 секунд), которая стоит Ошибки границ в точках разделения - предложение разрезается пополам, каждая половина транскрибируется независимо, а шв производит неправильные символы.Плохой опыт для живых субтитров

4.По сути, никаких диалектов

У large-v3 есть токен yue (кантонский), но качество нигде не близко к производственной готовности. Wu, Min Nan, Sichuanese, Central Plains Mandarin - ни один из них не поддерживается официальными моделями.

5.Внутренние ускорители требуют переноса самостоятельно

Экспорт Whisper ONNX плюс преобразование Ascend ATC работает, но вы столкнетесь с не поддерживаемыми версиями опсета, конфигурацией динамической оси, тихими не поддерживаемыми сбоями оператора и моделями, нуждающимися в реконверсировании после обновления версии.Подробности см. в Ascend 910B private ASR walkthrough.

Когда самохостинг с открытым исходным кодом является правильным вызовом

Быть справедливым О нас там, где он подходит:

  • У вас есть инженеры ML, которые могут модифицировать модели
  • Сценарий допускает ошибки (записки о внутренних совещаниях, видео субтитры)
  • Общий мандарин, без тяжелых собственных именных нагрузок
  • Не требуется реального времени
  • Отсутствие мандата национального ускорителя

Если все пять держатся, самохостинг является отличной ценностью.Если двое или более нет, тщательно проверьте цифры затрат на персонал.

4.Сравнение возможностей по трем маршрутам

РазмерSelf-hosting с открытым исходомОблачный поставщик частный пакетКоммерческий On-premise двигатель
Стоимость лицензии0MediumВысокий
Усилия по осуществлениюВысокий (1 - 2 человеко-месяца)Средний (1 - 2 недели)Низкий (поставляется поставщиком)
Китайская точность (встречи)MediumСредний-высокийВысокий
ключевое слово / собственные существительныеНичегоДаДа
разделение по спикерамТребуется отдельный модульДаПостроенный в
Real-time streamingСлабоеДаДа
Поддержка диалектовПо сути ни одинLimited22
Поддержка внутреннего ускорителяПортируйте себяЧастичноNative
Операция с воздушным зазоромУпаковать самостоятельноЗависит от продавцаПоддержанный
MLPS / секретная поддержкаВаши собственные бумажные работыЧастичноПредставленная документация
Оперативная ответственностьПолностью вашиПродавецПродавец + SLA

Наиболее часто недооцениваемыми двумя направлениями являются усилия по осуществлению и ответственность за операции.Они никогда не появляются в котировке, но они постоянно потребляют команду.

5.Что требует уровень MLPS 3 во время отбора

Это наиболее распространенный вопрос со стороны правительства и финансовых клиентов.Из требований MLPS уровня 3 (GB / T 22239 - 2019) для выполнения записей и систем протокол совещания, это те, которые определяют выбор:

КонтрольТребование MLPS L3The question to ask
Резиденция данныхАудио и текст хранятся локально, не публичная загрузка«Разве какая-либо часть речевая транскрипция делает публичный звонок в сеть? - включая проверку лицензий, загрузку моделей и телеметрию
Контроль доступаПроверка личности, разрешения на основе ролейМожет ли он интегрироваться с нашими существующими LDAP / OAuth? "
Аудит безопасностиОтслеживаемые операции, сохраненные журналы«Кто может экспортировать протокол совещания?Был ли экспорт зарегистрирован?Как долго сохраняются ловши? "
Транспортное шифрованиеЗашифрованная внутренняя связь«Является ли TLS внедренным и в интранете, или только на публичной стороне? "
Защита остаточной информацииУдалённые данные должны быть невосстановленными«После удаления встречи, также очищаются ли кэши моделей и временные файлы? "

Первые и последние чаще всего упускаются.

Многие решения заявляют «нет утечка данных», однако лицензионная валидация достигает общественного интернета, модели весов загружаются при первом запуске, а телеметрические телефоны Главная - любой единый публичный вызов ставит под сомнение требование о невыходе во время оценки MLPS;.Спросите, пока не получите жесткий ответ.

Аналогичным образом, если «удалить совещание» удаляет только строку базы данных и оставляет промежуточные файлы и векторные кэши на диске, защита остаточной информации не выполняется.

Смотрите MLPS Level 3 compliance breakdown для полной подробности.

6.Восемь вопросов, на которые нужно ответить перед выбором

Отправьте этот список продавцам или спросите свою собственную команду.Любой вариант, который не может ответить, выводится:

  1. Является ли Любой частью газопровода речевая транскрипция публичным сетевым звонком? (лицензия, модель и телеметрия все учитываются)
  2. Какова сумма одновременных потоков устойчивый на сервер?Устойчивый, а не пик
  3. Поддерживается ли ключевое слово?Жесткое ограничение или мягкое руководство?
  4. Является ли разделение по спикерам Встроено, или добавлен в качестве отдельного модуля?Как обрабатывается пересекающаяся речь?
  5. Какие диалекты поддерживаются?Что такое измеренная точность?Вы можете поделиться тестом?
  6. Поддерживается ли Ascend / Cambricon / Hygon?Внутренне или переносится на сайт?
  7. Поддерживается ли развертывание air-gapped?Что содержит оффлайн пакет?
  8. Что документация предоставляется для оценки MLPS? (топология развертывания, схема потока данных, спецификация журнала аудита)

Вопросы 1 и 7 - это вопросы, которые являются ключевыми.Продавец, который не может ответить на них, не поставляет в условиях реального соответствия.

7.Когда не стоит работать на месте

Слово против наших собственных интересов, так что это не читается как пинг.

Пропускать наpremises, если:

  • Ежедневный объем крошечный (несколько часов в день) - облако с оплатой за использование дешевле и не несет операционную нагрузку
  • Нет требования к соблюдению - если вы можете использовать облако, не тратите шесть цифр на серверы для ощущения безопасности
  • Никто из команды не проводит операций. - после выхода на локацию, обновления моделей, сбои оборудования и настройка производительности - все ваши
  • Вам нужен речевая транскрипция один раз - покупка сервера для транскрипции одной партии, а затем простого пользования - плохая торговля

Правильным триггером для локальной работы является Красная линия или Конкурентное давление - не "это кажется безопаснее. "

8.Как это делает VoiVision

VoiVision создает корпоративную конференционную сеть речевая транскрипция, с полным стеком, разработанным собственным образом от речи до ASR, разделения спикеров и семантической структурирования:

  • 52 года NLP исследования NLP, основанная в 1973 году как лаборатория NEU NLP
  • Опубликовано 200+ документов (20+ CCF-A), 110+ патентов на изобретения (54 предоставлено)
  • NiuTrans - движок машинного перевода, используемый более 100 000 раз по всему миру
  • Вывод В 4 раза быстрее, чем обычные LLM общего назначения на эквивалентном оборудовании
  • Нативная поддержка Ascend 310P / 910B, Cambricon MLU370 / 590, Hygon DCU и NVIDIA T4 / L4 / A10 / A100, а также только CPU-операция.
  • 22 диалекта, и развертывание с воздушным разрывом
  • ≥98% точность китайского речевая транскрипция, с кластерами, поддерживающими более 50 одновременных потоков

Восемь вопросов выше, как есть.Любое решение, которое не может ответить на них, заслуживает второго взгляда, независимо от того, насколько низкая цена.

Нужна оценка вашего уровня MLPS и целевой консолидации? Book a demo, или начать с complete private deployment guide.

FAQ

Q: On-premise или облачный ASR - что лучше?

A: Это зависит от трех условий: ежедневный объем, требования к соответствию и давление на одновременность.С низким ежедневным объемом и отсутствием ограничений соответствия, облачные API, как правило, имеют более низкую трехлетнюю совокупную стоимость владения и гораздо меньшую операционную нагрузку.Когда резидентность данных является жесткой красной линией, применяются правила Xinchuang или сохраняется давление на одновременность, то на месте - правильный вызов.Триггер для локального внедрения - это красная линия соответствия или устойчивая параллельность, а не смутное чувство, что это безопаснее.

Q: Каковы препятствия для самохостинга Whisper?

A: Пять главных: отсутствие поддержки ключевое слово (правильные существительные записываются как похожие звучащие символы, а initial_prompt является только слабым руководством), отсутствие встроенного разделение по спикерам (вы должны добавить pyannote или аналогичный модуль и выровнять временные метки сами), слабая потоковая связь (chunking производит граничные ошибки в точках разделения), по сути нет поддержки диалектов, и отечественные ускорители требуют портирования (экспорт ONNX плюс преобразование ATC, со множеством ловушек).

Q: Как вы рассчитываете трехлетний TCO для наpremises ASR?

A: Не сравнивайте только лицензионные сборы.Включает стоимость речевая транскрипция в час, лицензирование оборудования, программного обеспечения, усилия по внедрению, трехлетние операционные усилия и резервные меры по отказу.Самохостинг с открытым исходным кодом экономит на лицензировании, но затраты на людей - внедрение обычно занимает от одного до двух человеко-месяцев, а операции составляют около 0,3 - 0,5 FTE, выше, когда задействованы внутренние ускорители и развертывание с воздухом.

Q: Что требует MLPS Level 3 при выборе системы протокол совещания для встреч?

A: Пять контрольных элементов: Резидентность данных (аудио и текст хранятся локально, нет публичной загрузки), контроль доступа (проверка личности и разрешения на основе ролей), аудит безопасности (отслеживаемые операции, сохраненные журналы), шифрование транспорта (зашифрованная внутренняя связь) и защита остаточной информации (удалённые данные должны быть невосстановленными).Наиболее упускаемый и наиболее критический вопрос заключается в том, совершает ли какая-либо часть трубопровода вызов в публичную сеть.

Q: Как проверить, действительно ли локальное решение хранит данные в домене?

A: Спросите напрямую, совершает ли какая-либо часть трубопровода речевая транскрипция вызов в общедоступную сеть, и явно включайте проверки лицензий, загрузку веса модели и телеметрию.Любой отдельный публичный запрос поставит под сомнение утверждение "нет утечка данных" в ходе оценки MLPS.

Q: Для 50 часов заседаний в день, в облаке или на месте?

A: Без ограничений соответствия, платное облачное использование обычно стоит значительно меньше за три года.Если применяются требования к резиденции данных, Xinchuang или конфиденциальности, или если сохраняется давление на одновременность, выберите локальную систему.Переломная точка как в экономике, так и в соответствии обычно наступает, когда присутствует либо давление одновременности, либо правило соответствия без облака.

Q: Поддерживает ли локальный ASR Ascend и другие отечественные акселераторы?

A: Это зависит от маршрута.Модели с открытым исходным кодом требуют, чтобы вы выполнили экспорт ONNX и преобразование ATC самостоятельно, что представляет собой значительную работу со многими ловушками.Коммерческие двигатели, которые встроенно поддерживают Ascend 310P / 910B, Cambricon MLU370 / 590 и Hygon DCU, полностью устраняют эти усилия по портированию.Всегда подтвердите, является ли поддержка нативной или требует портирования на сайте.

#Развертывание на месте#ASR выбор#Whisper#MLPS L3#TCO

Персонализированная демо-версия

Расскажите нам о вашем сценарии встреч и потребностях в соблюдении стандартов - получите индивидуальный план.

Забронировать
Онлайн-чат