VoiVision AI

Tech & النظام البيئي

أربعة خطوط الأجهزة · محرك واحد · تغطية كاملة

محرك الكلام بالذكاء الاصطناعي

بناءً على الأبحاث الداخلية لمختبر NEU NLP ، أعادنا تصميم خط أنابيب ASR من سلسلة AM + LM + Decoder التقليدية إلى نموذج عصبي من النهاية إلى النهاية (E2E).باستخدام النمذجة الهجينة Conformer + CTC / Attention ، جنبا إلى جنب مع التقييم الكمي INT8 / INT4 ، والتشذيب ، وتقطير المعرفة ، وإعادة المعلمات الهيكلية ، والاندماج المشغل ، يحقق المحرك ASR في الوقت الفعلي على CPU وحده - لا حاجة إلى GPU.إن نمذجة اللغة الخفيفة الوزن مع ضغط السياق التكيفي تقلل من حوسبة LM بأكثر من 70٪ ، في حين أن دقة التعرف تحسن بنسبة 10-20٪ مقارنة بالنهج التقليدية.

  • نموذج E2E: Conformer + CTC / Attention الهجين ، والقضاء على تراكم خطأ النمذجة الصوتية / اللغة
  • INT8 / INT4 الكمية والتشذيب: انخفاض كبير في المعلمات للاستدلال CPU في الوقت الحقيقي
  • تقطير المعرفة وإعادة المعلمات الهيكلية: نموذج مدمج مع تعميم عال
  • تحسين اندماج المشغل و ذاكرة التخزين المؤقت: تحسين كفاءة مصفوفة CPU
  • خفيفة الوزن LM: LM الداخلية + ضغط السياق التكيفي ، 70٪ الحساب الحد
  • التدريب المعزز في السياق والاهتمام الذاتي المقيد: دقة عالية في الظروف المنخفضة الموارد

دعم المسرع

  • NVIDIA: T4 / L4 / A10 / A100
  • Ascend: 310P / 910B
  • Cambricon: MLU370 / MLU590
  • Hygon DCU (يعمل CPU فقط أيضًا)

التكامل الكامل لـ OA

  • WeCom
  • DingTalk
  • Feishu
  • Landray
  • Seeyon

النشر

  • Docker / K8s نقرة واحدة
  • Bare-metal
  • السحابة الحكومية / السحابة الخاصة / SIEM
  • RESTful API / WebSocket

ASR × OCR الاندماج متعدد الوسائط

الوعي بمحتوى الشاشة × تعزيز ASR الديناميكي

تقوم VoiVision بربط ASR مع على الجهاز OCR ، وذلك باستخدام المحتوى المرئي للشاشة (PPT / docs / whiteboard) لتعزيز التعرف على الكلام.يلتقط BJ66+ WCB06 الشاشة عبر القنوات السلكية + اللاسلكية ؛ يقرأ على الجهاز نموذج كبير OCR النص الإطار تلو الآخر ؛ تقوم قاعدة معرفة المجال بالتطابق التلقائي مع مصطلحات المجال وحقنها في فك تشفير ASR - مما يرفع الدقة في المشاهد الكثيفة المصطلحات مثل المحاضرات والاستشارات والعروض الطرقية.

حلقة مغلقة من أربع خطوات

  1. 1 التقاط: BJ66+ WCB06 يمسك تيار بايت الشاشة (HDMI-in + لاسلكي)
  2. 2 على الجهاز OCR: تحليل الإطار حسب الإطار لـ PPT / docs / نص اللوح البيضاء
  3. 3 KB مباراة: 200+ الانضباط كلمة مفتاحية القواميس المحاذاة التلقائية
  4. 4 حقن كلمة مفتاحية: مصطلحات المجال حقن ديناميكيا في ASR فك الترميز

المزايا الرئيسية

  • النشر المحلي المحلية بالكامل - البيانات لا تترك مكانًا
  • نطاق قابل للتبديل الساخن KBs (التعليم / الرعاية الصحية / المالية / القانون)
  • النطاقات الجديدة لا تحتاج إلى إعادة تدريب ASR - كلمة مفتاحية تنفذ على الفور
  • حقن كلمة مفتاحية <500ms ، OCR على مستوى الإطار <500ms
خط الأساس دقة مصطلح ASR العام ~ 72٪ → ASR × OCR الاندماج يرفع إلى 94٪ + (اختبار ساعة المحاضرة NEU NLP مختبر)

OA التكامل

سلس مع المنصات المكتبية الرئيسية · محضر الاجتماع في سير العمل الخاص بك

تتكامل VoiVision بشكل عميق مع منصات المكاتب والتعاون الرائدة - مزامنة محضر الاجتماع التلقائية ، واستخراج todo الذكي ، وإدارة متعددة المنصات ذات محطة واحدة - تضمين ذكاء الاجتماعات مباشرة في سير عمل المؤسسة الحالية.

WeCom

  • مزامنة التقويم • جهات الاتصال
  • تدفق الموافقة · دفع التطبيق
  • السيارات محضر الاجتماع مزامنة · todo

DingTalk

  • مزامنة التقويم • اجتماع mgmt
  • DING إشعار · موافقة
  • Todo · أوراق متعددة الأبعاد

Feishu

  • مزامنة التقويم •docs
  • Msg إشعار • الاجتماع
  • الموافقة · ويكي المؤسسة

Landray / Seeyon

  • التكامل الإيكولوجي • SSO
  • رابط محرك سير العمل
  • مخصص الذاتي بنيت OA

احجز عرض تجريبي شخصي

أخبرنا عن سيناريو الاجتماع واحتياجات الامتثال الخاصة بك - احصل على خطة مخصصة.

احجز الآن
دردشة مباشرة