VoiVision AI

เทค & ระบบนิเวศ

สี่สายฮาร์ดแวร์ · หนึ่งเครื่องยนต์ · ครอบคลุมเต็มรูปแบบ

เอ็นจินเสียง AI

สร้างขึ้นจากการวิจัยภายในของ NEU NLP Lab เราสร้างสถาปัตยกรรมท่อ ASR จากน้ําตก AM + LM + Decoder แบบดั้งเดิมเป็นแบบจําลองประสาทแบบ end-to-end (E2E)การใช้การสร้างแบบจําลองแบบไฮบริด Conformer + CTC / Attention รวมกับการกําหนดปริมาณ INT8 / INT4 การตัดแต่งกิ่งการกลั่นความรู้การปรับพารามิเตอร์โครงสร้างใหม่และฟิวชั่นผู้ประกอบการเครื่องยนต์จะประสบความสําเร็จใน ASR แบบเรียลไทม์บน CPU เพียงอย่างเดียว - ไม่จําเป็นต้องใช้ GPUการสร้างแบบจําลองภาษาที่มีน้ําหนักเบาพร้อมการบีบอัดบริบทแบบปรับตัวช่วยลดการคํานวณ LM มากกว่า 70% ในขณะที่ความแม่นยําในการจดจําเพิ่มขึ้น 10-20% เมื่อเทียบกับวิธีการแบบดั้งเดิม

  • รุ่น E2E: Conformer + CTC / Attention ไฮบริดขจัดการสะสมข้อผิดพลาดการสร้างแบบจําลองอะคูสติก / ภาษา
  • การกําหนดปริมาณและการตัดแต่งกิ่ง INT8 / INT4: ลดพารามิเตอร์อย่างมากสําหรับการอนุมาน CPU แบบเรียลไทม์
  • การกลั่นความรู้และการพารามิเตอร์โครงสร้างใหม่: แบบจําลองขนาดกะทัดรัดที่มีการทั่วไปสูง
  • การเพิ่มประสิทธิภาพการรวมตัวประกอบการและแคช: ปรับปรุงประสิทธิภาพเมทริกซ์ CPU
  • LM น้ําหนักเบา: ภายใน LM + การบีบอัดบริบทแบบปรับตัว, ลดการคํานวณ 70%
  • การฝึกอบรมที่เพิ่มขึ้นในบริบทและความสนใจในตนเองที่จํากัด: ความแม่นยําสูงในสภาวะที่มีทรัพยากรต่ํา

การสนับสนุน Accelerator

  • NVIDIA: T4 / L4 / A10 / A100
  • Ascend: 310P / 910B
  • Cambricon: MLU370 / MLU590
  • Hygon DCU (CPU เท่านั้นยังทํางาน)

การรวม OA เต็มรูปแบบ

  • WeCom
  • DingTalk
  • Feishu
  • Landray
  • Seeyon

การปรับใช้

  • Docker / K8s คลิกเดียว
  • เปลือยโลหะ
  • คลาวด์ Gov / คลาวด์ส่วนตัว / SIEM
  • RESTful API / WebSocket

ASR × OCR ฟิวชั่นมัลติโหมด

การรับรู้เนื้อหาหน้าจอ × การเพิ่มประสิทธิภาพแบบไดนามิก ASR

VoiVision เชื่อมโยง ASR กับบนอุปกรณ์ OCR โดยใช้เนื้อหาภาพของหน้าจอ (PPT / docs / ไวท์บอร์ด) เพื่อเพิ่มการรู้จำเสียงพูด BJ66+ WCB06 จับภาพหน้าจอผ่านช่องทางแบบมีสาย + ไร้สาย; บนอุปกรณ์รุ่นใหญ่ OCR อ่านเฟรมข้อความโดยเฟรม; ฐานความรู้โดเมนจับคู่โดยอัตโนมัติและฉีดคําโดเมนลงในตัวถอดรหัส ASR - ยกความแม่นยําในฉากที่มีความหนาแน่นของคําศัพท์เช่นการบรรยายการให้คําปรึกษาและโรดโชว์

ห่วงปิดสี่ขั้นตอน

  1. 1 การจับภาพ: BJ66+ WCB06 คว้าสตรีมไบต์หน้าจอ (HDMI-in + ไร้สาย)
  2. 2 บนอุปกรณ์ OCR: การวิเคราะห์แบบเฟรมโดยเฟรมของข้อความ PPT / docs / ไวท์บอร์ด
  3. 3 การแข่งขัน KB: 200+ วินัยคำสำคัญพจนานุกรมอัตโนมัติจัดตําแหน่ง
  4. 4 การฉีดคำสำคัญ: คําศัพท์โดเมนแบบไดนามิกฉีดเข้าไปในตัวถอดรหัส ASR

ข้อดีที่สําคัญ

  • การติดตั้งแบบ on-premise ท้องถิ่นอย่างเต็มที่ - ข้อมูลไม่เคยออกจากห้อง
  • โดเมนแบบ Hot-swappable KBs (การศึกษา / การดูแลสุขภาพ / การเงิน / กฎหมาย)
  • โดเมนใหม่ไม่จําเป็นต้องฝึกซ้อม ASR - คำสำคัญมีผลทันที
  • การฉีดคำสำคัญ <500ms, ระดับเฟรม OCR <500ms
ความถูกต้องของคํา ASR ทั่วไป ~72% →ฟิวชั่น ASR×OCR ยกขึ้นเป็น 94%+ (การทดสอบการบรรยายชั่วโมง NEU NLP Lab)

การบูรณาการ OA

ไม่มีรอยต่อกับแพลตฟอร์มสํานักงานหลัก · บันทึกการประชุมเข้าสู่เวิร์กโฟลว์ของคุณ

VoiVision บูรณาการอย่างลึกซึ้งกับแพลตฟอร์มสํานักงานและการทํางานร่วมกันชั้นนํา - การซิงค์บันทึกการประชุมอัตโนมัติการสกัดแบบอัจฉริยะการจัดการหลายแพลตฟอร์มแบบเทอร์มินัลเดียว - ฝังประชุมอัจฉริยะโดยตรงในเวิร์กโฟลว์ขององค์กรที่มีอยู่

WeCom

  • การซิงค์ปฏิทิน·รายชื่อ
  • กระแสการอนุมัติ·ผลักดันแอป
  • ซิงค์อัตโนมัติบันทึกการประชุม·todo

DingTalk

  • ปฏิทินซิงค์·การประชุม mgmt
  • DING แจ้ง·อนุมัติ
  • Todo·แผ่นหลายมิติ

Feishu

  • ซิงค์ปฏิทิน·เอกสาร
  • Msg แจ้ง·ประชุม
  • อนุมัติ·วิกิองค์กร

Landray / Seeyon

  • บูรณาการเชิงนิเวศ·SSO
  • การเชื่อมโยงเครื่องยนต์เวิร์คโฟลว์
  • OA ที่สร้างขึ้นเองเอง

จองการสาธิตส่วนบุคคล

บอกเราสถานการณ์การประชุมและความต้องการในการปฏิบัติตามกฎระเบียบของคุณ - รับแผนที่เหมาะสม

จองเลย
แชทสด