VoiVision AI

Công nghệ & Hệ sinh thái

Bốn dòng phần cứng · một động cơ · bảo hiểm đầy đủ

Động cơ giọng nói AI

Được xây dựng dựa trên nghiên cứu trong nhà của NEU NLP Lab, chúng tôi đã kiến trúc lại đường ống ASR từ thác truyền thống AM + LM + Decoder thành mô hình thần kinh đầu-đến-đầu (E2E). Sử dụng mô hình lai Conformer + CTC / Attention, kết hợp với lượng tử hóa INT8 / INT4, cắt tỉa, chưng cất kiến thức, cấu trúc tái tham số hóa và hợp nhất vận hành, động cơ đạt được ASR thời gian thực trên CPU một mình - không cần GPU. Mô hình ngôn ngữ nhẹ với nén ngữ cảnh thích ứng làm giảm tính toán LM lên hơn 70%, trong khi độ chính xác nhận dạng cải thiện 10-20% so với các phương pháp truyền thống.

  • Mô hình E2E: Conformer + CTC / Attention hybrid, loại bỏ sự tích lũy lỗi mô hình âm thanh / ngôn ngữ
  • INT8 / INT4 lượng tử hóa & cắt tỉa: giảm đáng kể các thông số cho thời gian thực CPU suy luận
  • Chưng cất kiến thức và cấu trúc tái tham số hóa: mô hình nhỏ gọn với tổng quát hóa cao
  • Operator fusion & cache optimization: cải thiện hiệu quả ma trận CPU
  • LM nhẹ: nội bộ LM + nén ngữ cảnh thích ứng, giảm 70% tính toán
  • Context-enhanced training & constrained self-attention: độ chính xác cao trong điều kiện nguồn lực thấp

Hỗ trợ Accelerator

  • NVIDIA: T4 / L4 / A10 / A100
  • Ascend: 310P / 910B
  • Cambricon: MLU370 / MLU590
  • Hygon DCU (chỉ có CPU cũng hoạt động)

Tích hợp đầy đủ OA

  • WeCom
  • DingTalk
  • Feishu
  • Landray
  • Seeyon

Triển khai

  • Docker / K8s một lần nhấp chuột
  • Trần kim loại
  • Đám mây Gov / đám mây riêng / SIEM
  • RESTful API / WebSocket

ASR × OCR Đa phương thức Fusion

Nhận thức về nội dung màn hình × tăng cường ASR năng động

VoiVision liên kết ASR với trên thiết bị OCR, sử dụng nội dung trực quan của màn hình (PPT / docs / whiteboard) để tăng cường nhận dạng giọng nói. BJ66+ WCB06 chụp màn hình thông qua các kênh có dây + không dây; OCR mô hình lớn trên thiết bị đọc từng khung văn bản; cơ sở kiến thức miền tự động phù hợp và tiêm các thuật ngữ miền vào bộ giải mã ASR - nâng cao độ chính xác trong các cảnh dày đặc thuật ngữ như các bài giảng, tư vấn và roadshow.

Vòng khép kín bốn bước

  1. 1 Chụp: BJ66+ WCB06 nắm lấy dòng byte màn hình (HDMI-in + không dây)
  2. 2 trên thiết bị OCR: phân tích từng khung của văn bản PPT / docs / whiteboard
  3. 3 KB trận đấu: 200+ kỷ luật từ khóa từ điển tự động căn chỉnh
  4. 4 Tiêm từ khóa: các thuật ngữ miền được tiêm động vào bộ giải mã ASR

Ưu điểm chính

  • Hoàn toàn địa phương triển khai tại chỗ - dữ liệu không bao giờ rời khỏi phòng
  • Tên miền có thể hoán đổi nóng KBs (giáo dục / chăm sóc sức khỏe / tài chính / pháp luật)
  • Tên miền mới không cần đào tạo lại ASR - từ khóa có hiệu lực ngay lập tức
  • Tiêm từ khóa < 500ms, OCR cấp khung < 500ms
Độ chính xác cơ bản của thuật ngữ chung ASR ~72% → ASR × OCR fusion nâng lên 94%+ (Kiểm tra giờ giảng dạy của NEU NLP Lab)

Tích hợp OA

Liên tục với các nền tảng văn phòng chính · biên bản cuộc họp vào quy trình làm việc của bạn

VoiVision tích hợp sâu với các nền tảng văn phòng và cộng tác hàng đầu - đồng bộ hóa biên bản cuộc họp tự động, khai thác todo thông minh, quản lý đa nền tảng một thiết bị đầu cuối - nhúng Trí tuệ cuộc họp trực tiếp vào các quy trình công việc của doanh nghiệp hiện có.

WeCom

  • Đồng bộ hóa lịch · liên hệ
  • Quy trình phê duyệt · ứng dụng đẩy
  • Tự động biên bản cuộc họp đồng bộ · todo

DingTalk

  • Đồng bộ hóa lịch · cuộc họp mgmt
  • ĐING thông báo · chấp thuận
  • Todo · tấm đa chiều

Feishu

  • Đồng bộ hóa lịch · docs
  • Msg thông báo · cuộc họp
  • Phê duyệt · wiki doanh nghiệp

Landray / Seeyon

  • Tích hợp sinh thái · SSO
  • Liên kết công cụ Workflow
  • Tùy chỉnh tự xây dựng OA

Đặt một bản demo cá nhân

Hãy cho chúng tôi biết kịch bản cuộc họp và nhu cầu tuân thủ của bạn - nhận một kế hoạch phù hợp.

Đặt lịch ngay
Trò chuyện trực tiếp