Tecnología y Ecosistema
Cuatro líneas de hardware · un motor · cobertura completa
Motor de voz IA
Basado en la investigación interna de NEU NLP Lab, re-arquitectó la tubería ASR de la cascada tradicional AM + LM + Decoder en un modelo neuronal de extremo a extremo (E2E). Utilizando el modelado híbrido Conformer + CTC / Attention, combinado con la cuantificación INT8 / INT4, la poda, la destilación del conocimiento, la re-parametrización estructural y la fusión del operador, el motor logra ASR en tiempo real solo con CPU, sin necesidad de GPU. El modelado de lenguaje ligero con compresión de contexto adaptativa reduce la computación LM en más de un 70%, mientras que la precisión del reconocimiento mejora en un 10 - 20% sobre los enfoques tradicionales.
- ▸Modelo E2E: Conformer + híbrido CTC / Attention, eliminando la acumulación de errores de modelado acústico / lenguaje
- ▸Cuantificación y poda de INT8 / INT4: parámetros drásticamente reducidos para la inferencia CPU en tiempo real
- ▸Destilación del conocimiento y re-parametrización estructural: modelo compacto con alta generalización
- ▸Optimización de fusión de operadores y caché: mejora de la eficiencia de la matriz CPU
- ▸LM ligero: compresión de contexto adaptativa interna LM +, reducción del 70% del cálculo
- ▸Entrenamiento mejorado por contexto y autoatención restringida: alta precisión en condiciones de bajos recursos
Apoyo al acelerador
- •NVIDIA: T4 / L4 / A10 / A100
- •Ascend: 310P / 910B
- •Cambricon: MLU370 / MLU590
- •Hygon DCU (solo CPU también funciona)
Integración OA
- •WeCom
- •DingTalk
- •Feishu
- •Landray
- •Seeyon
Despliegue
- •Docker / K8s con un clic
- •Bare-metal
- •Nube pública / nube privada / SIEM
- •RESTful API / WebSocket
ASR × OCR Fusión Multimodal
Conciencia del contenido de la pantalla × mejora dinámica de ASR
VoiVision vincula ASR con en el dispositivo OCR, utilizando el contenido visual de la pantalla (PPT / docs / whiteboard) para impulsar reconocimiento de voz. El BJ66+ WCB06 captura la pantalla a través de canales cableados e inalámbricos; un OCR de gran tamaño de modelo en el dispositivo lee el texto marco por marco; la base de conocimiento de dominio coincide automáticamente e inyecta términos de dominio en el decodificador ASR, elevando la precisión en escenas densas en terminología como conferencias, consultas y roadshows.
Cuatro pasos de bucle cerrado
- ▸1 Captura: BJ66+ WCB06 agarra el flujo de bytes de pantalla (HDMI-in + wireless)
- ▸2 en el dispositivo OCR: análisis marco por marco del texto de PPT / docs / whiteboard
- ▸3 partidos KB: 200+ disciplina palabra clave diccionarios auto-alinear
- ▸4 Inyección palabra clave: términos de dominio inyectados dinámicamente en el decodificador ASR
Ventajas clave
- ✓implementación local totalmente local: los datos nunca dejan espacio
- ✓Dominio intercambiable en caliente KBs (educación / salud / finanzas / derecho)
- ✓Los nuevos dominios no necesitan reentrenamiento de ASR - palabra clave entra en vigencia al instante
- ✓Inyección de palabra clave < 500ms, OCR a nivel de marco < 500ms
Integración de OA
Integrado con las principales plataformas de oficina · acta de reunión en su flujo de trabajo
VoiVision se integra profundamente con las principales plataformas de oficina y colaboración: sincronización automática de acta de reunión, extracción inteligente de todo, administración multiplataforma de un terminal, incrustando Inteligencia de reuniones directamente en los flujos de trabajo empresariales existentes.
WeCom
- •Sincronización de calendario · Contactos
- •Flujo de aprobación · App push
- •Auto acta de reunión sincronización · todo
DingTalk
- •Sincronización de calendario · reunión mgmt
- •Notificar · Aprobar
- •Todo · hojas multidimensionales
Feishu
- •Sincronización de calendario · docs
- •Msg Notificar · Reunión
- •Aprovación · Enterprise Wiki
Landray / Seeyon
- •Integración Eco · SSO
- •Motor de flujo de trabajo
- •Custom self-construido OA
Escribir una demo personalizada
Cuéntanos su escenario de reunión y sus necesidades de cumplimiento - obtenga un plan a medida.
