Tecnologia e Ecossistema
Quatro linhas de hardware · um motor · cobertura total
Motor de voz IA
Com base na pesquisa interna do NEU NLP Lab, re-arquitetamos o pipeline ASR da cascata tradicional AM + LM + Decoder em um modelo neural de ponta a ponta (E2E). Usando a modelagem híbrida Conformer + CTC / Attention, combinada com quantização INT8 / INT4, poda, destilação de conhecimento, re-parametrização estrutural e fusão de operadores, o motor alcança ASR em tempo real em CPU sozinho - sem GPU necessário. A modelagem de linguagem leve com compressão de contexto adaptativa reduz a computação LM em mais de 70%, enquanto a precisão de reconhecimento melhora 10 - 20% em comparação com as abordagens tradicionais.
- ▸Modelo E2E: Conformer + híbrido CTC / Attention, eliminando o acúmulo de erros de modelagem acústica / linguagem
- ▸Quantização e poda INT8 / INT4: parâmetros drasticamente reduzidos para inferência CPU em tempo real
- ▸Destilação de conhecimento e re-parametrização estrutural: modelo compacto com alta generalização
- ▸Fusão de operadores e otimização de cache: eficiência melhorada da matriz CPU
- ▸LM leve: compressão de contexto adaptativa interna LM +, redução de 70% de computação
- ▸Treinamento contextualizado e auto-atenção restringida: alta precisão em condições de baixos recursos
Suporte acelerador
- •NVIDIA: T4 / L4 / A10 / A100
- •Modelo: 310P / 910B
- •Cambricon: MLU370 / MLU590
- •Hygon DCU (somente CPU também funciona)
Integração OA
- •WeCom
- •DingTalk
- •Feishu
- •Landray
- •Seeyon
implantação
- •Docker / K8s com um clique
- •Bare-metal
- •Nuvem governamental / nuvem privada / SIEM
- •RESTful API / WebSocket
Fusão Multimodal ASR × OCR
Consciência de conteúdo da tela × aprimoramento dinâmico ASR
O VoiVision liga o ASR com o no dispositivo OCR, usando o conteúdo visual da tela (PPT / docs / whiteboard) para aumentar o reconhecimento de fala. O BJ66+ WCB06 captura a tela através de canais com fio + sem fio; um OCR de grande modelo no dispositivo lê o texto quadro por quadro; a base de conhecimento de domínio combina automaticamente e injeta termos de domínio no decodificador ASR - aumentando a precisão em cenas de terminologia densa, como palestras, consultas e roadshows.
Loop fechado de quatro etapas
- ▸1 Captura: BJ66+ WCB06 agarra o fluxo de bytes da tela (HDMI-in + wireless)
- ▸2 no dispositivo OCR: análise frame-by - frame de texto PPT / docs / whiteboard
- ▸3 KB jogo: 200+ disciplina palavra-chave dicionários auto alinhamento
- ▸4 Injeção palavra-chave: termos de domínio injetados dinamicamente no decodificador ASR
Principais vantagens
- ✓implantação local totalmente local - dados nunca deixam espaço
- ✓Domínio hot-swappable KBs (educação / saúde / finanças / direito)
- ✓Novos domínios não precisam de treinamento ASR - palavra-chave entra em vigor imediatamente
- ✓Injeção palavra-chave < 500ms, nível de quadro OCR < 500ms
Integração OA
Inteligente com as principais plataformas de escritório · ata de reunião no seu fluxo de trabalho
O VoiVision integra-se profundamente com as principais plataformas de escritório e colaboração - sincronização automática do ata de reunião, extração inteligente de todo, gerenciamento multi-plataforma de terminal único - incorporando o Inteligência de reuniões diretamente nos fluxos de trabalho da empresa existentes.
WeCom
- •Sincronização de calendário · contatos
- •Fluxo de aprovação · App Push
- •Auto ata de reunião sincronização · todo
DingTalk
- •Sincronização de calendário · reunião mgmt
- •DING Notificar · Aprovação
- •Todo · folhas multidimensionais
Feishu
- •Sincronização do calendário · docs
- •Msg Notificar · Reunião
- •Aprovação · Enterprise Wiki
Landray / Seeyon
- •Integração Eco · SSO
- •Link do motor de fluxo de trabalho
- •Customizado auto-construído OA
Reserve uma demo personalizada
Conte-nos o seu cenário de reunião e as necessidades de conformidade - obtenha um plano personalizado.
