VoiVision AI

技术与生态

四款硬件 · 同一引擎 · 全场景覆盖

AI 语音引擎

基于东北大学 NLP 实验室自研算法,我们对 ASR 引擎的算法与架构进行了重构:将传统的声学模型+语言模型+解码器级联管线优化为端到端(E2E)神经网络模型,采用 Conformer + CTC/Attention 混合建模,并结合模型量化(INT8/INT4)、剪枝、知识蒸馏、结构重参数化与算子融合等技术,使系统在纯 CPU 上即可实现实时语音识别,无需 GPU。语言建模轻量化与自适应上下文压缩机制将语言模型计算负担减少约 70% 以上,识别准确率较传统方案提升 10–20%。

  • 端到端模型:Conformer + CTC/Attention 混合建模,消除声学与语言建模误差累积
  • 模型量化(INT8/INT4)与剪枝:显著降低参数规模,CPU 实时推理
  • 知识蒸馏与结构重参数化:紧凑模型保持高泛化能力
  • 算子融合与缓存优化:提升 CPU 端矩阵运算效率
  • 轻量化语言模型:内嵌式 LM + 自适应上下文压缩,减少 70% 计算负担
  • 上下文增强训练与自注意力约束:低资源条件下仍保持高准确率

适配算力

  • NVIDIA:T4 / L4 / A10 / A100
  • 昇腾 Ascend:310P / 910B
  • 寒武纪 Cambricon:MLU370 / MLU590
  • 海光 Hygon DCU(纯 CPU 亦可)

全平台 OA 对接

  • 企业微信
  • 钉钉
  • 飞书
  • 蓝凌
  • 致远互联

部署方式

  • Docker / K8s 容器化一键部署
  • 物理机裸金属
  • 政务云 / 私有云 / 信创环境
  • RESTful API / WebSocket 标准接口

ASR × OCR 多模态融合创新

投屏内容感知 × 语音识别动态增强

语像智能将 ASR 与端侧 OCR 联动,用投屏画面(PPT / 文档 / 板书)的视觉内容反向增强语音识别。BJ66+WCB06 双通道捕获投屏画面,端侧大模型 OCR 逐帧识别文字,领域知识库自动匹配并将专业术语动态注入 ASR 解码器,让转写在上课、会诊、路演等术语密集场景下准确率显著提升。

四步技术闭环

  1. ① 画面采集:BJ66+WCB06 捕获投屏画面字节流(有线 HDMI + 无线双通道)
  2. ② 端侧 OCR:逐帧解析 PPT / 文档 / 板书文字内容
  3. ③ 知识库匹配:200+ 学科领域热词自动对齐
  4. ④ 热词注入:领域术语动态注入 ASR 解码器

核心优势

  • 纯本地私有化部署,数据不出教室 / 会议室
  • 多领域知识库热插拔(教育 / 医疗 / 金融 / 法律等)
  • 新增领域无需重新训练 ASR,热词即时生效
  • 热词注入延迟 < 500ms,帧级 OCR 处理 < 500ms
通用 ASR 术语识别率基线约 72% → 融合 ASR×OCR 方案后提升至 94%+(东北大学 NLP 实验室课时实测)

OA 对接集成

与主流办公平台无缝对接 · 让纪要直达工作流

语像智能深度集成主流办公与协作平台,纪要自动同步、待办智能提取、多平台一终端管理,把会议智能直接嵌入企业已有的工作流。

企业微信

  • 日程同步 · 通讯录打通
  • 审批流转 · 应用消息推送
  • 纪要自动同步 · 待办协同

钉钉

  • 日程同步 · 会议管理
  • DING 通知 · 审批流转
  • 待办协同 · 多维表格

飞书

  • 日历同步 · 文档集成
  • 消息通知 · 会议管理
  • 审批流转 · 企业百科

蓝凌 / 致远互联

  • 生态对接 · 单点登录
  • 流程引擎打通
  • 企业自建 OA 定制对接

预约一场专属 Demo

告诉我们你的会议场景与合规要求,获取一对一定制方案。

立即预约
在线咨询