VoiVision AI
tech· VoiVision AI Engineering

Sau độ chính xác 98%: năm công đoạn quyết định chất lượng biên bản cuộc họp

Độ chính xác của phiên âm giọng nói chỉ là vé nhập cảnh. Cho dù biên bản cuộc họp thực sự có thể sử dụng được phụ thuộc vào năm giai đoạn nữa: phân tách người nói, mẫu tóm tắt, trích xuất hành động, đánh bóng đoạn văn và một chuỗi thực sự ngoại tuyến. Bài viết này đi qua từng giai đoạn từ góc độ kiểm tra chấp nhận của người mua, với các chế độ thất bại phổ biến và danh sách kiểm tra bạn có thể sử dụng trực tiếp.


Gặp gỡ chất lượng biên bản cuộc họp: năm giai đoạn kỹ thuật

Nhiều người mua tập trung toàn bộ đánh giá vào một con số duy nhất: Độ chính xác của phiên âm giọng nói. 98% nghe có vẻ ấn tượng. Sau đó, ba tháng sau khi đi trực tiếp, phản hồi thực sự đến - "Chúng ta vẫn phải chỉ định ai đó để dọn dẹp nó. "

Vấn đề là trộn lẫn hai thứ khác nhau. Độ chính xác phiên âm giọng nói xác định liệu các từ có đúng hay không. biên bản cuộc họp khả năng sử dụng xác định liệu đầu ra có thể được sử dụng như là. Vị trí thứ hai vẫn còn năm cổng để vượt qua.

Ghi chú: Bài viết này được tổ chức từ quan điểm kiểm tra chấp nhận của người mua. Các tuyên bố khả năng làm theo sản phẩm được công bố Thông số kỹ thuật; số liệu thông lượng là giá trị được công bố và thay đổi theo điều kiện âm thanh, kích thước mô hình và chiến lược đồng thời - đo chúng trên trang web.

Giai đoạn 1: phân tách người nói - ai nói điều này?

biên bản cuộc họp mà không có loa quy định đọc như thế này: *"Tôi nghĩ kế hoạch này hoạt động... Rủi ro quá cao... Hãy thử nó trước. * Ai đồng ý, ai phản đối - hoàn toàn vô hình. biên bản cuộc họp như thế này còn tệ hơn không có, bởi vì họ đưa ra các quyết định sai lầm.

Hai khái niệm được kết hợp ở đây, và kiểm tra chấp nhận phải tách chúng ra:

Khả năngCâu hỏi được trả lờiĐiều kiện tiên quyếtphù hợp nhất để
phân tách người nóiAi đã nói phần này (Speaker 1 / Speaker 2)Không cóCác cuộc họp với sự thay đổi của những người tham dự
Nhận dạng vân tay giọng nóiThành viên nào trong nhóm này (Alice / Bob)Các mẫu in giọng nói đã đăng kýCác cuộc họp với danh sách ổn định

phân tách người nói hoạt động thông qua tích hợp với hệ thống âm thanh và cuộc họp địa phương, tự động ghi âm và dán nhãn người nói. Nó ra nhãn vai trò - không cần phải biết danh tính trước, phù hợp với các cuộc họp với những người tham gia bên ngoài.

Nhận dạng vân tay giọng nói đi xa hơn và gán lời nói cho danh tính thực: nó phân tích dấu giọng nói trong phiên âm giọng nói trực tiếp hoặc tập tin, phân biệt người nói và hiển thị thông tin vai trò, với quản lý thư viện dấu giọng nói đầy đủ (đăng ký, đổi tên, xóa). Nó phù hợp với các cuộc họp định kỳ với một danh sách cố định - ủy ban điều hành, ủy ban đầu tư, nhóm làm việc thường trực.

Chế độ thất bại phổ biến

  • Thử nghiệm với một mẫu đọc loa đơn: Một giọng nói duy nhất không thể kiểm tra sự tách biệt. Bạn cần một bản ghi âm thực sự với sự gián đoạn và lời nói chồng chéo.
  • Toàn bộ phân khúc sai quy định: khi hai giọng nói nghe giống nhau, mô hình có thể gán toàn bộ phần kéo dài cho nhầm người - tồi tệ hơn là không phân biệt chúng.
  • Không có quản lý in giọng nói: nếu bạn không thể đổi tên hoặc xóa dấu vân âm sau khi thay đổi nhân viên, tính năng này sẽ chết trong vòng sáu tháng.

Hành động chấp nhận

Hãy thực hiện một bản ghi âm thực sự với Ba người hoặc nhiều người tham gia và gián đoạn (không phải là kịch bản đọc) và kiểm tra xem nhãn vai trò có bị xáo trộn hay toàn bộ phân đoạn đi đến nhầm người. Nếu bạn đang đánh giá tuyến đường in giọng nói, hãy thử nghiệm đăng ký, đổi tên và xóa.

Giai đoạn 2: Thế hệ tóm tắt - kết luận có tồn tại không?

Lỗi tóm tắt phổ biến nhất là Sử dụng sai template.

Các loại cuộc họp khác nhau cần cấu trúc tóm tắt khác nhau. Bốn template được cung cấp:

Loại cuộc họpMẫu (Template)Những gì bản tóm tắt nên chứa
Đồng bộ hóa thông tinĐịnh hướng tóm tắtCác điểm chính, trạng thái tiến độ
Cuộc họp quyết địnhĐịnh hướng kết luậnQuyết định cuối cùng, bất đồng, các mục mở
Hội thảo / BrainstormThảo luận đa đảngNhững điểm tranh chấp, những điểm tranh chấp
Báo cáo lênĐịnh hướng báo cáoĐầu tiên, hỗ trợ dữ liệu

Tại sao mẫu không phù hợp là kẻ giết người số một: chạy một cuộc họp quyết định thông qua một mẫu định hướng tóm tắt và mô hình nén các cuộc thảo luận thành một đoạn trơn tru - Làm phẳng các kết luận và bất đồng với nhau. Tuy nhiên, trong một cuộc họp quyết định, các kết luận và bất đồng là những phần duy nhất quan trọng.

Khả năng tóm tắt phải bao gồm cả cuộc họp trực tiếp và các tệp âm thanh / video. Nghĩa là biên bản cuộc họp xuất hiện khi cuộc họp kết thúc, và một bản ghi âm lịch sử được thả vào sau đó cũng có thể được tóm tắt.

Chế độ thất bại phổ biến

  • Đánh giá bản tóm tắt chỉ bằng Fluency: Một bản tóm tắt trôi chảy mà mất đi kết luận nguy hiểm hơn một bản vụng về, bởi vì nó trông ổn.
  • Bỏ qua loại cuộc họp: một mẫu cho tất cả mọi thứ.
  • Không có bản tóm tắt cho tập tin phiên âm giọng nói: chỉ có các cuộc họp trực tiếp được xử lý, vì vậy các bản ghi âm lịch sử không thể được lưu trữ một cách hữu ích.

Hành động chấp nhận

Chuẩn bị bốn bản ghi âm của các loại cuộc họp khác nhau, áp dụng mẫu phù hợp cho mỗi loại, và Tập trung vào việc liệu các kết luận và bất đồng có được bảo tồn đầy đủ hay không thay vì đọc để mịn màng.

Giai đoạn 3: trích xuất hành động - nó có thực sự được thực hiện không?

Điều thúc đẩy mọi thứ sau một cuộc họp là danh sách hành động. biên bản cuộc họp không có các mục hành động là một bản ghi, không phải là một công cụ quản lý.

Chuỗi cốt lõi là: Xác định các câu lệnh kiểu hành động và bên chịu trách nhiệm từ các kết luận → đầu ra cấu trúc task, owner và source passage → đẩy qua một API tiêu chuẩn vào quy trình công việc hiện có.

Có một yêu cầu khó khăn ở đây mà rất dễ bị bỏ qua: các mục hành động phải giữ nguyên nguồn gốc của chúng. Nếu tất cả những gì bạn nhận được là "hoàn thành nghiên cứu vào thứ Tư tới ", không ai biết trong bối cảnh nào điều đó đã được nói hoặc ai đã đưa ra nó - đường mòn trách nhiệm đã bị phá vỡ.

Sự tích hợp cũng quan trọng như vậy. Các mục hành động được trích xuất phải tiếp cận các hệ thống mà mọi người đã sử dụng: WeCom, DingTalk hoặc Feishu trong nội bộ, các hệ thống OA của chính phủ như Landray và Seeyon trong các thiết lập khu vực công. Nếu các mục hành động chỉ có thể ngồi bên trong hệ thống này cho đến khi ai đó di chuyển chúng bằng tay, tính năng này gần như không đáng giá.

Chế độ thất bại phổ biến

  • Không có nguồn tham khảo: không thể được truy tìm lại từ ngữ và ngữ cảnh.
  • Không tích hợp: các mục hành động không thể rời khỏi hệ thống, điều đó cũng tốt như không trích xuất chúng.
  • Khai thác quá mức: xử lý "để lát nữa chúng ta bàn lại chuyện này" như một mục hành động.

Hành động chấp nhận

Chọn ba mục hành động và đẩy chúng qua việc tích hợp vào hệ thống thực sự đang sử dụng (WeCom / DingTalk / Feishu / OA). Xác nhận tất cả chủ sở hữu, nhiệm vụ và nguồn đoạn đều sống sót sau khi giao hàng.

Giai đoạn 4: Đánh bóng đường đi - nó có thể đọc được không?

Các cuộc họp thực sự nghe như thế này: "vì vậy, um, chúng ta sẽ đẩy điều đó trở lại một chút, bởi vì cái trước đó đã không, bạn biết đấy, chưa. "

Raw phiên âm giọng nói buộc người đọc phải nỗ lực thực sự để xây dựng lại ý nghĩa.Đánh bóng giải quyết năm loại vấn đề:

Loại vấn đềLàm thế nào nó xuất hiện
Dự phòngLời bài hát: Repeated Lead-In
Trật tự từ ScrambledInversions, parenthesical interruptions
Từ ngữ kémTài liệu tham khảo không rõ ràng, thuật ngữ bị lạm dụng
Thiếu các kết nối logicCác câu mất liên kết nhân quả của họ
Trượt và lặp lạiTự sửa dư

Nhưng có một hạn chế không thể vượt qua: đánh bóng không được làm rơi thông tin quan trọng hoặc thay đổi giọng nói của người nói.

Tại sao điều này lại quan trọng? Bởi vì quá đánh bóng số lượng để đặt các từ trong miệng của người nói. Trong biên bản cuộc họp chính thức - đặc biệt là trong các cơ sở chính phủ và pháp lý - hồ sơ mang một tính chất gần bằng chứng. Nếu AI đánh bóng một nhận xét được bảo vệ thành một cam kết vững chắc, trách nhiệm giải trình sẽ bị phá vỡ.

Chế độ thất bại phổ biến

  • Đánh bóng quá mức: Thay đổi "chúng tôi có thể xem xét nó " thành" chúng tôi đồng ý " thay đổi hoàn toàn bản chất của tuyên bố.
  • Không đánh bóng: bàn giao lời nói thông tục thô cho người đọc phá hủy khả năng sử dụng.
  • Tông màu phẳng: chuyển đổi một nhận xét ngoại giao thành một nhận xét thẳng thắn.

Hành động chấp nhận

So sánh các đoạn đánh bóng với bản ghi âm gốc câu nói theo câu nói, kiểm tra hai điều: có bất kỳ thông tin quan trọng nào bị bỏ rơi, và âm điệu đã bị thay đổi.

Giai đoạn 5: Chuỗi ngoại tuyến - sự tuân thủ có thực sự giữ?

Tuy nhiên, bốn giai đoạn đầu tiên tốt, nếu giai đoạn này sụp đổ, giải pháp chỉ đơn giản là không tuân thủ trong khu vực công và các cài đặt được quy định.

Có một khoảng cách mà hầu hết người mua bỏ lỡ ở đây: phiên âm giọng nói rất dễ chạy ngoại tuyến, nhưng Thế hệ tóm tắt là giai đoạn bị bỏ qua.

Nếu Kiến trúc là "transcribe to text locally, then send the text to a cloud LLM for summary", sau đó:

Âm thanh không bao giờ rời khỏi trang web, nhưng Toàn bộ nội dung của cuộc họp là.Đối với MLPS Cấp 3, các kịch bản tài chính và chính phủ, điều đó trực tiếp mâu thuẫn với cam kết "không có dữ liệu rời khỏi trang web".

Vì vậy, sự chấp nhận phải bao gồm một hành động cụ thể: chạy lại toàn bộ đường ống với mạng hoàn toàn ngắt kết nối, đặc biệt theo dõi giai đoạn tóm tắt.

Một vòng lặp thực sự đóng chạy cả mô hình nhận dạng và tóm tắt tại địa phương, Không yêu cầu giấy phép đám mây - và điều này liên quan đến kênh kiểm tra giấy phép, cũng nên được xác minh không khí (một số giải pháp sao chép tại địa phương nhưng cần truy cập mạng để xác nhận giấy phép, điều này cũng sẽ làm suy yếu lời hứa "không thoát" trong quá trình đánh giá).

Để biết các yêu cầu tuân thủ cơ bản, hãy xem phân tích của chúng tôi về MLPS Level 3 requirements for meeting recording and minutes systems.

Chế độ thất bại phổ biến

  • Xác minh phiên âm giọng nói ngoại tuyến nhưng không tóm tắt: lỗ phổ biến nhất.
  • Bỏ qua kênh kiểm tra giấy phép: phiên âm giọng nói chạy cục bộ, nhưng mọi startup đều gọi Trang chủ.
  • Sự suy giảm im lặng thay vì một lỗi: hệ thống lặng lẽ rơi trở lại một dòng chảy giảm mà không có dấu hiệu hiển thị cho người dùng.

Hành động chấp nhận

Chạy lại đường ống đầy đủ không khí. Nếu giai đoạn tóm tắt bị lỗi hoặc giảm mạnh, nó phụ thuộc vào đám mây và giải pháp không tuân thủ.

Phụ lục: Một danh sách kiểm tra bạn có thể sử dụng như là

Năm giai đoạn được nén thành một bảng - đánh dấu mỗi giai đoạn trong quá trình chấp nhận:

#MụcPhương phápTiêu chí vượt qua
1phân tách người nóiGhi âm đa bên thực sựKhông có toàn bộ phân đoạn sai quy định
2Nhận dạng vân tay giọng nói (nếu được chọn)Đăng ký / đổi tên / xóaCả ba hành động đều hoạt động
3Kết hợp mẫu tóm tắtKiểm tra tất cả 4 loại họpKết luận và bất đồng được bảo tồn
4File-phiên âm giọng nói tóm tắtNhập khẩu một bản ghi lịch sửSummary được sản xuất
5Action-item trích xuấtĐẩy ba mục kết thúc để kết thúcNhiệm vụ / chủ sở hữu / nguồn tất cả hiện diện
6Tích hợp hệ thốngKết nối với mục tiêu OA / IMCác mục nhập vào dòng công việc hiện có
7Đánh bóng đường điSo sánh mức câu với âm thanhKhông mất thông tin, không thay đổi giai điệu
8Định dạng đầu raKiểm tra xuất khẩuVăn bản / đồ họa / các mục hành động / bản đồ tâm trí
9Chuỗi ngoại tuyếnChạy lại không khí-gapedMọi thứ đều hoạt động, bao gồm các bản tóm tắt
10Thông lượngNhập hàng loạt và thời gian nóKhoảng 10:1 (lường nó)

Mục 9 là một trong những thường bỏ qua nhiều nhất, và một trong những có khả năng thất bại nhất. Nếu bạn chỉ có thể giữ một hành động chấp nhận, hãy giữ hành động này.

Để biết các đường dẫn triển khai cụ thể cho kịch bản, hãy xem các hướng dẫn chơi government intranet và financial compliance của chúng tôi.

Lời kết luận trung thực

Không một trong năm giai đoạn này có thể được thay thế bằng độ chính xác của phiên âm giọng nói. phiên âm giọng nói chính xác là vé nhập cảnh, không phải là điểm đến.

Nếu một nhà cung cấp chỉ nói về các con số chính xác Về chúng tôi và không bao giờ gán loa Về chúng tôi, mẫu tóm tắt, nguồn gốc của mục hành động hoặc tóm tắt ngoại tuyến, hệ thống sẽ rất có thể được sử dụng như một công cụ phiên âm giọng nói - sản xuất các bản thảo thô mà ai đó vẫn phải làm sạch bằng tay.

Điều đó không giống như việc mua một hệ thống biên bản cuộc họp.


Đọc thêm: Running multilingual meetings: offline translation and synced subtitles | OA integration in practice (Tạm dịch: OA integration in practice) | Choosing an on-premise ASR solution

Câu hỏi thường gặp

Q: Ngoài độ chính xác của phiên âm giọng nói, những gì khác nên được kiểm tra khi chấp nhận hệ thống biên bản cuộc họp?

A: Độ chính xác chỉ xác định liệu các từ có đúng hay không, chứ không phải liệu biên bản cuộc họp có thể sử dụng được hay không. 5 điều quan trọng: liệu những người nói có được gán chính xác hay không, liệu mẫu tóm tắt có phù hợp với loại cuộc họp hay không, liệu các mục hành động có mang chủ sở hữu và một nhiệm vụ hay không, liệu lời nói thông tục có được đánh bóng hay không và liệu toàn bộ chuỗi có thực sự ngoại tuyến hay không. Nếu bất kỳ một trong những thất bại, mọi người làm lại biên bản cuộc họp bằng tay - và độ chính xác cao không cứu bạn.

Q: phân tách người nói và nhận dạng vân tay có giống nhau không?

A: Không. phân tách người nói trả lời "Ai nói phân đoạn này" và xuất ra các nhãn vai trò như Speaker 1 và Speaker 2, mà không cần phải biết danh tính trước. Nhận dạng in giọng nói trả lời "thành viên nhóm nào là này", và yêu cầu các mẫu in giọng nói được đăng ký trước và thư viện in giọng nói. Các nhãn trước đây nói tự động thông qua tích hợp với cuộc họp địa phương hoặc hệ thống âm thanh; sau này phù hợp với các cuộc họp với một danh sách ổn định và hỗ trợ đăng ký, đổi tên và xóa dấu vân âm.

Q: Những loại mẫu tóm tắt nào tồn tại và tôi nên chọn như thế nào?

A: Có bốn loại phổ biến. Các cuộc họp đồng bộ hóa thông tin theo định hướng tóm tắt, các cuộc họp quyết định theo định hướng kết luận, các cuộc thảo luận đa bên phù hợp với các cuộc thảo luận và hội thảo, và các báo cáo theo định hướng phù hợp với báo cáo lên. Chất lượng tóm tắt kém thường được gây ra không phải bởi một mô hình yếu mà là bởi một mẫu không phù hợp với loại cuộc họp - chạy một cuộc họp quyết định thông qua một mẫu tóm tắt và các kết luận và bất đồng được phẳng đi.

Q: Làm thế nào để các mục hành động được trích xuất từ một cuộc trò chuyện?

A: Hệ thống đầu tiên xác định các tuyên bố kiểu hành động và bên chịu trách nhiệm từ các kết luận, sau đó đầu ra các mục có cấu trúc với nhiệm vụ, chủ sở hữu và nguồn đoạn. Giữ tham chiếu nguồn gốc ban đầu là điều cần thiết, nếu không một mục hành động không thể được truy tìm. Kết quả thường được đẩy thông qua một API tiêu chuẩn hoặc tích hợp với WeCom, DingTalk, Feishu, hoặc các hệ thống OA của chính phủ như Landray và Seeyon để chúng đi vào quy trình công việc hiện có trực tiếp.

Q: Làm thế nào để nói chuyện thông tục được xử lý trong biên bản cuộc họp?

A: Giai đoạn đánh bóng giải quyết năm loại vấn đề: dự phòng, trật tự từ xáo trộn, từ ngữ kém, thiếu các kết nối logic và trượt hoặc lặp lại. Giới hạn khó khăn là nó không được thả thông tin quan trọng hoặc thay đổi giai điệu của người nói - đánh bóng quá mức để đưa từ ngữ vào miệng người nói, đó là một vấn đề nghiêm trọng trong biên bản cuộc họp chính thức.

Q: Những định dạng đầu ra nào được hỗ trợ?

A: Một bản ghi Word được tạo tự động vào cuối cuộc họp, cùng với văn bản biên bản cuộc họp, đồ họa biên bản cuộc họp, các mục hành động và bản đồ tâm trí. Tất cả chúng đều hỗ trợ xem web, chỉnh sửa và tải xuống, và có thể được lưu trữ cùng với âm thanh, bản dịch và tóm tắt.

Q: Toàn bộ đường ống biên bản cuộc họp có thể chạy ngoại tuyến không?

A: Có, nhưng bạn phải xác minh nó từng giai đoạn trong quá trình chấp nhận. phiên âm giọng nói là tương đối dễ dàng để chạy ngoại tuyến; những gì bị bỏ qua là tạo tóm tắt. Nếu bản tóm tắt được sản xuất thông qua một điểm cuối LLM đám mây, thì âm thanh không bao giờ rời khỏi trang web nhưng văn bản thì - và lời hứa tuân thủ vẫn thất bại. Một vòng lặp đóng thực sự chạy cả nhận dạng và mô hình tóm tắt tại địa phương, không yêu cầu cấp phép đám mây.

Q: Thông lượng tập tin phiên âm giọng nói là gì?

A: Con số được công bố là 10:1 - khoảng một phút để phiên âm mười biên bản cuộc họp của âm thanh hoặc video, với nhập khẩu hàng loạt cho MP3, MP4, MOV, MKV, WAV và AAC. Thời gian thực tế thay đổi theo điều kiện âm thanh, kích thước mô hình và chiến lược đồng thời, vì vậy hãy coi nó như một cái gì đó để đo lường trên trang web.

#Hội nghị biên bản cuộc họp#phân tách người nói#Tóm tắt thông minh#Các mục hành động#Triển khai tại chỗ#Danh sách kiểm tra chấp nhận

Đặt một bản demo cá nhân

Hãy cho chúng tôi biết kịch bản cuộc họp và nhu cầu tuân thủ của bạn - nhận một kế hoạch phù hợp.

Đặt lịch ngay
Trò chuyện trực tiếp