Khi nói chuyện điện thoại di động đột nhiên xuất hiện một tiếng ồn, tai nghe thỉnh thoảng nổ tung khi phát nhạc, loa thông minh xuất hiện biến dạng ở một dải tần số nào đó...... Những vấn đề này có thể kéo dài rất ngắn, nhưng sẽ ảnh hưởng trực tiếp đến trải nghiệm của người dùng. Đối với các doanh nghiệp sản xuất sản phẩm âm thanh, làm thế nào để nhanh chóng phát hiện những bất thường như vậy trong phát hiện hàng loạt và xác định chính xác thời gian xảy ra vấn đề là một phần quan trọng trong kiểm soát chất lượng âm thanh.
Trước đây, việc kiểm tra chất lượng âm thanh thường phụ thuộc vào việc nghe âm thanh nhân tạo. Nhân viên kiểm tra chất lượng cần phát đi phát lại âm thanh, dựa vào kinh nghiệm phán đoán có tồn tại các vấn đề như tiếng ồn, sự thật, bùng nổ hoặc thiếu âm thanh hay không. Nhưng khi sản phẩm bước vào giai đoạn sản xuất hàng loạt, những hạn chế của âm thanh nhân tạo cũng dần trở nên rõ ràng: hiệu quả phát hiện hạn chế, các tiêu chuẩn phán đoán của nhân viên khác nhau có thể có sự khác biệt, thời gian dài nghe cũng dễ dàng tạo ra sự mệt mỏi thính giác. Hơn nữa, một số bất thường thoáng qua chỉ kéo dài vài chục mili giây hoặc vài trăm mili giây và có thể dễ dàng bị bỏ qua trong quá trình phát hiện.
Để giải quyết vấn đề khó khăn này, nhóm công nghệ thông tin của Liên Khang đã phát triển thuật toán kiểm tra chất lượng âm thanh, thành quả sáng tạo này hiện đã được cấp bằng sáng chế quốc gia: một phương pháp và hệ thống chấm điểm tự động chất lượng âm thanh kết hợp MFCC và đặc điểm thống kê miền thời gian (bằng sáng chế số: ZL 2025 1 1516445.X). Hiệu quả đạt được tự động chấm điểm và định vị bất thường về chất lượng âm thanh thông qua trích xuất chữ ký âm thanh, phân tích phân đoạn và mô hình học máy.

Làm thế nào để máy "hiểu" sự khác biệt âm thanh?
Tai người phán đoán chất lượng âm thanh, dựa vào nhận thức tổng hợp về độ vang, âm sắc, tiếng ồn, biến dạng và thay đổi thoáng qua. Máy móc, mặc dù không thể nghe trực tiếp như con người, có thể biến âm thanh thành một tập hợp các tính năng dữ liệu có thể tính toán và so sánh được.
Chương trình bằng sáng chế kết hợp hai loại tính năng âm thanh. Đầu tiên là MFCC, hay còn gọi là Meier Frequency Inversion Factor. MFCC có thể mô tả sự phân bố năng lượng và đặc điểm âm sắc của âm thanh trên các dải tần số khác nhau, và thông qua MFCC có thể xác định sự thay đổi trong cấu trúc phổ giữa âm thanh tham chiếu và âm thanh cần đo. Loại thứ hai là các đặc điểm thống kê miền thời gian, bao gồm năng lượng gốc trung bình, độ không, biên độ tối đa, độ lệch và độ dốc. Những đặc điểm này lần lượt phản ánh năng lượng âm thanh, tốc độ thay đổi dạng sóng, đỉnh biên độ và hình thái phân phối tín hiệu.
Hệ thống được cấp bằng sáng chế kết hợp các tính năng MFCC với các tính năng thống kê miền thời gian, cho phép kết quả phát hiện tập trung không chỉ vào những thay đổi về âm sắc và phổ mà còn cả những bất thường đột ngột trong dạng sóng âm thanh.
Làm thế nào để phát hiện âm thanh chính xác, trực quan, ổn định?

Sơ đồ quy trình của phương pháp tự động chấm điểm chất lượng âm thanh kết hợp MFCC và đặc điểm thống kê miền thời gian
01
Kết hợp trung bình với tối đa để tăng khả năng bắt ngoại lệ
Sau khi tiền xử lý âm thanh được phân đoạn theo 1 giây, mỗi phân đoạn được chia thành 10 phân đoạn phụ 100 mili giây. Giá trị trung bình phản ánh chất lượng âm thanh tổng thể của giây này, trong khi giá trị tối đa được sử dụng để nắm bắt các bất thường ngắn hạn như bùng nổ và cắt đột ngột. Kết hợp cả hai để tránh sự bất thường bị che khuất bởi dữ liệu trung bình và cho phép phát hiện chính xác hơn. Sau đó, hệ thống sẽ so sánh âm thanh tham chiếu với các đặc điểm của âm thanh được kiểm tra và tạo điểm số thông qua mô hình SVM.
02
Phân loại 0-5 điểm, kết quả kiểm tra trực quan hơn
Hệ thống dựa theo mức độ biến dạng xuất ra 0 - 5 điểm: 0 điểm biểu thị cơ bản không có khác biệt, điểm càng cao, chứng tỏ biến dạng càng nghiêm trọng; 5 điểm có nghĩa là tín hiệu bị mất hoặc chất lượng âm thanh cực kỳ kém. So với phán đoán đơn giản "đủ tiêu chuẩn" hoặc "không đủ tiêu chuẩn", điểm phân loại có thể phản ánh trực quan mức độ vấn đề hơn. Các nhân viên nghiên cứu phát triển có thể so sánh các phương án khác nhau, dây chuyền sản xuất cũng có thể thiết lập giá trị đánh giá, tự động tiến hành kiểm tra lại hoặc chặn đứng các sản phẩm xấu.
03
Mô hình trọng lượng nhẹ để triển khai ổn định dây chuyền sản xuất
Kiểm tra dây chuyền sản xuất không chỉ phải chính xác, mà còn phải vận hành ổn định, phản ứng nhanh, bảo trì thuận tiện. Bằng sáng chế sử dụng mô hình máy vector hỗ trợ, không phụ thuộc vào mạng học sâu phức tạp, yêu cầu tương đối thấp đối với các mẫu đào tạo và tài nguyên tính toán, tệp mô hình SVM chỉ vài chục MB, có thể hoạt động trong các máy điều khiển công nghiệp thông thường, không cần GPU, triển khai nhẹ và đào tạo mô hình ổn định thông qua học mẫu nhỏ, cải thiện độ ổn định chính xác phát hiện.

Sơ đồ kết quả thử nghiệm của mẫu dây chuyền sản xuất b được thể hiện trong sáng chế
Ứng dụng thực tế
Bằng sáng chế có thể được áp dụng cho điện thoại di động, tai nghe không dây, loa thông minh, thiết bị đeo, thiết bị đầu cuối âm thanh trên xe hơi và các sản phẩm điện tử khác có loa, micrô hoặc chức năng phát lại âm thanh.
Trong thử nghiệm loa, hệ thống có thể so sánh âm thanh tiêu chuẩn với âm thanh mà thiết bị thực sự phát và thu được, xác định tiếng ồn, tiếng nổ, cắt, biến dạng và mất tín hiệu trong quá trình phát lại.
Trong thử nghiệm micrô, sự khác biệt giữa tín hiệu ghi âm của thiết bị và tín hiệu tham chiếu có thể được đánh giá, hỗ trợ phát hiện độ nhạy bất thường, tiếng ồn cơ bản quá lớn, độ lệch âm tần hoặc lỗi liên kết thu thập.
Trong giai đoạn xác minh R&D, nó có thể được sử dụng như một công cụ đánh giá khách quan để giúp các kỹ sư so sánh hiệu suất âm thanh của các chương trình khác nhau; Trong giai đoạn thử nghiệm sản xuất, nó có thể được tích hợp với các thiết bị tự động hóa, phần mềm kiểm tra và hệ thống quản lý dữ liệu để đạt được việc thu thập tự động, chấm điểm tự động, định vị bất thường và ghi lại kết quả.
Giá trị của công nghệ bằng sáng chế, không chỉ là đề xuất một phương pháp chấm điểm, mà còn là có thể thực sự áp dụng cho hiện trường thử nghiệm của khách hàng. Trong tương lai, thông tin UNICOM sẽ tiếp tục xoay quanh nhu cầu kiểm tra thực tế của khách hàng, thúc đẩy nhiều thuật toán và thành quả công nghệ sáng tạo hội nhập vào nghiên cứu và phát triển xác minh và sản xuất hàng loạt, để phát hiện âm thanh từ "phán đoán bằng kinh nghiệm" đến "nói chuyện bằng dữ liệu".