Nhận dạng giọng nói tiếng Việt khó ở đâu: vùng miền, ồn, thuật ngữ
01/10/2026

Một người Nghệ An nói câu: mô tê răng rứa. Một người Sài Gòn nói: sao vậy trời. Cả hai đều là tiếng Việt, và với người nghe thì không có gì lạ, nhưng với một hệ thống nhận dạng giọng nói tiếng Việt, đây là hai bài toán khác hẳn nhau. Chúng tôi ở AIVISION làm model speech to text E1.0 nên đã nhìn thấy khá nhiều kiểu lỗi, và bài này kể ba nhóm khó khăn lớn nhất, kèm quan điểm của người trong cuộc.
Giọng vùng miền: một ngôn ngữ, nhiều hệ âm
Tiếng Việt có sáu thanh điệu, và cách phát âm các thanh này khác nhau theo vùng. Ở nhiều nơi miền Trung, thanh hỏi và thanh ngã, hoặc thanh nặng, nghe khác hẳn với giọng chuẩn miền Bắc hay miền Nam. Phụ âm đầu cũng khác: có nơi phân biệt tr và ch, s và x, có nơi không. Có vùng nói d, gi, r gần như giống nhau, có vùng giữ thành ba âm khác biệt.
Với người nghe, ngữ cảnh giúp ta bù đắp. Nghe âm ấy, đoán được từ nhờ nội dung câu. Với máy, nếu dữ liệu huấn luyện chủ yếu là một giọng, những giọng còn lại sẽ có tỷ lệ sai cao hơn. Đây không phải lỗi thuật toán, mà là lỗi về độ đa dạng của dữ liệu.
Cái khó thật sự là việc thu thập dữ liệu cho các giọng ít phổ biến. Bạn cần người nói thật, ghi âm thật, có người nghe lại và viết ra từng chữ. Quá trình này tốn kém, chậm, và dễ bị thiên lệch về những vùng dễ tiếp cận. Chúng tôi không khẳng định E1.0 đã xử lý hết các giọng, vì chưa có phép đo công khai nào cho phép nói như thế. Đây là hướng cải thiện liên tục.
Còn một chuyện nữa: người nói không chỉ có một giọng. Cùng một người, lúc nói chuyện thân mật khác lúc phát biểu trang trọng, lúc mệt khác lúc tỉnh táo. Nhiều người Việt sống xa quê cũng pha trộn giọng gốc với giọng nơi mình ở, thành một thứ lai mà bảng phân loại vùng miền nào cũng không bao quát được.
Tiếng ồn: kẻ phá bĩnh ngoài phòng thí nghiệm
Hầu hết model nhận dạng giọng nói trông ổn trong điều kiện sạch. Rắc rối bắt đầu khi ra thực tế. Xe máy chạy ngang, tiếng quạt, tiếng điều hòa, tiếng chén bát trong quán, người khác nói chen vào. Với tiếng Việt, tiếng ồn đặc biệt gây hại vì nhiều phân biệt quan trọng nằm ở các chi tiết âm thanh nhỏ, như đuôi thanh điệu hay phụ âm cuối. Khi những chi tiết đó bị che, hai từ khác nghĩa trở thành một.
Một tình huống mà đội sản phẩm hay gặp: người dùng ghi âm bằng điện thoại để trên bàn họp, cách người nói ba bốn mét. Âm thanh dội lại từ tường, tiếng người ngồi gần át tiếng người ngồi xa. Kết quả nhận dạng tệ không phải vì model dở, mà vì tín hiệu đã hỏng trước khi đến model. Đôi khi lời khuyên hiệu quả nhất lại rất đời thường: đặt micro gần người nói hơn.
Cũng có lúc xử lý khử ồn trước khi nhận dạng làm kết quả tệ hơn. Bộ khử ồn quá mạnh có thể xóa luôn những chi tiết nhỏ của giọng nói. Đây là một đánh đổi tinh tế mà ít người ngoài ngành nghĩ tới.
Từ chuyên ngành và tên riêng
Đây là nhóm lỗi gây bực nhất với người dùng, vì sai ở đúng những chữ quan trọng nhất. Một cuộc họp có thể được nhận dạng gần hoàn hảo, trừ tên khách hàng, tên dự án và mấy từ viết tắt nội bộ.
Lý do cũng dễ hiểu: các từ này hiếm trong dữ liệu huấn luyện. Model đã quen với cách nói thông thường và có xu hướng thay thế một từ lạ bằng từ quen nghe gần giống. Tên một hoạt chất thuốc, tên một thủ tục pháp lý, tên một linh kiện kỹ thuật, tất cả đều dễ bị biến thành những từ phổ thông na ná.
Hãy lấy lĩnh vực dược làm ví dụ. Tên thuốc thường dài, gốc nước ngoài, phát âm theo kiểu Việt hóa không thống nhất: người này đọc theo tiếng Anh, người kia đọc theo tiếng Pháp, người thứ ba đọc theo thói quen quầy thuốc. Một hệ thống nhận dạng phải đối mặt với tất cả cách đọc đó. Đây chính là lý do chúng tôi nhấn mạnh rằng với y tế và dược, speech to text chỉ nên hỗ trợ việc ghi chép hành chính, và mọi nội dung phải được người có chuyên môn kiểm tra. Hệ thống không chẩn đoán, không kê đơn, không khuyên liều dùng.
Hướng xử lý thường thấy gồm:
- Bổ sung từ vựng ngành vào dữ liệu huấn luyện hoặc finetune.
- Dùng một mô hình ngôn ngữ phía sau để sửa lỗi dựa trên ngữ cảnh, ví dụ một LLM tiếng Việt đọc lại bản chép và chỉnh những chỗ vô lý.
- Cho phép người dùng cung cấp danh sách tên riêng, thuật ngữ cần ưu tiên.
Không cách nào trong số này là phép màu, và mỗi cách có cái giá riêng. Dùng LLM sửa lỗi có thể khiến văn bản đẹp hơn nhưng lệch khỏi những gì người nói thực sự đã nói, một rủi ro cần cân nhắc nghiêm túc khi bản ghi dùng làm tài liệu.
Những khó khăn ít được nhắc
Ngoài ba nhóm lớn, còn vài thứ làm khổ đội ngũ. Người Việt hay nói pha tiếng Anh giữa câu: deadline, meeting, feedback, rồi cả tên sản phẩm công nghệ. Ranh giới giữa tiếng Việt và tiếng Anh trong một câu là chuyện mà hệ thống nhận dạng một ngôn ngữ xử lý rất vụng. Ngoài ra là chuyện chuẩn hóa văn bản: nói là hai nghìn hai trăm, viết là 2.200 hay 2200? Ngày tháng viết thế nào? Chúng tôi không có đáp án duy nhất, vì mỗi nơi dùng có quy ước riêng.
Bài toán tương tự cũng tồn tại ở các thị trường mà AIVISION quan tâm như Mexico hay Philippines, nơi người dân hay trộn ngôn ngữ trong cùng một câu. Bài học chung là: không có model nào giải quyết được mọi thứ, và biết rõ model sai ở đâu quan trọng không kém việc làm nó đúng thêm.