Speech to text tiếng Việt E1.0 của AIVISION dùng vào việc gì
01/10/2026

Bạn đã bao giờ ngồi gõ lại một cuộc họp dài hai tiếng từ file ghi âm chưa? Gần như ai làm văn phòng cũng từng trải qua: tua đi tua lại, nghe lại câu vừa lỡ, rồi nhận ra mất cả buổi chiều chỉ để có bản biên bản. Đó là loại việc mà speech to text tiếng Việt sinh ra để giảm bớt. E1.0 là model chuyển giọng nói tiếng Việt thành văn bản mà AIVISION đã phát hành, và bài này nói về loại việc mà công nghệ này thường được dùng, cùng những chỗ cần thận trọng.
E1.0 là gì
E1.0 là model nhận dạng giọng nói tiếng Việt: đưa vào âm thanh, trả ra văn bản. Về mặt kỹ thuật, nhóm bài toán này hay được gọi là ASR (automatic speech recognition). Số 1.0 cho biết đây là phiên bản đầu tiên, và chúng tôi coi nó là điểm khởi đầu chứ không phải đích đến.
Chúng tôi sẽ không nêu tỷ lệ lỗi hay độ chính xác của E1.0 trong bài này. Lý do đơn giản: một con số như vậy chỉ có nghĩa khi đi kèm bộ dữ liệu kiểm tra, điều kiện thu âm và cách tính, mà phần đó chúng tôi chưa công bố. Nếu bạn thấy ai đó báo độ chính xác tròn trịa mà không nói đo trên cái gì, hãy hỏi lại.
Những việc người ta thường dùng speech to text để làm
Phần dưới đây là các tình huống ứng dụng điển hình của công nghệ nhận dạng giọng nói tiếng Việt nói chung. Chúng là ví dụ về ngành, không phải danh sách khách hàng hay tính năng đã triển khai của riêng sản phẩm nào.
Biên bản và ghi chú
Họp, phỏng vấn, tập huấn, hội thảo. Có bản văn bản thô sau cuộc họp, người dự chỉ cần đọc lướt và sửa, thay vì nghe lại từ đầu. Đây là ứng dụng dễ hình dung nhất, và cũng là nơi người dùng phàn nàn nhiều nhất khi tên riêng, từ viết tắt bị nhận sai.
Nhập liệu bằng giọng nói
Những người bận tay, ví dụ nhân viên kho, kỹ thuật viên hiện trường, người đang lái xe, thấy nói dễ hơn gõ. Một đoạn ghi chú đọc vào điện thoại rồi thành văn bản có thể tiết kiệm đáng kể thời gian so với gõ trên màn hình nhỏ.
Phụ đề và tìm kiếm trong video, podcast
Có chữ đi kèm âm thanh thì nội dung dễ tìm kiếm hơn, dễ làm phụ đề hơn, và dễ tiếp cận hơn với người khiếm thính. Một kho video hàng nghìn giờ mà không có văn bản thì gần như không tra cứu được.
Trung tâm chăm sóc khách hàng
Cuộc gọi được chuyển thành văn bản để tóm tắt, phân loại, hoặc kiểm tra chất lượng. Bước này thường đi cùng một LLM đọc phần văn bản đó. Đây cũng là chỗ mà speech to text và mô hình ngôn ngữ gặp nhau, và là lý do AIVISION làm cả hai mảng.
Y tế và dược, ở vai trò hành chính
Với healthcare, speech to text có thể giúp ghi lại lời đọc để người có chuyên môn xem và chỉnh, ví dụ soạn nháp ghi chú hành chính. Cần nói rõ giới hạn: công cụ chỉ hỗ trợ thông tin và công việc giấy tờ. Nó không chẩn đoán, không kê đơn, không khuyên liều dùng, và nhân viên y tế phải kiểm tra lại mọi nội dung. Một chữ nhận sai trong tên thuốc có thể gây hậu quả thật, nên việc rà soát bởi người có chuyên môn là bắt buộc chứ không phải tùy chọn.
Cái gì làm nên một bản chuyển văn bản dùng được
Từ kinh nghiệm làm sản phẩm, chúng tôi thấy người dùng không đánh giá model bằng bảng số. Họ đánh giá bằng cảm giác: tôi có phải sửa quá nhiều không? Nếu phải sửa nhiều hơn là gõ lại từ đầu thì công cụ bị bỏ. Nếu chỉ sửa vài chỗ thì nó trở thành thói quen.
Có mấy yếu tố quyết định cảm giác ấy:
- Chất lượng âm thanh đầu vào. Micro tốt, phòng yên tĩnh cho kết quả khác hẳn một đoạn ghi âm qua loa ngoài giữa quán cà phê.
- Dấu câu và viết hoa. Văn bản liền một khối không ngắt câu rất khó đọc dù từng chữ đúng.
- Tên riêng và thuật ngữ. Đây là điểm yếu kinh điển, mà bài tiếp theo trong chuỗi sẽ nói kỹ.
- Cách người nói. Nói nhanh, nói lẩm bẩm, hay nhiều người nói chồng lên nhau đều làm khó bất kỳ hệ thống nào.
Dùng thế nào cho hợp lý
Lời khuyên thực tế nhất của chúng tôi: coi kết quả speech to text là bản nháp. Bản nháp tốt tiết kiệm rất nhiều thời gian, nhưng ở những nơi sai sót có hậu quả như hợp đồng, y tế, pháp lý, hãy để người đọc lại.
Nếu bạn định tích hợp vào quy trình, hãy thử với dữ liệu thật của mình trước, tức là giọng của người trong tổ chức bạn, micro bạn đang dùng, và từ vựng ngành bạn hay gặp. Một demo trên giọng phát thanh viên chuẩn hiếm khi phản ánh được điều đó.
Điều đáng nói thêm là E1.0 chỉ là một mắt xích. Giá trị lớn thường đến khi văn bản đầu ra được nối tiếp vào bước khác: tóm tắt, trích xuất ý chính, điền biểu mẫu. Đó là lý do bên cạnh model giọng nói, chúng tôi phát triển LLM tiếng Việt L1.0 và làm finetune cho các lĩnh vực chuyên biệt.
Nhóm làm sản phẩm ở AIVISION vẫn đang tiếp tục cải thiện, và phản hồi từ người dùng thật luôn có giá trị hơn mọi phòng thí nghiệm. Với các thị trường nói tiếng khác như Mexico hay Philippines, bài toán nhận dạng giọng nói có cùng khung vấn đề, dù chi tiết ngôn ngữ khác nhau hoàn toàn.