AIVISION ra mắt Speech-to-Text E1.0: nhận dạng giọng nói tiếng Việt, chạy được trên một GPU

28/09/2026

AIVISION ra mắt Speech-to-Text E1.0: nhận dạng giọng nói tiếng Việt, chạy được trên một GPU

AIVISION công bố Speech-to-Text E1.0 (mã build aivision-s2s-ev-E1.0.0), mô hình nhận dạng giọng nói tiếng Việt 1.5 tỷ tham số. Mô hình xử lý được cả những câu người Việt hay chêm tiếng Anh giữa chừng, và đủ nhỏ để chạy trên một GPU hoặc ngay trên thiết bị.

Dùng thử và tích hợp API tại s2s.aivgroups.com.

Con số chính

Chỉ sốGiá trịGhi chú
WER trung bình11,84%Trên 4 bộ test giữ riêng. Càng thấp càng tốt.
Giọng đọc tiếng Việt4,58%FLEURS-vi
Nói lẫn Việt + Anh15,68%ViMedCSS (y khoa), giữ nguyên thuật ngữ tiếng Anh

Mô hình 1.5B tham số, huấn luyện trên hơn 50.000 giờ âm thanh tiếng Việt gồm giọng đọc, phát thanh và hội thoại tự nhiên.

Độ chính xác theo từng bộ test

WER (Word Error Rate) so với bản gỡ băng của con người, trên bốn bộ test tiếng Việt. Càng thấp càng tốt.

Bộ testLoại dữ liệuWER%
FLEURS-viGiọng đọc tiếng Việt4,58
VIVOSGiọng đọc tiếng Việt6,83
ViMedCSS testY khoa, nói lẫn Việt + Anh15,68
AIV meetingsHọp thực tế, nói tự nhiên, xa micro20,29
Trung bình11,84

Bộ AIV meetings khó nhất vì là hội thoại thật, nhiều người nói chen nhau và thu từ xa. Đây cũng là loại âm thanh doanh nghiệp gặp nhiều nhất khi gỡ băng cuộc họp.

So với các mô hình mã nguồn mở khác

Chúng tôi chạy benchmark độc lập trên ba bộ test công khai tiếng Việt (FLEURS-vi, VIVOS, ViMedCSS), 300 câu mỗi bộ, ngày 29/08/2026.

#Mô hìnhTham sốWER% TB
1aivision-s2s-ev-E1.0.01.5B11,84*
2Qwen3-ASR-1.7B1.7B12,15
3PhoWhisper-large1.5B14,95
4Voxtral-Small-24B24B16,09
5Voxtral-Mini-3B3B21,31
6SeamlessM4T-v22.3B23,10

PhoWhisper-large tốt nhất ở giọng đọc tiếng Việt thuần (VIVOS 4,79) nhưng yếu nhất khi người nói chêm tiếng Anh.

* Lưu ý về cách so sánh: số của các mô hình khác đo trên bộ ba công khai. Số 11,84 của E1.0 đo trên bộ bốn tập nội bộ, khó hơn vì có thêm âm thanh họp AIV. Vì vậy thứ hạng chỉ mang tính tham khảo, không phải so sánh chặt chẽ trên cùng một bộ test.

Vì sao chọn E1.0

  • Tiếng Việt gần bản gỡ băng. Giọng đọc sạch đạt 4,58 WER trên FLEURS-vi và 6,83 trên VIVOS, ngang các mô hình mở tốt nhất dù nhỏ hơn nhiều.
  • Tiếng Anh nằm trong câu tiếng Việt. Giữ nguyên thuật ngữ kỹ thuật tiếng Anh thay vì phiên âm sai: 15,68 WER trên bộ y khoa nói lẫn ngôn ngữ, nơi các mô hình chỉ học tiếng Việt thường sai nhiều nhất.
  • Đủ nhỏ để tự vận hành. 1.5B tham số chạy trên một GPU hoặc trên thiết bị, dữ liệu âm thanh không phải rời khỏi hệ thống của bạn, không cần máy chủ khổng lồ và không tốn phí cloud theo từng phút.

Phương pháp đánh giá

  • Âm thanh cố định 16 kHz, đối chiếu với bản gỡ băng của con người.
  • Số được đọc thành chữ ở cả hai phía, WER tính giống hệt nhau trên mọi bộ test.
  • Độ chính xác tiếng Anh hiện được báo cáo dưới dạng tiếng Anh xen trong tiếng Việt. Chúng tôi chưa công bố WER cho tiếng Anh thuần.

Dùng thử

Truy cập s2s.aivgroups.com để thử mô hình và xem tài liệu API. Cần tư vấn triển khai tại chỗ cho doanh nghiệp, hãy liên hệ đội ngũ AIVISION.

Bài viết liên quan

Xem tất cả bài viết