Speech-to-Speech là gì? Voicebot nghe, nghĩ và đáp lời bằng giọng nói
05/10/2026

Thử hình dung chín giờ tối, máy lạnh phòng ngủ nhà chị Lan bắt đầu nhỏ nước. Chị gọi tổng đài bảo hành. Nhân viên đã về, đầu dây bên kia là giọng thu sẵn: bấm phím 1 để đặt lịch, phím 2 để gặp kỹ thuật, phím 0 để nghe lại. Chị bấm 1, nghe thêm một menu nữa, rồi cúp máy. Thôi để mai.

Cũng cuộc gọi đó, nếu đầu dây là một hệ Speech-to-Speech, chị Lan chỉ cần nói: “Máy lạnh nhà chị chảy nước, chiều mai có thợ qua được không em?”. Giọng bên kia hỏi lại địa chỉ, chốt khung giờ, đọc lại số điện thoại để chị xác nhận. Không phím bấm, không nhạc chờ. Nghe như phim, nhưng phía sau chỉ là ba việc rất đời thường.
Nghe, nghĩ, nói: ba việc của một voicebot
Bóc lớp vỏ ra, voicebot Speech-to-Speech làm đúng ba việc mà tổng đài viên vẫn làm mỗi ngày, chỉ khác là không biết mệt.
- Nghe: chuyển giọng nói thành chữ (Speech-to-Text). Trên nền tảng s2speech, khâu này chạy streaming qua WebSocket, chữ hiện ra khi người gọi còn đang nói. Nó được làm để hiểu tiếng Việt chen tiếng Anh, số, tiền, ngày tháng và nhiều giọng vùng miền.
- Nghĩ: mô hình ngôn ngữ đọc câu vừa nghe, đoán ý định rồi soạn câu trả lời. Ở đây là aivision-L1.0, mô hình ngôn ngữ tiếng Việt của AIVISION, trả lời theo luồng thay vì đợi viết xong cả đoạn.
- Nói: biến câu trả lời thành giọng đọc (Text-to-Speech), giọng Việt hoặc Anh tự nhiên, phát ngay từ những chữ đầu.
Chữ quan trọng nhất ở đây là “theo luồng”. Nếu ba khâu xếp hàng, khâu sau đợi khâu trước xong hẳn mới chạy, người gọi sẽ nghe một khoảng lặng dài sau mỗi câu. Khi cả ba chạy cuốn chiếu, câu trả lời đã bắt đầu vang lên trong lúc phần đuôi của nó còn đang được nghĩ. Lúc đó cuộc gọi mới có cảm giác đang nói chuyện với người.
Vì sao vài giây im lặng lại đắt
Trong khung chat, khách chờ được. Trên điện thoại thì không. Vài giây im lặng là đủ để người ta “alo, alo” rồi nói chồng lên voicebot, và cuộc gọi bắt đầu rối. Vì vậy khi đánh giá một hệ voice AI, đừng chỉ hỏi nó trả lời có đúng không. Hãy hỏi nó trả lời có kịp không.
Vài phép thử chúng tôi hay khuyên làm ngay trong buổi demo, trước khi ai đó kịp mở slide:
- Chen ngang giữa câu. Voicebot tử tế phải biết dừng lại để nghe, thay vì đọc tiếp như máy phát băng.
- Đọc một địa chỉ có số nhà, số hẻm, rồi một số tiền và một ngày cụ thể. Hệ yếu thường lộ ra ở đây.
- Nói kiểu dân văn phòng: “check giùm em cái voucher”, “book lại slot chiều mai”.
- Đổi người gọi: giọng Bắc, giọng Trung, giọng Nam, người nói nhanh, người hay ngập ngừng.
Đọc con số độ chính xác cho tỉnh táo
AIVISION công bố tỉ lệ lỗi từ (WER, càng thấp càng tốt) trung bình 11,84% trên bốn bộ kiểm thử tiếng Việt. Phần chi tiết mới đáng đọc: 4,58% trên FLEURS-vi (giọng đọc), 6,83% trên VIVOS, 15,68% trên ViMedCSS (y khoa) và 20,29% trên các cuộc họp doanh nghiệp thật. Đây là số liệu nội bộ, đo trên dữ liệu không dùng để huấn luyện.
Con số 20,29% đáng được treo lên tường hơn là giấu đi, vì nó phản ánh đúng đời thực: âm thanh càng lộn xộn, càng nhiều người nói chồng, càng nhiều thuật ngữ, máy càng dễ nghe nhầm. Bài học thiết kế rất thực dụng: số điện thoại, số tiền, ngày hẹn thì voicebot phải đọc lại để khách xác nhận. Đừng đặt cược vào một lần nghe.
Việc nào giao cho voicebot, việc nào để người làm
Voicebot hợp với những cuộc gọi lặp đi lặp lại, theo khuôn mẫu: đặt và dời lịch hẹn, hỏi tình trạng đơn hàng, xác nhận giao hàng, nhắc lịch, trả lời câu hỏi thường gặp, trực ngoài giờ để ghi nhận yêu cầu. Nó cũng làm tốt vai lễ tân: hỏi trước vài thông tin rồi chuyển cho đúng người, để nhân viên khỏi phải hỏi lại từ đầu.
Ngược lại, có những cuộc gọi nên để người cầm máy. Khách đang bực vì món hàng hỏng lần thứ ba. Một cuộc thương lượng giá. Những việc trong tài chính, bảo hiểm hay y tế, nơi AI chỉ nên hỗ trợ tra cứu và ghi chép, còn quyết định thuộc về con người. Quan điểm của chúng tôi khá rõ: voicebot giỏi không phải voicebot biết tuốt, mà là voicebot biết lúc nào phải chuyển máy.
Bắt đầu nhỏ, đo bằng cuộc gọi thật
Cách thử đỡ tốn công nhất là chọn đúng một loại cuộc gọi, nghe lại vài chục bản ghi thật, viết kịch bản cho cả những lúc khách đi lệch kịch bản. Chuyện công nghệ để sau.
Đến lúc chọn công nghệ, có hai đường. Một là tự ráp ba khâu bằng API: Speech-to-Text, Text-to-Speech và aivision-L1.0 dùng chung một tài khoản, một API key, một số dư; theo s2speech.com, hiện mỗi tài khoản có $10 dùng miễn phí mỗi ngày, không cần thẻ. Hai là dùng bản Speech-to-Speech đóng gói sẵn: phát hành miễn phí, chạy thời gian thực, cài on-premise được trên một GPU khoảng 8 GB VRAM (cỡ RTX 2080 Ti), phục vụ 8 phiên đồng thời. Toàn cảnh các dịch vụ có trên trang giới thiệu s2speech của AIVISION, còn muốn nói thử vài câu thì vào thẳng s2speech.com.
Đường nào cũng vậy, hãy để số liệu cuộc gọi thật lên tiếng: bao nhiêu cuộc xong mà không cần người, bao nhiêu cuộc phải chuyển, khách cúp máy ở câu nào. Nếu chị Lan đặt được lịch thợ ngay trong một cuộc gọi, không phải gọi lại sáng hôm sau, voicebot đã làm đúng việc của nó.