Tổng đài AI on-premise trên một GPU 8 GB: cần gì và coi chừng gì
05/10/2026

“Ghi âm của khách không được ra khỏi tòa nhà này.” Thử hình dung câu đó vang lên trong cuộc họp đầu tuần, ngay sau khi phòng chăm sóc khách hàng trình bày kế hoạch dùng voicebot. Người nói là trưởng bộ phận tuân thủ, và chị không đùa. Bài toán lập tức đổi hướng: không còn là chọn dịch vụ đám mây nào, mà là làm sao chạy tổng đài AI on-premise, ngay trong phòng máy của công ty.
Tin vui là chuyện này nhẹ hơn nhiều người tưởng. Bản Speech-to-Speech của s2speech được phát hành miễn phí, chạy thời gian thực, cài on-premise được và vừa trên một GPU khoảng 8 GB VRAM, cỡ RTX 2080 Ti, với 8 phiên hội thoại đồng thời. Tin kém vui hơn: “cài được” và “ngày nào cũng chạy ổn” là hai chuyện khác nhau. Dưới đây là những thứ cần chuẩn bị và những chỗ hay vấp.
Trên bàn kỹ thuật cần có gì
- Một máy chủ có GPU khoảng 8 GB VRAM. Không cần cụm máy đắt tiền, một card cỡ RTX 2080 Ti là đủ cho bản Speech-to-Speech. Có điều, nên để GPU đó làm riêng việc này.
- Đường nối với tổng đài. Dịch vụ Text-to-Speech của s2speech có sẵn đầu ra 8 kHz G.711 μ-law và A-law cho tổng đài Asterisk, FreeSWITCH. Với bản on-premise, hãy hỏi rõ định dạng âm thanh vào ra ngay từ đầu để khỏi phải chuyển mã ở giữa.
- Kịch bản và dữ liệu nghiệp vụ. Voicebot chỉ trả lời tốt khi được nối vào nơi chứa câu trả lời: lịch hẹn, trạng thái đơn hàng, chính sách đổi trả. Đây thường là phần tốn thời gian nhất, và không GPU nào làm thay được.
- Một người làm chủ hệ thống. Ai theo dõi log, ai nghe lại cuộc gọi lỗi, ai sửa kịch bản. Thiếu vai này, dự án hay chết lặng lẽ sau vài tuần.

8 phiên đồng thời, hiểu cho đúng
8 CCU nghĩa là tại cùng một thời điểm, GPU đó xử lý tối đa 8 cuộc hội thoại. Không phải 8 cuộc gọi mỗi ngày, cũng không phải 8 nhân viên ảo ngồi chờ. Cuộc gọi thứ chín đến đúng lúc cả 8 phiên đều bận thì phải đi đâu đó: vào hàng chờ, sang tổng đài viên, hoặc sang một máy chủ khác.
Vì vậy, trước khi mua thêm gì, hãy kéo log tổng đài ra xem giờ cao điểm. Có tổng đài cả ngày lác đác, chỉ dồn dập đầu giờ sáng và sau giờ nghỉ trưa. Có nơi đều đều cả ngày. Số cuộc gọi cùng lúc ở thời điểm đỉnh mới là con số quyết định cần bao nhiêu GPU, chứ không phải tổng số cuộc gọi trong tháng.
Một mẹo thực dụng: đừng thiết kế để voicebot ôm hết. Cho nó nhận những loại cuộc gọi theo khuôn mẫu, còn khi đầy phiên hoặc khi khách muốn gặp người thì chuyển thẳng về nhóm tổng đài viên. Khách không quan tâm ai nghe máy. Họ quan tâm có ai nghe máy hay không.
Những chỗ hay vấp khi chạy thật
Âm thanh điện thoại không giống âm thanh demo
Buổi demo thường dùng micro tốt trong phòng yên tĩnh. Cuộc gọi thật đi qua đường điện thoại băng hẹp, có tiếng xe máy, tiếng trẻ con, có người bật loa ngoài. Hãy thử bằng chính bản ghi tổng đài của mình. Ngay số liệu nội bộ AIVISION công bố cũng cho thấy khoảng cách giữa giọng đọc và âm thanh đời thực: tỉ lệ lỗi từ 4,58% trên FLEURS-vi, nhưng 20,29% trên cuộc họp doanh nghiệp thật, đo trên dữ liệu không dùng để huấn luyện.
Số, tiền và ngày tháng
Speech-to-Text của s2speech được làm để hiểu số, tiền, ngày tháng và tiếng Việt chen tiếng Anh. Dù vậy, kịch bản vẫn nên bắt voicebot đọc lại mã đơn, số tiền, ngày hẹn để khách xác nhận. Một câu “Dạ em đọc lại nhé” tốn vài giây nhưng có thể tránh được cả một vụ khiếu nại.
Vận hành sau ngày chạy chính thức
On-premise nghĩa là bạn tự lo những việc mà nhà cung cấp đám mây thường làm hộ: theo dõi nhiệt độ và bộ nhớ GPU, sao lưu cấu hình, cập nhật phiên bản, tính trước chuyện máy chủ khởi động lại giữa giờ làm. Luôn chừa sẵn đường lui: máy chủ AI không phản hồi thì tổng đài phải tự chuyển cuộc gọi về người.
Dữ liệu và quyền truy cập
Giữ dữ liệu trong nhà là lý do chính để chọn on-premise, nên đừng để nó rò ra cửa sau. Ai được nghe lại ghi âm, bản chép lời lưu bao lâu, log có che số tài khoản của khách không. Những câu này nên có câu trả lời trên giấy trước ngày chạy thật.
Một lộ trình thử nghiệm gọn
Nếu vẫn thấy hợp, lộ trình có thể như sau. Dựng thử kịch bản bằng API của nền tảng, với câu nói do chính nhóm thu hoặc dữ liệu giả lập, chưa dùng ghi âm thật của khách. Theo s2speech.com, hiện mỗi tài khoản có $10 dùng miễn phí mỗi ngày, không cần thẻ, nên bước này có thể bắt đầu trước khi phải xin ngân sách. Khi kịch bản ổn, chuyển sang bản Speech-to-Speech on-premise, cho chạy song song với tổng đài viên ở một tuyến gọi ít rủi ro, nghe lại cuộc gọi lỗi mỗi ngày, và chỉ mở rộng khi tỉ lệ phải chuyển người giảm dần rồi ổn định.
Thông tin từng dịch vụ có trên trang sản phẩm s2speech, còn tài khoản dùng thử thì tạo ở s2speech.com. Đội ngũ AIVISION đã triển khai AI tiếng nói ở Việt Nam, Mỹ, Mexico, Philippines và Thái Lan, nên những câu hỏi kiểu “tổng đài của tôi cấu hình hơi lạ” có người để hỏi.
Còn chị trưởng bộ phận tuân thủ? Chị không cần biết VRAM là gì. Chị chỉ cần nhìn sơ đồ và thấy mũi tên dữ liệu không vượt qua bức tường công ty. Với on-premise, đó là sơ đồ vẽ được. Chỉ cần hỏi AIVISION xác nhận một điều: bản on-premise chạy hoàn toàn trong mạng nội bộ, không cần gọi ra ngoài.