AIVISION phát hành Speech to Speech AI: miễn phí, realtime, on-premise
02/10/2026

Bạn nói một câu, vài nhịp sau AI đã trả lời lại bằng giọng nói. Không phải gõ, không phải đọc chữ trên màn hình. Đó là thứ AIVISION vừa phát hành: bộ mô hình Speech to Speech cho tiếng Việt, dùng thử miễn phí tại s2speech.com, chạy theo thời gian thực và có thể cài đặt on-premise ngay trong hạ tầng của doanh nghiệp.

Speech to Speech là gì, nói cho dễ hiểu
Một hệ thống hội thoại bằng giọng nói cần làm ba việc liên tiếp: nghe (chuyển giọng nói thành văn bản), hiểu (mô hình ngôn ngữ xử lý câu hỏi) và nói (đọc câu trả lời thành tiếng). Nếu ba khâu này nằm ở ba nhà cung cấp khác nhau, độ trễ cộng dồn và trải nghiệm trở nên rời rạc. Speech to Speech của AIVISION gom cả ba khâu lại: Speech-to-Text, mô hình ngôn ngữ aivision-L1.0 và Text-to-Speech, cùng một nền tảng, một API.
Kết quả là cuộc hội thoại chạy liền mạch hơn. Âm thanh được phát dạng streaming, nên người nghe bắt đầu nghe câu trả lời trước khi máy đọc xong cả đoạn.
Bốn điểm chính của bản phát hành
- Dùng miễn phí: mỗi tài khoản trên s2speech.com có $5 sử dụng miễn phí mỗi ngày, không cần thẻ.
- Realtime: nghe, hiểu và trả lời trong lúc cuộc hội thoại đang diễn ra.
- On-premise: doanh nghiệp có thể chạy toàn bộ hệ thống trên máy chủ của mình, dữ liệu giọng nói không phải rời khỏi hạ tầng nội bộ.
- Phần cứng vừa phải: chỉ cần một GPU khoảng 8GB VRAM, tầm RTX 2080 Ti, và phục vụ được 8 phiên hội thoại đồng thời (8 CCU).
Vì sao chạy được trên GPU 8GB lại quan trọng
Nhiều doanh nghiệp muốn dùng AI giọng nói nhưng vướng hai chuyện: không muốn gửi ghi âm khách hàng ra ngoài, và không có ngân sách cho cụm GPU đắt tiền. Một mô hình chỉ cần khoảng 8GB VRAM thay đổi bài toán này. Một máy chủ với card đồ họa phổ thông đã đủ để chạy thử, và khi cần nhiều phiên hơn thì nhân thêm máy theo tỷ lệ 8 phiên mỗi GPU.
Với on-premise, dữ liệu hội thoại nằm trong tầm kiểm soát của doanh nghiệp, điều mà các ngành như ngân hàng, y tế hay khu vực công thường bắt buộc.
Dùng vào việc gì
Tổng đài và chăm sóc khách hàng
Trả lời các câu hỏi lặp lại bằng giọng nói tự nhiên, ngoài giờ hành chính hoặc lúc đường dây quá tải. Nền tảng hỗ trợ định dạng âm thanh 8 kHz G.711 dùng thẳng trên các tổng đài phổ biến.
Trợ lý giọng nói trong ứng dụng
Thêm khả năng hỏi đáp bằng giọng nói vào app, kiosk hay thiết bị, mà không phải ghép nhiều dịch vụ rời rạc.
Phiên dịch và hội thoại đa ngôn ngữ
Trên s2speech.com đã có các ứng dụng dùng ngay như phiên dịch giọng nói, phụ đề trực tiếp và phòng họp đa ngôn ngữ. Theo AIVISION, các ứng dụng dịch và họp hỗ trợ 24 ngôn ngữ, với tiếng Việt là trọng tâm.
Độ chính xác được công bố bằng số
Khâu nghe là nền móng của Speech to Speech. AIVISION công bố mô hình nhận dạng giọng nói của mình có tỉ lệ lỗi từ trung bình 11,84% trên bốn bộ kiểm thử tiếng Việt, gồm cả hội thoại y khoa và cuộc họp doanh nghiệp thực tế. Đây là số liệu nội bộ của AIVISION, đo trên dữ liệu không dùng để huấn luyện, và được đăng công khai trên s2speech.com.
Dĩ nhiên, môi trường thực tế của mỗi doanh nghiệp khác nhau: tạp âm, giọng vùng miền, thuật ngữ chuyên ngành. Cách tốt nhất vẫn là thử trên chính dữ liệu của bạn trước khi triển khai rộng.
Bắt đầu thế nào
Bạn có thể đăng ký và dùng thử ngay tại s2speech.com. Nhà phát triển có thể tích hợp qua REST, WebSocket, và mô hình ngôn ngữ dùng API tương thích OpenAI.
Doanh nghiệp cần triển khai on-premise hoặc tư vấn giải pháp có thể liên hệ trực tiếp:
- Điện thoại: +84 981 419 967
- Email: giang.vo@aivgroups.com
Tìm hiểu thêm các giải pháp AI khác tại AIVISION.