Câu hỏi thường gặp về speech to text và LLM tiếng Việt

01/10/2026

Câu hỏi thường gặp về speech to text và LLM tiếng Việt

Chúng tôi nhận được khá nhiều câu hỏi lặp đi lặp lại từ những đội đang cân nhắc dùng speech to text tiếng Việt và LLM tiếng Việt cho công việc thật. Thay vì trả lời rải rác qua email, chúng tôi gom chúng ở đây. Có những câu chúng tôi trả lời được ngay, và có những câu phải nói thẳng là cần trao đổi theo từng trường hợp. Chúng tôi chọn nói thật hơn là đưa con số đẹp mà không đo được trên bài toán của bạn.

Về AIVISION và các model

AIVISION là ai?

AIVISION là đơn vị AI tại Việt Nam. Chúng tôi huấn luyện LLM trên hệ thống cluster gồm 24x NVIDIA H200 và 8x NVIDIA B300, và làm training, finetune LLM cho tiếng Việt cũng như cho các lĩnh vực cụ thể như healthcare và dược. Website của chúng tôi gồm aivision.vn cho tiếng Việt, aivgroups.com cho tiếng Anh và aivision.mx cho Mexico.

E1.0 và L1.0 là gì?

E1.0 là model speech-to-text, tức chuyển giọng nói thành văn bản, và L1.0 là model ngôn ngữ lớn (LLM), cả hai cho tiếng Việt. Chúng tôi đã phát hành cả hai. Nói đơn giản: E1.0 nghe, L1.0 hiểu và sinh văn bản. Hai thứ có thể đi cùng nhau, ví dụ nghe cuộc gọi rồi tóm tắt nội dung.

Model có bao nhiêu tham số?

Chúng tôi không công bố con số tham số trong bài này. Con số đó cũng ít khi cho biết model hợp với bài toán của bạn hay không, vì một model nhỏ được finetune tốt có thể phù hợp hơn một model lớn tổng quát. Nếu bạn cần thông tin kỹ thuật để đánh giá hạ tầng, hãy liên hệ để trao đổi theo nhu cầu cụ thể.

Độ chính xác bao nhiêu phần trăm?

Câu này chúng tôi cố tình không trả lời bằng một con số. Độ chính xác của nhận dạng giọng nói phụ thuộc rất nhiều vào chất lượng âm thanh, giọng vùng miền, tiếng ồn, thuật ngữ chuyên ngành và cách đo. Một con số trong phòng thu chẳng nói gì về tổng đài của bạn. Cách đáng tin hơn là thử trên mẫu ghi âm thật của bạn và đo cùng nhau. Hãy liên hệ để sắp xếp việc này.

Về speech to text tiếng Việt

Speech to text tiếng Việt khó ở chỗ nào?

Tiếng Việt có sáu thanh điệu, và hai từ chỉ khác nhau ở dấu có thể mang nghĩa hoàn toàn khác. Thêm giọng Bắc, Trung, Nam, từ địa phương, người nói nhanh, nói nuốt âm, đoạn hội thoại có nhiều người, và tiếng ồn. Với lĩnh vực như y tế, tên thuốc và thuật ngữ hiếm càng làm bài toán khó hơn. Vì vậy chúng tôi tập trung vào dữ liệu và đánh giá sát với điều kiện sử dụng thực.

Âm thanh thế nào thì cho kết quả tốt hơn?

Một vài kinh nghiệm chung: micro đặt gần người nói, hạn chế tiếng vọng, tránh nén âm thanh quá mức, và nếu có thể thì tách kênh từng người nói. Chuyện này không phụ thuộc riêng vào model nào. Đôi khi đổi vị trí micro cải thiện kết quả nhiều hơn đổi cả model.

Có xử lý được thuật ngữ chuyên ngành không?

Đây là một trong những lý do chúng tôi làm finetune cho từng lĩnh vực như healthcare và dược. Thuật ngữ chuyên ngành thường là nơi model tổng quát hay mắc lỗi. Mức độ cải thiện thế nào phải đo trên dữ liệu của bạn, và chúng tôi không đưa con số khi chưa có phép đo đó.

Về LLM tiếng Việt và finetune

Finetune LLM khác gì với dùng model có sẵn?

Model có sẵn dùng được ngay nhưng có thể hiểu sai thuật ngữ, trả lời không đúng định dạng, hoặc lệch giọng. Finetune là huấn luyện tiếp trên dữ liệu của bạn để model quen với lĩnh vực và cách làm việc cụ thể. Đổi lại, bạn cần dữ liệu tốt và một cách đánh giá nghiêm túc. Không phải bài toán nào cũng cần finetune. Đôi khi RAG hoặc viết prompt tốt là đủ.

Nên dùng RAG hay finetune?

Nếu chatbot chủ yếu tra cứu tài liệu hay thay đổi, bắt đầu với RAG. Nếu vấn đề là model hiểu sai thuật ngữ hay xuất sai định dạng, finetune đáng cân nhắc. Nhiều hệ thống tốt dùng cả hai. Chúng tôi thường khuyên đo lỗi thật trước rồi quyết định.

Chi phí là bao nhiêu?

Chúng tôi không đưa mức giá chung vì chi phí phụ thuộc vào khối lượng dữ liệu, mức độ cần làm sạch, kích thước model, hạ tầng và yêu cầu vận hành. Hãy liên hệ để trao đổi theo nhu cầu của bạn, và chúng tôi sẽ nói rõ cái gì được tính vào đâu.

Về triển khai và dữ liệu

Có thể chạy on-premise không?

Với nhiều khách hàng, đặc biệt trong y tế và tài chính, câu hỏi dữ liệu có rời khỏi tổ chức hay không là câu hỏi đầu tiên. Chúng tôi sẵn sàng thảo luận các phương án triển khai, kể cả đặt trong môi trường của khách hàng, tùy yêu cầu và năng lực vận hành của hai bên. Phương án cụ thể cần bàn theo từng trường hợp.

Dữ liệu của tôi được xử lý thế nào?

Quy tắc chúng tôi theo đuổi là dữ liệu của khách thuộc về khách. Chi tiết về lưu trữ, thời gian xóa, ẩn danh hóa và phạm vi sử dụng cần được ghi rõ bằng văn bản trong thỏa thuận, và chúng tôi khuyên mọi khách hàng đọc kỹ phần này với bất kỳ đơn vị nào, không riêng chúng tôi.

Hệ thống có hỗ trợ ngôn ngữ khác ngoài tiếng Việt không?

E1.0 và L1.0 được phát hành cho tiếng Việt. Chúng tôi không khẳng định hỗ trợ các ngôn ngữ khác ở thời điểm này. Nếu bạn có nhu cầu về ngôn ngữ khác, hãy cho chúng tôi biết để thảo luận như một bài toán riêng.

Làm sao để bắt đầu thử?

Cách thực tế nhất là bắt đầu với một tác vụ hẹp và một lượng nhỏ dữ liệu thật: vài chục cuộc ghi âm, hoặc vài chục câu hỏi điển hình. Cùng nhau xác định tiêu chí thành công trước khi chạy. Cách này cho bạn bằng chứng cụ thể thay vì lời hứa. Thông tin thêm có tại AIVISION.

Tại sao các câu trả lời ở đây ít con số?

Vì chúng tôi muốn trung thực. Độ chính xác, độ trễ, chi phí đều phụ thuộc vào bài toán, dữ liệu và hạ tầng của bạn. Một con số chung chung nghe hấp dẫn nhưng dễ gây hiểu nhầm, và chúng tôi thà để bạn đo trực tiếp rồi tự đánh giá. Nếu bạn cần so sánh nhiều đơn vị, hãy dùng cùng một bộ dữ liệu kiểm thử cho tất cả, kể cả chúng tôi.

Bài viết liên quan

Xem tất cả bài viết