AI đa ngôn ngữ: bài học từ LLM tiếng Việt sang Mexico, Philippines
01/10/2026

Làm một LLM cho tiếng Việt dạy tôi nhiều điều mà các tài liệu tiếng Anh ít nhắc tới. Ngôn ngữ có sáu thanh điệu, chữ viết đầy dấu, người dùng gõ không dấu khi vội, và mỗi miền dùng một từ khác nhau cho cùng một thứ. Khi nhìn sang những thị trường như Mexico hay Philippines, tôi nhận ra các vấn đề này không biến mất. Chúng đổi hình. Bài này bàn về AI đa ngôn ngữ ở góc độ bài toán và hướng tiếp cận chung, chứ không phải thông báo về model nào.
Cần nói rõ ngay từ đầu: các model hiện nay của AIVISION là E1.0 và L1.0, được phát hành cho tiếng Việt. Những gì dưới đây là suy nghĩ về cách tiếp cận, rút ra từ kinh nghiệm làm tiếng Việt, không phải lời khẳng định về việc hỗ trợ ngôn ngữ khác.
Tiếng Việt dạy gì cho chúng tôi
Có ba bài học lớn. Một là dữ liệu chất lượng cao bằng ngôn ngữ ít tài nguyên khan hiếm hơn bạn tưởng, nhất là dữ liệu chuyên ngành như y tế hay dược. Hai là chuẩn hóa văn bản chiếm nhiều công sức hơn mọi người dự tính: mã hóa ký tự, dấu đặt lệch chỗ, viết tắt, tiếng lóng mạng xã hội. Ba là đánh giá. Điểm benchmark dịch từ tiếng Anh sang chưa cho biết model có hiểu cách người thật nói.
Với giọng nói còn thêm một lớp nữa. Một hệ speech to text tiếng Việt phải đối mặt với giọng Bắc, Trung, Nam, tiếng ồn tổng đài, người nói chen ngang. Mỗi ngôn ngữ mới sẽ có bộ vấn đề tương tự, nhưng khác chi tiết.
Tiếng Tây Ban Nha ở Mexico: cùng ngôn ngữ, khác thị trường
Nhiều người nghĩ tiếng Tây Ban Nha có sẵn rất nhiều tài nguyên nên bài toán dễ. Phần đúng là dữ liệu tổng quát thì dồi dào. Phần dễ bị đánh giá thấp là tiếng Tây Ban Nha ở Mexico có từ vựng, cách xưng hô, thành ngữ và cách nói chuyện với khách hàng khác với Tây Ban Nha hay Argentina. Một chatbot chăm sóc khách hàng dùng giọng quá trang trọng kiểu châu Âu sẽ nghe lạc điệu ngay. Thêm nữa là hiện tượng pha trộn tiếng Anh trong công việc, đặc biệt ở các vùng gần biên giới.
Tôi nghĩ bài học từ tiếng Việt áp dụng được ở đây: đừng coi “tiếng Tây Ban Nha” là một khối. Hãy xác định biến thể mục tiêu từ đầu, thu thập dữ liệu theo đúng biến thể đó, và nhờ người bản ngữ ở đúng khu vực kiểm tra. Một người Tây Ban Nha đọc kết quả chưa chắc phát hiện ra chỗ người Mexico thấy gượng.
Philippines: nhiều ngôn ngữ và chuyện chuyển mã
Philippines là bài toán phức tạp theo kiểu khác. Có Filipino và nhiều ngôn ngữ vùng, trong khi tiếng Anh được dùng rộng rãi trong công việc. Người dùng hay chuyển qua lại giữa tiếng Anh và tiếng bản địa ngay trong một câu, hiện tượng gọi là chuyển mã (code-switching). Với nhận dạng giọng nói, điều này khó chịu: model phải nhận ra từ nào thuộc ngôn ngữ nào ngay giữa câu.
Tiếng Việt cũng có phiên bản của chuyện này, khi dân công nghệ trộn thuật ngữ tiếng Anh vào câu nói hằng ngày, kiểu “deploy xong chưa anh”. Kinh nghiệm cho thấy bạn không thể xử lý bằng cách coi mọi câu là đơn ngữ. Dữ liệu huấn luyện phải phản ánh cách người ta thực sự nói, kể cả khi nó “không chuẩn” theo sách giáo khoa.
Những vấn đề kỹ thuật lặp lại ở mọi ngôn ngữ
- Tokenizer. Bộ tách từ thiết kế cho tiếng Anh thường chia tiếng Việt, và cả nhiều ngôn ngữ khác, thành quá nhiều mảnh vụn. Hậu quả là tốn token hơn, chậm hơn, đắt hơn, và đôi khi hiểu kém hơn.
- Dữ liệu chuyên ngành. Từ vựng y khoa, pháp lý, tài chính của mỗi ngôn ngữ phải được tìm và kiểm chứng riêng. Dịch máy từ tiếng Anh dễ sinh ra thuật ngữ nghe có vẻ đúng mà không ai dùng.
- Phương ngữ và giọng. Gom chung tất cả vào một tập thường làm model trung bình hóa và kém ở từng nơi.
- An toàn và văn hóa. Điều nhạy cảm ở nước này có thể bình thường ở nước khác. Bộ lọc an toàn dịch nguyên văn thường sai lệch.
Cách đánh giá không bị lừa bởi con số đẹp
Sai lầm tôi gặp nhiều nhất là đo model đa ngôn ngữ bằng bộ đề dịch máy từ tiếng Anh rồi kết luận nó “hiểu” ngôn ngữ đích. Bộ đề dịch mang theo cấu trúc câu và bối cảnh văn hóa của tiếng Anh. Điều đáng tin hơn là tạo bộ kiểm thử bản địa: câu hỏi thật của người dùng thật, viết bởi người bản ngữ, đúng lĩnh vực, bao gồm cả lỗi chính tả và cách nói đời thường.
Với nhận dạng giọng nói, tương tự: cần ghi âm thật từ đúng môi trường sử dụng, đúng nhóm giọng, đúng mức ồn. Phòng thu sạch cho kết quả đẹp mà ngoài đời thì không.
Cách chúng tôi nghĩ về việc mở rộng
AIVISION là đơn vị AI tại Việt Nam, huấn luyện LLM trên cụm 24x NVIDIA H200 và 8x NVIDIA B300, đã phát hành model speech-to-text E1.0 và LLM L1.0 cho tiếng Việt, đồng thời làm training và finetune cho các lĩnh vực như healthcare và dược. Chúng tôi vận hành các trang aivision.vn cho thị trường Việt Nam, aivgroups.com cho độc giả quốc tế và aivision.mx cho Mexico, nên chuyện địa phương hóa là câu hỏi có thật trong công việc của chúng tôi.
Hướng tiếp cận chúng tôi nghiêng về là làm từng thị trường một cách có kỷ luật thay vì tuyên bố “hỗ trợ trăm ngôn ngữ”. Cụ thể: xác định lĩnh vực và biến thể ngôn ngữ cần phục vụ, làm việc với người bản ngữ để dựng dữ liệu và bộ kiểm thử, đo trên nhiệm vụ thật, rồi mới mở rộng. Cách này chậm hơn, và đổi lại bạn biết model làm được gì và chưa làm được gì.
Điều tôi sẽ hỏi nếu bạn làm AI cho thị trường mới
- Biến thể ngôn ngữ nào, ở khu vực nào, cho nhóm người dùng nào?
- Dữ liệu chuyên ngành hợp pháp ở đâu ra, ai kiểm chứng?
- Người bản ngữ nào tham gia đánh giá, và họ có đại diện cho người dùng thật không?
- Người dùng có chuyển mã hay viết tắt không, và dữ liệu có phản ánh điều đó chưa?
- Quy định bảo vệ dữ liệu của nước đó yêu cầu gì về nơi lưu trữ?
Trả lời được năm câu này trước khi viết dòng code đầu tiên thường tiết kiệm được vài tháng. Ngôn ngữ không chỉ là chữ. Nó là thói quen, là bối cảnh, và model chỉ giỏi khi dữ liệu đưa nó vào đúng bối cảnh đó.