Vì sao LLM tiếng Việt cần được huấn luyện riêng

01/10/2026

Vì sao LLM tiếng Việt cần được huấn luyện riêng

Một buổi chiều, anh bạn làm chăm sóc khách hàng gửi tôi ảnh chụp màn hình. Khách nhắn: 'em oi cho anh hoi cai nay bao hanh may thang'. Chatbot trả lời một đoạn rất lịch sự, rất trôi chảy, và hoàn toàn sai ý, vì nó hiểu 'bao hanh' thành một thứ khác. Không ai trong phòng cười nổi. Đó là loại lỗi nhỏ mà chỉ khi triển khai thật mới thấy, và nó là lý do chính khiến chúng tôi ở AIVISION nghĩ nghiêm túc về LLM tiếng Việt được huấn luyện riêng.

Nói trước cho công bằng: các model đa ngữ lớn bây giờ đọc và viết tiếng Việt khá ổn. Nhiều việc không cần model riêng. Nhưng 'khá ổn' và 'đủ tin cậy để đặt trước khách hàng' là hai khoảng cách rất khác nhau, và khoảng cách ấy nằm ở bốn chỗ cụ thể dưới đây.

Tokenizer: chi phí nằm ở chỗ ít ai nhìn

Model không đọc chữ, nó đọc token. Tokenizer được xây từ kho dữ liệu huấn luyện ban đầu, và nếu kho đó chủ yếu là tiếng Anh thì các mảnh từ tiếng Anh được gộp rất gọn, còn tiếng Việt bị băm vụn. Một câu tiếng Việt có dấu có thể tốn nhiều token hơn đáng kể so với câu tiếng Anh cùng nghĩa. Chúng tôi không đưa ra con số cụ thể ở đây vì nó phụ thuộc từng tokenizer, nhưng bạn có thể tự đo trong năm phút: lấy cùng một đoạn văn hai thứ tiếng, đếm token, so sánh.

Hệ quả có ba lớp. Chi phí gọi API tăng vì tính theo token. Cửa sổ ngữ cảnh co lại, nên tài liệu dài nhét vừa ít hơn. Và tốc độ sinh chữ chậm đi, vì mỗi âm tiết có thể phải sinh qua nhiều bước. Huấn luyện riêng cho phép chọn hoặc mở rộng từ vựng sao cho các âm tiết phổ biến như 'không', 'được', 'người' là một token nguyên vẹn thay vì ba bốn mảnh vụn. Đánh đổi là bạn phải huấn luyện lại phần embedding, và nếu làm ẩu, model có thể quên bớt khả năng sẵn có.

Dữ liệu: nhiều không có nghĩa là sạch

Tiếng Việt trên web không ít, nhưng phần lớn là tin tức sao chép lại, bình luận, quảng cáo, nội dung dịch máy thô và trang spam. Một model học từ đó sẽ học luôn giọng văn lủng củng của bản dịch máy. Bạn từng đọc một đoạn tiếng Việt mà biết ngay là dịch từ tiếng Anh, chữ nào cũng đúng mà cả câu không ai nói thế chưa? Model cũng sinh ra những đoạn như vậy, vì nó đã đọc rất nhiều đoạn như vậy.

Cái thiếu lớn hơn nằm ở các mảng chuyên ngành: văn bản hành chính, tài liệu pháp lý, hồ sơ y tế, thông tin thuốc. Những thứ này hoặc không công khai, hoặc nằm trong PDF scan chất lượng kém. Muốn model nói đúng giọng của một lĩnh vực, phải có người chịu khó thu thập, làm sạch và chuẩn hoá. Phần việc đó tẻ nhạt nhưng quyết định kết quả nhiều hơn việc chọn kiến trúc. Chúng tôi sẽ nói riêng về nó ở một bài khác về dữ liệu huấn luyện.

Dấu thanh không phải chuyện trang trí

Tiếng Việt có sáu thanh, và dấu là một phần của nghĩa. 'Ma', 'má', 'mà', 'mả', 'mã', 'mạ' là sáu từ khác nhau. Con người đọc tiếng Việt không dấu được nhờ ngữ cảnh, nhưng model chưa chắc. Trong thực tế, người dùng gõ không dấu rất nhiều, nhất là trên điện thoại và trong tin nhắn nhanh. Gõ Telex sai, thiếu một phím, ra 'dduowcj' hay 'đuơc'. Tin nhắn thoại chuyển thành chữ cũng hay mất dấu hoặc gắn nhầm dấu.

Một model chỉ học trên văn bản biên tập sạch sẽ sẽ bối rối trước đống dữ liệu đó. Một model được cho thấy đủ ví dụ thật, gồm cả văn bản có lỗi, sẽ học cách đoán đúng. Điều này đặc biệt đáng kể với ứng dụng giọng nói: speech to text tiếng Việt sinh ra văn bản, và văn bản đó chính là đầu vào của LLM. Lỗi dấu ở tầng nhận dạng sẽ chảy thẳng xuống tầng hiểu. Vì vậy chúng tôi coi ASR và LLM là hai nửa của cùng một bài toán, không phải hai sản phẩm tách rời.

Cách nói thật của người Việt

Đây là phần khó đo nhất. Người Việt xưng hô theo tuổi, vai vế, quan hệ: anh, chị, em, cô, chú, mình, tớ. Chữ 'ạ', 'nhé', 'nha', 'hen' thay đổi hẳn sắc thái câu. Một nhân viên ngân hàng nhắn 'dạ anh chờ em chút ạ' và model trả lời bằng giọng sách giáo khoa 'Quý khách vui lòng đợi trong giây lát' thì chưa sai, nhưng cứng. Ở miền Nam, miền Trung, miền Bắc từ vựng khác nhau. Người trẻ trộn tiếng Anh vào câu: 'deadline dí rồi', 'book lịch giúp em'. Viết tắt cũng đầy: 'k', 'ko', 'đc', 'dt', 'sđt'.

Một model đa ngữ thường hiểu được đa số những thứ này, nhưng đôi khi nó 'sửa' giúp bạn, thành chuẩn hoá thứ vốn không cần chuẩn hoá, hoặc trả lời bằng giọng quá trang trọng. Với chatbot hỗ trợ khách hàng hay trợ lý nội bộ, giọng điệu là một phần của sản phẩm.

Khi nào chưa cần huấn luyện riêng

Tôi không muốn bài này thành một lời quảng cáo. Nếu bạn chỉ cần tóm tắt email, soạn nháp văn bản, phân loại ticket với dữ liệu ít, một model đa ngữ kèm prompt tốt thường là đủ. Nếu vấn đề của bạn là model thiếu kiến thức cập nhật, RAG hợp lý hơn. Huấn luyện hay finetune đáng tiền khi bạn gặp một trong các tình huống: chi phí token tiếng Việt thành gánh nặng ở quy mô lớn, cần giọng điệu và thuật ngữ nhất quán, dữ liệu nhạy cảm cần chạy trong hạ tầng riêng, hoặc lĩnh vực đòi hỏi độ chính xác về thuật ngữ như y tế và dược. Phần so sánh các lựa chọn này chúng tôi viết kỹ trong một bài riêng về finetune LLM.

Góc nhìn của AIVISION

AIVISION là đơn vị AI tại Việt Nam, huấn luyện LLM trên hệ thống cluster 24 GPU NVIDIA H200 và 8 GPU NVIDIA B300. Về phần cứng, H200 có 141GB bộ nhớ HBM3e với băng thông khoảng 4,8TB/s, còn B300 có khoảng 288GB HBM3e. Bộ nhớ lớn nghĩa là có thể làm việc với model và ngữ cảnh dài hơn mà ít phải chia nhỏ. Chúng tôi đã phát hành model LLM L1.0 cho tiếng Việt và model speech-to-text E1.0, và tập trung vào việc làm cho AI Việt Nam hiểu tiếng Việt đúng như cách người ta nói, không chỉ đúng như cách người ta viết trong sách.

Chúng tôi cũng làm huấn luyện và finetune LLM cho các lĩnh vực cụ thể như healthcare và dược. Ở những lĩnh vực này, model chỉ là công cụ hỗ trợ thông tin và hành chính. Nó không chẩn đoán, không kê đơn, không khuyên liều dùng, và quyết định cuối cùng luôn thuộc về người có chuyên môn y khoa.

Thị trường nói tiếng Tây Ban Nha hay tiếng Tagalog cũng có đúng những vấn đề tương tự: tokenizer lệch, dữ liệu thưa, phương ngữ dày. Bài học rút ra từ tiếng Việt vì thế có thể mang sang các thị trường như Mexico hay Philippines, miễn là chịu khó đo trước khi tin.

Bài viết liên quan

Xem tất cả bài viết