Dữ liệu huấn luyện LLM tiếng Việt: làm sạch, ẩn danh, bản quyền

01/10/2026

Dữ liệu huấn luyện LLM tiếng Việt: làm sạch, ẩn danh, bản quyền

Có một câu nói trong nghề mà tôi nghe đến phát chán nhưng vẫn thấy đúng: model chỉ bằng dữ liệu của nó. Chán vì nghe như khẩu hiệu. Đúng vì mỗi lần một dự án thất bại, khi lần ngược lại, nguyên nhân gần như luôn nằm ở một file dữ liệu nào đó mà chẳng ai đọc kỹ. Bài này nói về dữ liệu huấn luyện LLM tiếng Việt: những việc tẻ nhạt cần làm và những cái bẫy mà chúng tôi ở AIVISION đã thấy lặp đi lặp lại.

Làm sạch: phần việc không ai muốn khoe

Dữ liệu tiếng Việt thô thường lẫn đủ thứ. Mã HTML còn sót, ký tự lạ do lỗi mã hoá, chữ bị vỡ dấu khi chuyển từ định dạng cũ, đoạn văn bị lặp lại cả chục lần, đầu trang chân trang của tài liệu scan chen vào giữa câu. Riêng chuyện Unicode đã đủ khổ. Cùng một chữ 'ệ' có thể được lưu ở dạng dựng sẵn hoặc dạng tổ hợp (chữ cái cộng dấu rời). Nhìn bằng mắt thì giống hệt, nhưng với máy là hai chuỗi khác nhau. Nếu không chuẩn hoá về một dạng, tokenizer sẽ coi như hai từ và model học loãng đi. Bước đầu tiên gần như luôn là chuẩn hoá Unicode.

Tiếp theo là lọc chất lượng. Loại văn bản quá ngắn, quá nhiều ký hiệu, tỷ lệ chữ không phải tiếng Việt cao bất thường. Loại trùng lặp, cả trùng chính xác lẫn gần trùng. Bản dịch máy thô cũng nên bị loại hoặc giảm trọng số, vì model học theo giọng văn gượng gạo đó. Tuy nhiên đừng lọc quá tay. Tôi đã thấy nhóm lọc mạnh đến mức xoá hết văn bản không dấu và văn bản viết tắt, rồi model huấn luyện xong không hiểu nổi tin nhắn của người dùng thật. Những thứ 'bẩn' mà người dùng thực sự gõ ra đôi khi chính là thứ cần giữ lại, có chọn lọc.

Ẩn danh hoá: dễ nói, khó làm

Dữ liệu doanh nghiệp, nhất là chat với khách, hồ sơ y tế, tài liệu nội bộ, chứa rất nhiều thông tin cá nhân: tên, số điện thoại, địa chỉ, số căn cước, email, biển số xe, mã bệnh nhân. Trước khi đưa vào huấn luyện, cần che hoặc thay thế chúng.

Các bước thực dụng gồm dùng quy tắc (regex) cho các mẫu có cấu trúc như số điện thoại, email, số định danh, dùng mô hình nhận diện thực thể cho tên người và địa chỉ, rồi thay bằng nhãn có nhất quán, ví dụ cùng một người luôn là [NGUOI_1] trong một đoạn hội thoại để giữ mạch văn. Sau đó phải kiểm tay một mẫu ngẫu nhiên. Tên tiếng Việt khó hơn bạn nghĩ: 'Hoa', 'Lan', 'Sáng', 'Bình' đều là danh từ hoặc tính từ thông thường. Địa chỉ viết tắt, viết thiếu dấu càng khó bắt hơn.

Hai điểm cần thừa nhận. Ẩn danh hoá hiếm khi hoàn hảo, nên phải cộng thêm biện pháp khác: giới hạn ai được truy cập dữ liệu, huấn luyện trong hạ tầng riêng, ghi nhật ký. Và có thông tin vẫn nhận ra người khi ghép với nhau, như một chuỗi chi tiết hiếm gặp, dù từng chi tiết đã được che. Với dữ liệu y tế, mức thận trọng cần cao hơn hẳn, và nên có sự tham gia của người phụ trách pháp lý hay tuân thủ của tổ chức ngay từ đầu, chứ không phải khi đã huấn luyện xong.

Bản quyền và quyền sử dụng

Câu hỏi 'dữ liệu này có được dùng để huấn luyện không' không có đáp án chung. Nó phụ thuộc nguồn gốc, giấy phép, điều khoản của trang gốc, thoả thuận với khách hàng, và pháp luật nơi áp dụng. Chúng tôi không phải tư vấn pháp lý nên không đưa ra kết luận chung, nhưng có vài nguyên tắc làm việc.

  • Ghi lại nguồn của từng tập dữ liệu và giấy phép đi kèm. Thiếu bước này, hai năm sau không ai trả lời nổi câu hỏi 'cái này lấy ở đâu'.
  • Dữ liệu của khách hàng chỉ dùng đúng phạm vi đã thoả thuận, và nên ghi rõ bằng văn bản có huấn luyện không, ai sở hữu model sau finetune.
  • Nội dung có bản quyền, như sách, báo, tài liệu trả phí, cần được xem xét riêng, không nên mặc định là lấy được vì nó 'có trên mạng'.
  • Khi nghi ngờ, hỏi luật sư hoặc bỏ nguồn đó đi. Chất lượng model thường không phụ thuộc vào một nguồn đáng ngờ nào.

Những cái bẫy hay gặp

Rò rỉ giữa tập huấn luyện và tập kiểm tra là cái bẫy kinh điển. Điểm đánh giá cao ngất vì model đã thấy đề thi. Đã thấy thì phải loại trùng cả gần-trùng trước khi chia tập.

Thiên lệch về giọng và vùng miền. Nếu dữ liệu chat phần lớn đến từ một chi nhánh miền Bắc, model sẽ nói giọng đó và trả lời sượng với khách miền Nam. Nếu toàn bộ tài liệu y tế lấy từ một bệnh viện, model sẽ phản ánh thói quen và thuật ngữ riêng của nơi ấy.

Nhãn sai hoặc không nhất quán. Khi có nhiều người viết câu trả lời mẫu, mỗi người một phong cách, thậm chí mâu thuẫn nhau về quy trình, model học ra sự lộn xộn. Hướng dẫn viết mẫu rõ ràng và một vòng rà soát chéo rẻ hơn nhiều so với việc huấn luyện lại.

Dữ liệu lỗi thời. Giá, quy định, quy trình thay đổi, nhưng model vẫn trả lời theo bản cũ một cách đầy tự tin. Với thông tin hay đổi, nên giữ ngoài model và truy xuất lúc chạy thay vì nhồi vào trọng số.

Dữ liệu tổng hợp do model khác sinh ra. Nó tiện và rẻ, nhưng nếu không kiểm, lỗi và văn phong máy sẽ bị khuếch đại qua từng thế hệ. Nên dùng có chọn lọc, có người đọc lại, và không coi nó là nguồn sự thật.

Một thói quen đáng giá

Tôi gợi ý một thói quen rất đơn giản: trước khi huấn luyện, cả nhóm ngồi đọc ngẫu nhiên 100 mẫu, thật sự đọc, không lướt. Có lần nhóm chúng tôi phát hiện cả một mảng mẫu bắt đầu bằng cùng một câu chào dài dòng chỉ nhờ cách làm này. Máy lọc chưa chắc bắt được, mắt người thì có.

Với healthcare và dược, dữ liệu càng cần được chuyên gia y khoa xem. Model chỉ là công cụ hỗ trợ thông tin và hành chính, không chẩn đoán, không kê đơn, không khuyên liều dùng. Một mẫu dữ liệu vô tình dạy model nói như thể nó đưa ra chỉ định là mẫu cần bị loại ngay.

AIVISION huấn luyện trên cluster 24 GPU NVIDIA H200 và 8 GPU NVIDIA B300, nhưng nhiều tính toán trong số đó vô nghĩa nếu đầu vào bẩn. Với chúng tôi, đầu tư vào dữ liệu luôn có lãi hơn đầu tư thêm phần cứng, điều nghe có vẻ ngược đời với một đơn vị có nhiều GPU.

Bài viết liên quan

Xem tất cả bài viết