Thuật ngữ y khoa và tên thuốc tiếng Việt: vì sao LLM hay sai
01/10/2026

Thử một thí nghiệm nhỏ: đưa cho một mô hình tổng quát một ghi chép khám bệnh tiếng Việt, loại ghi vội, có viết tắt, có chữ Latin xen giữa, rồi nhờ nó viết lại cho rõ. Phần lớn thời gian kết quả đọc rất mượt. Nhưng nếu bạn là người trong nghề và đọc kỹ, đôi khi sẽ thấy một viết tắt bị hiểu thành nghĩa khác, hoặc một tên thuốc bị đổi thành tên nghe gần giống. Đây là điều mà người làm thuật ngữ y khoa tiếng Việt với AI hay gặp, và là lý do finetune LLM y tế được đặt ra.
Bài này giải thích vì sao lỗi xảy ra, finetune giúp được đến đâu, và chỗ nào thì không thuốc nào chữa được. Góc nhìn là của AIVISION, đơn vị làm training và finetune LLM tiếng Việt.
Vì sao model tổng quát hay sai
Không có một nguyên nhân duy nhất. Có vài lớp chồng lên nhau.
Dữ liệu huấn luyện mỏng đúng chỗ cần dày
Mô hình học từ chữ nó đã đọc. Tiếng Anh y khoa có kho tài liệu khổng lồ. Tiếng Việt y khoa thì ít hơn nhiều, và phần lớn nằm ở những định dạng khó khai thác: PDF quét, tài liệu nội bộ, hồ sơ không được công khai vì lý do hợp lý. Kết quả là mô hình hiểu thuật ngữ tiếng Anh tốt hơn tiếng Việt, và khi gặp cách gọi Việt hoá, nó đoán.
Một khái niệm, nhiều cách gọi
Cùng một thứ có thể được gọi bằng thuật ngữ Hán Việt, tên gốc Latin, tên tiếng Anh, tên thông tục, và cách viết tắt riêng của từng khoa. Bác sĩ trong nghề hiểu nhờ ngữ cảnh. Mô hình nhiều khi thiếu ngữ cảnh đó. Một viết tắt hai chữ cái có thể mang nghĩa khác nhau ở tim mạch và ở nhi khoa.
Tên thuốc là trường hợp đặc biệt
Tên thuốc có hai tầng: tên hoạt chất và tên thương mại, mà tên thương mại do từng hãng đặt, nhiều khi chỉ khác nhau một hai chữ cái. Chúng được phiên âm sang tiếng Việt theo nhiều cách, người dùng gõ không dấu, gõ sai, nghe qua điện thoại rồi ghi lại. Với mô hình thống kê, hai cái tên gần giống nhau về mặt chữ rất dễ bị gộp thành một. Đây là loại lỗi nguy hiểm vì hai sản phẩm có thể hoàn toàn khác nhau về mục đích sử dụng.
Sự tự tin vô tư
Mô hình không có cảm giác ngập ngừng. Khi gặp một tên chưa từng thấy, nó không nói tôi không biết mà tạo ra một câu trả lời hợp lý. Đó không phải thiết kế xấu có chủ ý, mà là hệ quả của cách nó học: dự đoán chữ tiếp theo có khả năng nhất.
Finetune giúp được gì
Finetune là huấn luyện tiếp trên dữ liệu của lĩnh vực hẹp. Làm đúng, nó mang lại vài thay đổi có ý nghĩa.
- Mô hình quen với cách dùng chữ thực tế của giới y tế Việt Nam, bao gồm cả viết tắt và cách pha trộn ngôn ngữ.
- Nhận diện tốt hơn các biến thể của một tên: có dấu, không dấu, phiên âm, viết sai quen thuộc.
- Hiểu cấu trúc của các loại tài liệu: bệnh án, đơn, nhãn thuốc, tờ hướng dẫn.
- Biết giữ nguyên thuật ngữ khi tóm tắt hay viết lại, thay vì tự diễn đạt lại cho đẹp.
Nhưng tôi muốn tránh kiểu nói làm phép màu. Finetune không biến mô hình thành bác sĩ hay dược sĩ. Nó làm cho mô hình giỏi hơn về mặt ngôn ngữ của lĩnh vực, đọc hiểu và viết chuẩn hơn. Hiểu thuật ngữ khác với phán đoán lâm sàng, và chúng tôi không dùng finetune để vượt qua ranh giới đó.
Dữ liệu quyết định phần lớn kết quả
Ở các dự án kiểu này, thời gian dành cho dữ liệu thường nhiều hơn thời gian dành cho huấn luyện. Cần một bảng thuật ngữ do người trong nghề rà soát, cùng danh sách biến thể và viết tắt theo từng khoa. Cần ví dụ câu thật, đã xử lý để không lộ thông tin cá nhân. Cần những cặp tên dễ nhầm được đánh dấu riêng để mô hình học cách phân biệt.
Điều tôi thấy hiệu quả nhất, dù không hào nhoáng: bảng thuật ngữ do chính người dùng cuối soạn. Dược sĩ biết ở nhà thuốc mình khách hay gọi sản phẩm nào bằng tên gì. Bác sĩ khoa nội biết ba cách viết tắt cùng một chẩn đoán. Kiến thức đó không có trong sách, và không mô hình nào tự nhặt ra được.
Một điều cần tính trước: thuật ngữ thay đổi. Sản phẩm mới ra, danh pháp được cập nhật, khoa phòng thêm cách gọi. Bảng thuật ngữ nên được xem là tài liệu sống, có người chịu trách nhiệm cập nhật, chứ không phải thứ làm một lần.
Cách đo xem có tốt lên không
Cảm giác đọc thấy mượt không phải phép đo. Cách làm đáng tin hơn là xây một bộ câu kiểm tra nhỏ nhưng khó: những cặp tên dễ nhầm, những viết tắt đa nghĩa, những câu thiếu ngữ cảnh. Chạy trước và sau khi finetune, cho chuyên gia chấm thủ công. Ghi lại không chỉ tỷ lệ đúng mà cả loại sai, vì sai kiểu bỏ sót khác hẳn sai kiểu bịa.
Tôi sẽ không đưa ra con số về mức cải thiện ở đây, vì nó phụ thuộc vào dữ liệu và bài toán cụ thể, và một con số rút từ nơi khác chỉ gây hiểu lầm. Nếu ai đó chào bạn một phần trăm chính xác mà không nói đo trên bộ dữ liệu nào, hãy hỏi lại.
Đặt vào đúng chỗ
AIVISION huấn luyện mô hình trên cluster 24 GPU NVIDIA H200 và 8 GPU NVIDIA B300, đã phát hành LLM L1.0 cho tiếng Việt cùng mô hình speech to text E1.0, và nhận finetune cho các lĩnh vực như y tế và dược. Hướng của chúng tôi là xây nền tiếng Việt vững rồi tinh chỉnh theo từng lĩnh vực cùng đơn vị sử dụng, với dữ liệu được xử lý đúng quy định.
Dù vậy, tôi vẫn giữ một điều nhắc cho mọi người dùng công cụ kiểu này: khi một thuật ngữ hay tên thuốc xuất hiện trong kết quả của mô hình và nó quan trọng với một quyết định, hãy đối chiếu với tài liệu gốc. Mô hình tốt hơn thì lỗi ít đi, chứ không về không. Bác sĩ và dược sĩ vẫn là người quyết định cuối cùng, và công cụ nên được thiết kế để việc đối chiếu của họ nhanh, không phải để họ khỏi cần đối chiếu.