Finetune LLM là gì và khi nào nên dùng thay vì prompt hay RAG
01/10/2026

Câu hỏi tôi nghe nhiều nhất từ khách hàng không phải 'model nào tốt nhất' mà là 'có cần finetune không?'. Và câu trả lời trung thực, hơn một nửa số lần, là chưa cần. Nghe lạ từ một đội làm finetune LLM chuyên nghiệp, nhưng chúng tôi thà nói vậy còn hơn nhận một dự án để rồi cả hai bên thất vọng.
Finetune thật ra là gì
Một LLM sau khi huấn luyện ban đầu là một khối trọng số khổng lồ đã học ngôn ngữ và nhiều kiến thức chung. Finetune là tiếp tục huấn luyện khối đó trên một tập dữ liệu nhỏ hơn nhiều, có chủ đích, để thay đổi hành vi của nó. Nó khác với 'dạy thêm kiến thức' theo nghĩa ngây thơ. Cái finetune làm tốt nhất là thay đổi cách model hành xử: giọng điệu, định dạng đầu ra, cách dùng thuật ngữ, cách từ chối, cách giữ nhất quán qua hàng nghìn lượt hỏi. Nó làm kém hơn việc nhồi các sự kiện mới và đổi liên tục.
Có nhiều kiểu: finetune toàn bộ trọng số, hoặc dùng kỹ thuật nhẹ như LoRA chỉ cập nhật một phần nhỏ tham số. Kiểu nhẹ rẻ hơn, nhanh hơn, dễ thay đổi, và với phần lớn bài toán doanh nghiệp là điểm bắt đầu hợp lý. Kiểu đầy đủ đáng cân nhắc khi cần thay đổi sâu, ví dụ thêm hẳn một ngôn ngữ hay một lĩnh vực.
Ba công cụ, ba bài toán khác nhau
Cách dễ nhớ nhất là hỏi: vấn đề của bạn là model không biết, không làm theo, hay không nói đúng kiểu?
- Prompt giải quyết việc model chưa hiểu bạn muốn gì. Rẻ nhất, sửa trong vài phút. Giới hạn là prompt dài tốn token mỗi lần gọi và vẫn có thể bị bỏ qua khi ngữ cảnh dài.
- RAG giải quyết việc model không biết thông tin, nhất là thông tin riêng hoặc thay đổi thường xuyên như bảng giá, quy trình nội bộ, tài liệu sản phẩm. Dữ liệu nằm ngoài model nên cập nhật bằng cách thay tài liệu, không cần huấn luyện lại, và có thể trích nguồn.
- Finetune giải quyết việc model biết nhưng không hành xử đúng kiểu bạn cần, hoặc cần chạy nhỏ, nhanh, rẻ hơn ở quy mô lớn.
Ba thứ này không loại trừ nhau. Hệ thống tốt thường dùng cả ba: model đã finetune cho giọng và định dạng, RAG cho kiến thức, prompt cho chỉ dẫn từng tình huống.
Những dấu hiệu nên finetune
Theo kinh nghiệm của chúng tôi, finetune có lý khi gặp một vài điều sau. Bạn đã thử prompt kỹ, đã thử few-shot, mà đầu ra vẫn lệch ở một số trường hợp lặp đi lặp lại. Bạn cần một định dạng đầu ra nghiêm ngặt, ví dụ JSON theo schema cố định hay biên bản theo mẫu của tổ chức, và không muốn trả tiền cho một prompt dài hàng nghìn token mỗi lần gọi. Bạn muốn dùng model nhỏ hơn để giảm chi phí và độ trễ mà vẫn giữ chất lượng ở một tác vụ hẹp. Bạn cần dữ liệu chạy trong hạ tầng riêng vì lý do bảo mật. Hoặc lĩnh vực của bạn có thuật ngữ và cách diễn đạt mà model đa dụng hay dùng sai, như y tế, dược, pháp lý.
Với tiếng Việt, có thêm một lý do: nếu model gốc xử lý tiếng Việt kém ở mức tokenizer hay giọng điệu, finetune có thể kéo hành vi về gần hơn với cách người dùng thật nói. Chúng tôi giải thích phần này trong bài về lý do LLM tiếng Việt cần huấn luyện riêng.
Những dấu hiệu chưa nên finetune
Nếu bạn chưa có bộ câu hỏi đánh giá, đừng finetune. Không có thước đo thì bạn sẽ không biết model sau finetune tốt hơn hay tệ hơn, chỉ có cảm giác. Nếu vấn đề là thông tin hay đổi, đừng finetune, vì mỗi lần đổi bạn lại phải huấn luyện. Nếu bạn có chưa tới vài trăm ví dụ chất lượng thấp, lỗi nằm ở dữ liệu chứ không phải ở phương pháp. Và nếu một prompt viết lại cẩn thận giải quyết 90 phần trăm vấn đề, hãy dừng ở đó, chi phí vận hành một model riêng không nhỏ.
Một cái bẫy phổ biến: dùng finetune để 'dạy' model sự kiện rồi ngạc nhiên khi nó vẫn bịa. Finetune có thể làm model tự tin hơn khi nói về lĩnh vực mà nó chưa thật sự nắm, nên đôi khi làm ảo giác trông thuyết phục hơn. Với thông tin phải đúng từng chữ, RAG kèm kiểm tra nguồn an toàn hơn.
Chi phí thật nằm ở đâu
Nhiều người nghĩ chi phí là tiền GPU. Thực tế GPU chỉ là một phần. Phần lớn công sức nằm ở việc chuẩn bị dữ liệu, viết hướng dẫn gán nhãn, kiểm tra chất lượng, dựng bộ đánh giá, và duy trì sau khi đưa vào dùng. Một bộ vài nghìn ví dụ sạch, được chuyên gia lĩnh vực xem lại, thường đáng giá hơn một bộ hàng trăm nghìn ví dụ lấy tự động. Chúng tôi mô tả quy trình chi tiết trong bài về quy trình finetune LLM tiếng Việt.
Về phần cứng, AIVISION huấn luyện trên cluster gồm 24 GPU NVIDIA H200 và 8 GPU NVIDIA B300. H200 có 141GB HBM3e, B300 khoảng 288GB, đủ chỗ để chạy các thử nghiệm finetune lặp nhanh thay vì chờ xếp hàng. Nhưng phần cứng chỉ rút ngắn thời gian chạy, nó không thay được việc phải hiểu bài toán.
Một cách ra quyết định ngắn gọn
Trước khi bắt đầu, hãy trả lời ba câu bằng ví dụ thật, không bằng cảm tưởng. Model có thiếu thông tin hay thiếu cách hành xử? Bạn có bộ đánh giá ít nhất vài chục câu đại diện chưa? Chi phí và độ trễ của giải pháp hiện tại có thật sự là vấn đề chưa? Nếu thiếu thông tin, đi hướng RAG. Nếu thiếu cách hành xử và bạn đã có thước đo, khi đó finetune là ứng viên nghiêm túc.
Với healthcare và dược, chúng tôi còn thêm một ràng buộc: model chỉ hỗ trợ thông tin và hành chính, như soạn nháp tóm tắt hay tra cứu tài liệu. Nó không chẩn đoán, không kê đơn, không khuyên liều dùng. Chuyên môn y khoa quyết định cuối cùng, và hệ thống nên được thiết kế để việc kiểm tra của con người dễ, không khó hơn.
AIVISION đã phát hành model LLM L1.0 cho tiếng Việt và làm finetune cho từng lĩnh vực cụ thể. Nếu bạn muốn xem cách chúng tôi nghĩ về AI Việt Nam nói chung, trang chủ AIVISION có phần giới thiệu.