Chọn đơn vị finetune LLM: checklist trước khi ký hợp đồng
01/10/2026

Hợp đồng finetune LLM đầu tiên mà tôi được xem qua chỉ có hai trang. Trong đó không dòng nào nói model sẽ được đánh giá thế nào, ai giữ trọng số sau khi xong, hay dữ liệu của khách sẽ bị xử lý ra sao. Hai bên đều hào hứng, và sáu tháng sau cả hai đều bực. Bài này là danh sách những câu hỏi tôi muốn khách hàng đặt cho bất kỳ đơn vị nào làm finetune LLM, kể cả chúng tôi, trước khi ký.
Hỏi về bài toán trước khi hỏi về model
Một đơn vị đáng tin sẽ không vội báo giá. Họ hỏi lại bạn: người dùng là ai, tác vụ cụ thể là gì, hiện đang làm bằng cách nào, thế nào là thành công. Nếu cuộc trò chuyện đầu tiên chỉ xoay quanh tên model và số GPU, hãy thận trọng.
Nên hỏi thêm: finetune có thực sự cần thiết không? Đôi khi prompt tốt hoặc RAG đã đủ. Một đối tác sẵn lòng nói “bạn chưa cần finetune” là dấu hiệu tốt, vì họ đang không bán thứ bạn không cần.
Dữ liệu: nhiều rắc rối bắt đầu từ đây
- Họ cần loại dữ liệu nào, bao nhiêu, định dạng ra sao? Con số quá nhỏ hoặc quá lớn mà không giải thích đều đáng hỏi lại.
- Ai làm sạch và gán nhãn? Bạn hay họ? Chi phí này nằm trong báo giá hay tính riêng?
- Dữ liệu của bạn được lưu ở đâu, ai truy cập được, xóa khi nào sau dự án?
- Dữ liệu của bạn có được dùng để huấn luyện model cho khách khác không? Đòi câu trả lời bằng văn bản.
- Nếu dữ liệu có thông tin cá nhân hoặc y tế, quy trình ẩn danh hóa thế nào?
Tôi đã thấy dự án trễ ba tháng chỉ vì cả hai bên đều tưởng bên kia lo việc làm sạch dữ liệu. Hãy ghi rõ ra giấy.
Đánh giá: thứ phân biệt người làm thật và người nói hay
Hãy hỏi: chúng ta đo thành công bằng gì, trên bộ kiểm thử nào? Một đối tác nghiêm túc sẽ đề xuất dựng bộ kiểm thử cùng bạn, từ câu hỏi thật của người dùng, tách riêng khỏi dữ liệu huấn luyện. Nếu bộ kiểm thử bị lẫn vào dữ liệu huấn luyện, điểm số đẹp mà vô nghĩa.
Cần cảnh giác khi nghe những lời hứa kiểu “độ chính xác trên chín mươi phần trăm” mà không nói đo trên cái gì. Con số đó chỉ có nghĩa khi đi kèm bộ dữ liệu, cách chấm và tác vụ. Câu hỏi tiếp theo: so với model gốc chưa finetune thì cải thiện bao nhiêu? Nếu họ không có điểm gốc để so, bạn không biết mình mua gì.
Hãy hỏi cả về lỗi. Họ có báo cáo những trường hợp model vẫn làm sai không? Ai thành thật nói về giới hạn thường đáng tin hơn ai chỉ trình bày điểm mạnh.
Quyền sở hữu và khả năng thoát ra
- Sau khi xong, trọng số model (hoặc adapter) thuộc về ai? Bạn có được nhận về và tự chạy không?
- Nếu model chạy trên hạ tầng của đối tác, bạn có thể chuyển sang nơi khác sau này không?
- Mã nguồn, script huấn luyện, cấu hình có được bàn giao không?
- Model gốc dùng giấy phép nào, và giấy phép đó có cho phép dùng thương mại không?
Câu thứ tư hay bị quên. Một số model mở có điều khoản hạn chế dùng thương mại hoặc đòi ghi nguồn. Chọn nhầm thì cả dự án có thể vướng về pháp lý. Nhờ pháp chế đọc giấy phép của model nền, đừng chỉ nhìn bảng điểm.
Hạ tầng và bảo mật
Huấn luyện tốn GPU, và đơn vị làm cho bạn phải có đủ năng lực tính toán hoặc thuê ở đâu đó. Hãy hỏi thẳng: huấn luyện chạy ở đâu? Nếu dữ liệu nhạy cảm, bạn có thể yêu cầu huấn luyện và triển khai trong môi trường của mình, hay ít nhất trong vùng cô lập? Tôi từng thấy dự án dừng lại vì dữ liệu bệnh án không được phép rời khỏi bệnh viện, mà đối tác chỉ có phương án cloud. Chuyện này nên được phát hiện ngay buổi đầu. Bạn có thể đọc thêm về lựa chọn này trong các bài của AIVISION.
Hỏi thêm về kiểm soát truy cập, nhật ký, quy trình khi có sự cố, và ai chịu trách nhiệm nếu dữ liệu bị lộ. Nếu hợp đồng không nhắc gì đến những điều này, đó là khoảng trống bạn nên bịt trước khi ký.
Chuyên môn lĩnh vực và ngôn ngữ
Finetune cho tiếng Việt khác finetune cho tiếng Anh. Hãy hỏi đối tác đã làm gì với tiếng Việt: xử lý dấu, từ địa phương, viết không dấu, thuật ngữ chuyên ngành. Không cần họ kể tên khách hàng cũ, nhưng nên nghe họ mô tả được loại vấn đề đã gặp và cách xử lý. Với lĩnh vực như y tế hay dược, hỏi xem có chuyên gia lĩnh vực tham gia kiểm tra kết quả không, hay toàn kỹ sư nhìn đầu ra rồi tự thấy “nghe hợp lý”.
AIVISION là đơn vị AI tại Việt Nam, huấn luyện LLM trên cụm 24x NVIDIA H200 và 8x NVIDIA B300, đã phát hành model LLM L1.0 và speech-to-text E1.0 cho tiếng Việt, và làm finetune cho các lĩnh vực như healthcare và dược. Chúng tôi viết điều này không phải để bạn mặc định chọn chúng tôi, mà để bạn biết các câu hỏi trong bài này cũng áp dụng cho chính chúng tôi.
Tiến độ, bàn giao và bảo trì
- Dự án chia thành những mốc nào, mỗi mốc có sản phẩm kiểm tra được gì?
- Nếu kết quả đầu tiên không đạt, quy trình lặp lại là gì và ai chịu chi phí?
- Sau bàn giao, ai theo dõi chất lượng khi dữ liệu và cách dùng thay đổi?
- Có tài liệu để đội của bạn tự vận hành không?
- Khi có model nền mới tốt hơn, nâng cấp được không và tính phí thế nào?
Model không đứng yên. Dữ liệu người dùng trôi dần, tài liệu cập nhật, và chất lượng sẽ giảm nếu không ai để mắt tới. Một hợp đồng chỉ nói về lần giao đầu tiên là hợp đồng chưa nghĩ đến phần khó nhất.
Những dấu hiệu nên chậm lại
- Hứa kết quả cụ thể trước khi nhìn dữ liệu của bạn.
- Không chịu nói rõ phương pháp, nói chung chung là “công nghệ độc quyền”.
- Từ chối cho chạy thử trên một phần nhỏ dữ liệu trước khi cam kết toàn bộ.
- Hợp đồng không nêu rõ quyền sở hữu sản phẩm.
- Bất kỳ ai chê mọi đối thủ và nói mình luôn tốt nhất.
Cách giảm rủi ro mà tôi khuyên nhiều nhất là làm một dự án thử nhỏ, vài tuần, một tác vụ hẹp, có tiêu chí đánh giá viết sẵn. Bạn sẽ biết rất nhiều về cách làm việc của đối tác chỉ sau vài tuần đó, rẻ hơn nhiều so với biết điều này sau khi đã ký hợp đồng lớn.