Đánh giá LLM tiếng Việt đúng cách: vì sao điểm benchmark chưa đủ
01/10/2026

Hãy tưởng tượng bạn thuê một nhân viên vì họ đạt điểm cao trong kỳ thi tuyển, rồi ngày đầu đi làm họ không biết trả lời khách thế nào. Điểm thi không sai, nó chỉ đo một thứ khác với công việc. Điểm benchmark của LLM nhiều khi y như vậy. Với đánh giá LLM tiếng Việt, khoảng cách ấy còn rộng hơn, vì phần lớn bộ đo công khai được thiết kế cho tiếng Anh rồi dịch sang, hoặc dựa trên dạng bài thi trắc nghiệm vốn rất xa với cách người ta thực sự dùng model.
Benchmark đo được gì và không đo được gì
Benchmark công khai có giá trị: chúng cho một mặt bằng chung để so sánh, và giúp phát hiện sớm model có vấn đề nghiêm trọng về kiến thức hay suy luận cơ bản. Chúng tôi vẫn xem chúng. Nhưng có bốn giới hạn nên nhớ.
Thứ nhất về nội dung: câu hỏi trắc nghiệm kiến thức đo khả năng chọn đáp án, không đo khả năng viết một email trả lời khách hàng đúng giọng. Chúng không đo cách model xử lý tin nhắn không dấu, viết tắt, hay yêu cầu mơ hồ.
Về dịch thuật: bộ đo dịch từ tiếng Anh mang theo cách đặt câu và văn hoá của nguồn. Một câu hỏi về luật hay thủ tục của nước khác không cho biết gì về hiểu biết bối cảnh Việt Nam.
Về ô nhiễm dữ liệu: nếu câu hỏi benchmark đã lọt vào dữ liệu huấn luyện, điểm cao chỉ phản ánh trí nhớ. Với bộ đo công khai lâu năm, rủi ro này không nhỏ và gần như không thể kiểm chứng từ bên ngoài.
Về mục tiêu: khi một con số trở thành thứ mọi người chạy theo, người ta tối ưu cho con số đó. Hiện tượng quen thuộc, và model không ngoại lệ. Vì vậy chúng tôi không đưa điểm benchmark làm bằng chứng chính cho bất kỳ sản phẩm nào của AIVISION, và cũng thận trọng với những ai làm thế.
Bộ đánh giá riêng: nhỏ nhưng đúng việc
Cách hiệu quả nhất mà chúng tôi biết là xây một bộ đánh giá của chính bài toán. Không cần lớn. Vài trăm câu đại diện, lấy từ tình huống thực: câu hỏi khách thật hỏi (đã ẩn danh), tài liệu thật cần tóm tắt, các ca khó đã làm hệ thống cũ vấp. Mỗi câu kèm tiêu chí chấm rõ ràng: cần có thông tin nào, không được có thông tin nào, giọng điệu ra sao, khi nào phải từ chối.
Nên có những nhóm câu riêng cho các thách thức đặc thù tiếng Việt: không dấu, gõ Telex sai, viết tắt, trộn tiếng Anh, xưng hô theo vai vế, phương ngữ. Và các nhóm câu để thử giới hạn: câu ngoài phạm vi, câu cố ép model bịa, câu có tiền đề sai. Một model tốt không chỉ trả lời đúng khi biết, mà còn biết nói 'tôi không chắc' hoặc 'tài liệu không đề cập' khi không biết. Phần này liên quan trực tiếp tới việc giảm ảo giác, chủ đề chúng tôi viết riêng.
Ai chấm, và chấm thế nào
Có ba cách chấm, mỗi cách có chỗ mạnh yếu.
- Chấm tự động bằng quy tắc: nhanh, lặp lại được, phù hợp khi đáp án rõ như đúng định dạng JSON, đúng số liệu, có chứa mã nào đó. Không đủ cho chất lượng văn bản tự do.
- Chấm bằng người: tin cậy nhất cho sắc thái, độ tự nhiên, độ đúng chuyên môn, nhưng chậm, đắt và người chấm cũng bất đồng với nhau. Cần thang điểm rõ và đo mức đồng thuận giữa người chấm.
- Dùng model khác làm giám khảo: rẻ, nhanh, mở rộng được. Nhưng giám khảo model có thiên lệch riêng, thích câu trả lời dài, thích văn phong giống nó, và có thể chấm sai ở tiếng Việt chuyên ngành. Chỉ nên dùng khi đã đối chiếu với chấm tay trên một mẫu nhỏ để biết nó lệch bao nhiêu.
Cách kết hợp thực dụng: tự động cho phần kiểm được bằng máy, model giám khảo để sàng lọc lượng lớn, người chấm cho mẫu đại diện và mọi ca quan trọng. Với lĩnh vực như y tế hay dược, chuyên gia y khoa nên trực tiếp tham gia chấm, vì lỗi nhỏ về thuật ngữ có thể gây hậu quả lớn dù đoạn văn đọc rất trôi chảy.
Những lỗi đo lường hay gặp
So sánh không công bằng: model này dùng prompt đã được chỉnh kỹ, model kia dùng prompt mặc định. Kết quả phản ánh người viết prompt, không phải model.
Chạy một lần rồi tin. Đầu ra LLM có yếu tố ngẫu nhiên. Với bộ đánh giá nhỏ, chênh vài điểm có thể chỉ là nhiễu. Chạy lặp, xem độ dao động, và đừng ăn mừng một cải thiện nằm trong khoảng nhiễu.
Chỉ nhìn điểm trung bình. Một model có thể rất tốt ở 95 phần trăm câu và tệ nghiêm trọng ở 5 phần trăm còn lại. Nếu 5 phần trăm đó là câu về liều thuốc hay quy định pháp lý, điểm trung bình che mất điều quan trọng nhất. Hãy xem theo từng nhóm và đọc riêng các ca thất bại.
Quên đo những thứ ngoài chất lượng: độ trễ, chi phí mỗi lượt, độ ổn định khi ngữ cảnh dài, hành vi khi người dùng cố tình phá. Một model hơn vài điểm nhưng chậm gấp đôi có thể là lựa chọn tệ hơn.
Không đo sau khi triển khai. Người dùng thật hỏi khác tập đánh giá, và theo thời gian còn khác hơn. Nên lấy mẫu hội thoại thật định kỳ, chấm lại và bổ sung vào bộ đánh giá.
Cách AIVISION nhìn việc này
Chúng tôi huấn luyện LLM trên cluster 24 GPU NVIDIA H200 và 8 GPU NVIDIA B300, đã phát hành model LLM L1.0 cho tiếng Việt và speech-to-text E1.0. Chúng tôi không đưa ra con số xếp hạng hay phần trăm chính xác chung chung ở đây, bởi một con số rời khỏi bài toán cụ thể thì dễ gây hiểu lầm hơn là hữu ích. Điều đáng so sánh với bạn là kết quả trên bộ câu hỏi của chính bạn, với dữ liệu của chính bạn.
Nếu bạn đang chọn giữa các model hay cân nhắc finetune LLM, lời khuyên của tôi là dành tuần đầu tiên để dựng bộ đánh giá, không phải để huấn luyện. Nó làm mọi quyết định sau đó bớt cảm tính. Thông tin thêm về cách chúng tôi làm việc có tại AIVISION.