AI on-premise: Khi nào nên hay không nên tự thu thập dữ liệu?
24/09/2026

Một bài học từ nhà máy ở Long An
Tôi vẫn nhớ rõ buổi chiều cuối năm ngoái, khi ngồi trong phòng điều hành của một nhà máy chế biến thực phẩm ở Long An. Giám đốc sản xuất chỉ vào màn hình lớn, nơi dòng trạng thái "Model Confidence: 12%" nhấp nháy liên tục. Anh ấy thở dài, giọng đầy ẩn ức: "Mình đã mua phần mềm AI on-premise đắt tiền, đã đưa toàn bộ camera và dữ liệu sản xuất vào hệ thống, vậy mà nó vẫn đoán sai hơn cả con người". Đó là một tình huống điển hình mà chúng ta hay gặp khi doanh nghiệp Việt Nam bắt đầu triển khai AI nội bộ. Họ muốn giữ dữ liệu ngay trong tường nhà máy, điều hoàn toàn hợp lý về mặt an ninh. Nhưng họ quên mất rằng, dữ liệu thô không tự động biến thành tri thức. Nó cần được "nấu" đúng cách. Nếu nguyên liệu đầu vào bị lỗi, món ăn đầu ra sẽ chỉ là rác. Bài viết này không phải là bảng checklist khô khan. Nó là những câu chuyện thực tế về những ngã rẽ mà bạn sẽ phải chọn khi quyết định tự mình làm chủ dữ liệu huấn luyện.

Ngã rẽ về quy mô: Khi nào thì đủ và khi nào thì thừa
Rất nhiều sếp kỹ thuật có cùng một suy nghĩ: "Dữ liệu càng nhiều càng tốt". Đây là cái bẫy phổ biến nhất. Tôi từng thấy một khách hàng ngành dầu nhớt thu thập tới 50.000 hình ảnh mỗi ngày từ dây chuyền đóng chai. Con số nghe có vẻ ấn tượng. Nhưng thực tế, 90% trong số đó là các khung hình trùng lặp hoặc chất lượng ánh sáng quá kém. Hệ quả? Mô hình bị quá khớp (overfitting) với những điều kiện ánh sáng cụ thể của ca làm việc lúc 2 giờ sáng, và hoàn toàn mù quáng khi bước sang ca ngày. Việc thu thập dữ liệu huấn luyện không phải là cuộc đua marathon, mà là một bài tập chọn lọc. Bạn cần đủ đa dạng để mô hình hiểu bản chất vấn đề, nhưng không đến mức chôn vùi nó trong nhiễu. Một quy tắc thực tế mà chúng tôi hay áp dụng tại AIVISION, khi đồng hành cùng các dự án tại Masan hay Meat Deli, là tập trung vào chất lượng chú thích (annotation) hơn là số lượng tuyệt đối. Khoảng 3.000-5.000 mẫu được đánh dấu chính xác và đa dạng thường hiệu quả hơn 50.000 mẫu hỗn độn. Hãy tự hỏi: Liệu dữ liệu mình có đang phản ánh đúng sự thật của dây chuyền sản xuất hay chỉ là những khoảnh khắc ngẫu nhiên?
Cái bẫy của dữ liệu cân bằng
Hãy tưởng tượng bạn là một nhân viên bảo vệ nhà máy. Trong 100 ngày, không có trộm nào xuất hiện. Bạn chỉ thấy 99 ngày yên bình và 1 ngày có sự cố. Nếu bạn huấn luyện một AI để nhận diện trộm chỉ dựa vào dữ liệu đó, nó sẽ cho rằng "không có trộm" là trạng thái bình thường và bỏ qua mọi dấu hiệu bất thường. Đây là vấn đề dữ liệu mất cân bằng (imbalance). Trong sản xuất, lỗi hỏng hóc hoặc sản phẩm lỗi thường chỉ chiếm khoảng 1-2% tổng số lượng. Nếu bạn thu thập dữ liệu huấn luyện một cách thụ động, hệ thống sẽ bị "mù" trước chính những thứ cần được phát hiện. Giải pháp không nằm ở việc chờ đợi. Bạn phải chủ động tạo ra dữ liệu hoặc sử dụng kỹ thuật tổng hợp (synthetic data) để tăng cường các trường hợp hiếm gặp. Tôi từng làm việc với một công ty sản xuất mì ăn liền, nơi lỗi bao bì chỉ xảy ra vài lần một tuần. Chúng tôi không thể chờ đủ dữ liệu. Thay vào đó, chúng tôi sử dụng kỹ thuật tăng cường dữ liệu và mô phỏng các dạng lỗi khác nhau. Kết quả là mô hình bắt đầu "nhìn thấy" những chi tiết nhỏ mà con mắt người dễ bỏ qua. Điều kiện để điều này hoạt động? Bạn cần đội ngũ kỹ thuật đủ khả năng đánh giá xem dữ liệu tổng hợp có thực sự giống với dữ liệu thật hay không. Nếu không, bạn đang huấn luyện AI dựa trên ảo ảnh.
Giữ dữ liệu ở đâu: Sự đánh đổi giữa tốc độ và an toàn
Thuật ngữ "AI on-premise" nghe có vẻ đơn giản: đặt máy chủ trong nhà máy. Nhưng thực tế phức tạp hơn nhiều. Bạn có muốn dữ liệu huấn luyện nằm nguyên trên các camera rìa (edge devices) để xử lý nhanh, hay đẩy tất cả về trung tâm dữ liệu để huấn luyện mô hình lớn? Mỗi lựa chọn đều có cái giá của nó. Nếu bạn để dữ liệu ở rìa, tốc độ phản hồi rất nhanh, nhưng việc cập nhật mô hình trở thành một cơn ác mộng logistis. Bạn phải di chuyển vật lý các thiết bị hoặc dùng băng tải để cập nhật thuật toán. Ngược lại, nếu đẩy hết về trung tâm, bạn có sức mạnh tính toán khổng lồ, nhưng độ trễ (latency) có thể tăng lên, ảnh hưởng đến các quy trình kiểm tra chất lượng thời gian thực. Với các dây chuyền đóng gói tốc độ cao, độ trễ 200ms cũng có thể dẫn đến hàng nghìn sản phẩm lỗi trôi qua. Tôi khuyên bạn nên xem xét kiến trúc lai (hybrid). Dữ liệu thô ở rìa, nhưng các mẫu điển hình và dữ liệu lỗi được gửi về trung tâm để huấn luyện lại định kỳ. Đây là cách chúng tôi triển khai cho một đối tác trong ngành bia tại Thái Lan. Họ cần tốc độ cao, nhưng cũng cần mô hình tự thích ứng với sự thay đổi của nhãn hàng theo mùa. Việc cân bằng này đòi hỏi sự liên tục trong vận hành, không phải một lần là xong.
Khi nào thì KHÔNG nên tự làm
Đây là phần quan trọng nhất. Có những lúc, bạn nên dừng lại và nhận ra rằng việc tự thu thập và xử lý dữ liệu là một hố đen vô đáy. Hãy xem xét các dấu hiệu sau. Một là, dây chuyền sản xuất của bạn thay đổi liên tục. Nếu bạn đổi bao bì mỗi quý, đổi máy móc mỗi năm, dữ liệu cũ sẽ nhanh chóng mất giá trị. Chi phí bảo trì dữ liệu sẽ ăn mòn lợi nhuận từ việc tiết kiệm chi phí phần mềm. Hai là, bạn không có đội ngũ chuyên gia về thị giác máy tính (computer vision). Việc đánh dấu dữ liệu (labeling) không chỉ là vẽ hình chữ nhật. Nó là hiểu ngữ cảnh sản xuất. Nếu người đánh dấu không hiểu tại sao một vết xước lại là lỗi, họ sẽ đánh dấu sai, và mô hình sẽ học sai. Ba là, quy trình sản xuất của bạn quá phức tạp và không ổn định. Nếu mỗi lô hàng có một đặc tính riêng, việc chuẩn hóa dữ liệu sẽ mất nhiều thời gian hơn là lợi ích nó mang lại. Trong những trường hợp này, giải pháp hiệu quả nhất là sử dụng các mô hình tiên nghiệm (foundation models) đã được huấn luyện trước trên dữ liệu tổng quát, và chỉ tinh chỉnh (fine-tune) với một lượng nhỏ dữ liệu đặc thù. Đừng cố bắt cá bằng tay nếu bạn có thể dùng lưới. Đôi khi, sự khiêm tốn trong việc thừa nhận giới hạn kỹ thuật lại mang lại kết quả tốt hơn cho doanh nghiệp.
Sự ổn định là một quá trình, không phải một đích đến
Triển khai AI nội bộ không kết thúc khi bạn bấm nút "Train" thành công lần đầu. Nó mới chỉ bắt đầu. Mô hình sẽ suy giảm (drift) khi môi trường thay đổi: ánh sáng đổi theo mùa, máy móc xuống cấp, công nhân thay đổi. Nếu bạn không có một quy trình liên tục để thu thập, đánh giá và cập nhật dữ liệu huấn luyện, mô hình của bạn sẽ chỉ ổn định trong vài tuần đầu tiên, sau đó dần trở nên vô dụng. Tôi hay ví von: Dữ liệu AI giống như thực phẩm tươi. Nó có hạn sử dụng. Bạn cần một hệ thống logistics dữ liệu (data pipeline) hoạt động trơn tru, nơi dữ liệu mới được tự động phát hiện, đánh giá chất lượng và đưa vào quy trình huấn luyện lại. Tại AIVISION, khi làm việc với các tập đoàn đa quốc gia như TTN hay các đối tác tại Mexico và Philippines, chúng tôi nhấn mạnh vào khía cạnh này. Chúng tôi xây dựng các hệ thống giám sát hiệu suất mô hình, cảnh báo ngay khi độ chính xác giảm xuống dưới ngưỡng cho phép. Bạn không cần phải tự xây dựng tất cả từ đầu. Nhưng bạn cần hiểu rằng, việc duy trì sự ổn định của mô hình đòi hỏi một kỷ luật vận hành không kém phần quan trọng so với việc phát triển ban đầu. Hãy tự hỏi tổ chức của mình: Chúng ta đã sẵn sàng cho công việc "vô hình" nhưng tốn kém này, hay chúng ta đang chỉ xem AI như một phần mềm một lần mua, một lần dùng?
Còn nhiều thứ không gói được trong một bài viết. Bạn có thể đọc tiếp các bài khác của AIVISION, xem giải pháp chấm điểm trưng bày hoặc nói chuyện trực tiếp với chúng tôi.