Làm sạch dữ liệu AI: Giảm 50% thời gian với data pipeline thực chiến
08/09/2026

Muốn giảm 50% thời gian preprocessing, phải bỏ thói quen 'dọn' dữ liệu bằng tay
Hồi trước, mỗi khi khách hàng muốn triển khai mô hình dự báo doanh số, đội kỹ thuật thường mất khoảng 40-50% tổng thời gian chỉ để làm sạch dữ liệu AI. Nghe có vẻ ít, nhưng với một dự án kéo dài 3 tháng, con số đó tương đương cả tuần lễ ngồi đối mặt với các file Excel lộn xộn, thiếu sót và mâu thuẫn nhau.
Cách làm cũ thường là thế này: Tải dữ liệu từ POS, CRM và kho hàng ra. Mở Excel. Dò tìm các dòng trùng lặp. Sửa tên đơn vị hành chính cho đồng nhất. Xóa các giá trị ngoại lai (outlier) bằng mắt thường. Nghe thì đơn giản, nhưng thực tế, dữ liệu từ các nguồn rời rạc như POS và CRM không bao giờ 'sạch' theo cùng một chuẩn.
Chi phí ẩn của cách làm này không chỉ là thời gian. Nó là sự thiếu nhất quán. Người A làm sạch theo cách này, người B làm theo cách khác. Khi mô hình dự báo cho kết quả sai, chúng tôi không biết lỗi nằm ở thuật toán hay ở khâu chuẩn bị dữ liệu. Đây là cái bẫy lớn nhất khiến các dự án AI trong doanh nghiệp Việt Nam hay 'chết yểu' trước khi kịp đi vào vận hành.
Bây giờ, cách chúng tôi tiếp cận đã khác hẳn. Chúng tôi xây dựng một data pipeline doanh nghiệp tự động hóa, nơi quy tắc làm sạch được mã hóa thành code, không phải là các thao tác thủ công trong bảng tính. Kết quả là thời gian preprocessing giảm đi một nửa, và quan trọng hơn, quy trình đó có thể tái sử dụng cho các dự án tiếp theo mà không cần bắt đầu từ số không.
Giai đoạn 1: Đối mặt với mớ bòng bong từ POS và CRM
Trước khi nói về code hay công cụ, chúng tôi luôn bắt đầu bằng việc ngồi xuống với người phụ trách dữ liệu tại hiện trường. Câu hỏi đầu tiên không phải là 'anh/chị có bao nhiêu dữ liệu', mà là 'dữ liệu này được sinh ra như thế nào?'.
Thực tế ở các chuỗi bán lẻ tại Việt Nam, và thậm chí cả tại Mexico hay Philippines mà chúng tôi từng hỗ trợ, dữ liệu POS thường rất nhiễu. Một sản phẩm có thể có ba mã khác nhau tại ba khu vực khác nhau do lỗi nhập liệu từ các chi nhánh cũ. Trong khi đó, CRM lại lưu trữ thông tin khách hàng theo một cấu trúc hoàn toàn khác, với các trường ngày tháng tháng năm bị trộn lẫn giữa định dạng DD/MM/YYYY và MM/DD/YYYY.
Khó khăn lớn nhất không phải là công nghệ, mà là sự thiếu chuẩn hóa ngay từ khâu thu thập. Dữ liệu rời rạc này giống như những mảnh ghép của một bức tranh bị xé vụn, mỗi mảnh có một kiểu cắt riêng. Việc gán nhãn cho các lỗi này (lỗi thiếu, lỗi trùng, lỗi sai định dạng) là bước quan trọng nhất. Nếu không xác định rõ 'cái gì là lỗi', bạn không thể viết quy tắc để sửa nó.
Giai đoạn 2: Xây dựng quy tắc làm sạch dữ liệu AI bền vững
Sau khi đã liệt kê được các loại lỗi thường gặp, chúng tôi chuyển sang xây dựng bộ quy tắc chuẩn hóa. Đây là lúc từ khóa 'chuẩn bị dữ liệu' thực sự phát huy tác dụng. Thay vì sửa từng lỗi, chúng tôi thiết kế các hàm xử lý chung cho toàn bộ pipeline.
Ví dụ, với vấn đề ngày tháng, chúng tôi không sửa từng giá trị một. Chúng tôi viết một hàm kiểm tra: nếu giá trị nhỏ hơn 13 và nằm ở vị trí đầu tiên, xác suất cao nó là ngày, không phải tháng. Hàm này sẽ tự động áp dụng cho hàng triệu dòng dữ liệu trong vài phút. So với việc làm tay, tốc độ xử lý nhanh gấp đôi, thậm chí gấp mười tùy vào quy mô dữ liệu.
Điểm mấu chốt ở đây là tính minh bạch. Mỗi khi một quy tắc được áp dụng, hệ thống sẽ log lại (ghi log) xem bao nhiêu dòng bị thay đổi, bao nhiêu dòng bị loại bỏ. Điều này giúp chúng tôi dễ dàng kiểm tra chéo. Nếu một quy tắc xóa đi hơn 10% dữ liệu hợp lệ, đó là dấu hiệu cảnh báo rằng quy tắc đó đang quá 'nóng' và cần được điều chỉnh lại. Việc này đòi hỏi sự cẩn trọng cao, vì trong dự báo doanh số, một lỗi nhỏ trong dữ liệu đầu vào có thể khuếch đại thành sai lệch lớn trong dự báo đầu ra.
Giai đoạn 3: Kết nối pipeline và đo lường hiệu quả thực tế
Khi các quy tắc làm sạch đã ổn định, bước tiếp theo là kết nối chúng lại thành một data pipeline doanh nghiệp liên tục. Chúng tôi sử dụng các công cụ orchestrator để tự động hóa luồng chạy: tải dữ liệu thô -> áp dụng quy tắc làm sạch -> kiểm tra chất lượng -> xuất dữ liệu sạch.
Để đo lường hiệu quả, chúng tôi không chỉ nhìn vào thời gian chạy. Chúng tôi tập trung vào hai chỉ số chính: tỷ lệ dữ liệu hợp lệ (valid data ratio) và thời gian trung bình để phát hiện lỗi (mean time to detect). Trước khi có pipeline, việc phát hiện một lỗi định dạng có thể mất vài ngày. Sau khi triển khai, hệ thống cảnh báo ngay trong vòng vài giờ sau khi dữ liệu mới được đẩy lên.
Trong một dự án gần đây tại một tập đoàn F&B lớn, việc áp dụng pipeline này đã giúp đội data scientist giảm thời gian chuẩn bị dữ liệu từ 2 tuần xuống còn 3 ngày. Không chỉ vậy, chất lượng dữ liệu đầu vào cho mô hình dự báo cũng đồng đều hơn, giúp độ chính xác của mô hình cải thiện đáng kể mà không cần phải tinh chỉnh thuật toán quá nhiều. Đây là minh chứng rõ ràng rằng việc đầu tư vào hạ tầng dữ liệu hiệu quả hơn là cố gắng 'câu' thuật toán phức tạp trên dữ liệu bẩn.
Còn những gì chưa giải quyết được và hướng đi tiếp theo
Chúng tôi phải thừa nhận rằng, không có data pipeline nào là hoàn hảo ngay từ đầu. Hiện tại, cái khó nhất vẫn nằm ở khâu xử lý dữ liệu phi cấu trúc, như các ghi chú tự do trong CRM hoặc hình ảnh hóa đơn. Các công cụ text analysis và computer vision đã giúp đỡ phần nào, nhưng độ chính xác vẫn chưa đủ để thay thế hoàn toàn con người trong các trường hợp đặc biệt.
Hơn nữa, việc duy trì pipeline khi doanh nghiệp thay đổi hệ thống POS hoặc CRM là một thách thức lớn. Mỗi lần thay đổi hệ thống, chúng tôi lại phải rà soát và cập nhật các quy tắc làm sạch. Điều này đòi hỏi sự cam kết dài hạn, không phải là một dự án làm xong rồi bỏ.
Để tiến xa hơn, chúng tôi cần các chuẩn dữ liệu ngành rõ ràng hơn. Hiện tại, mỗi doanh nghiệp tự 'phát minh' ra các định dạng riêng, gây khó khăn cho việc trao đổi dữ liệu giữa các hệ thống. Nếu có một chuẩn chung, công đoạn chuẩn hóa sẽ nhẹ nhàng hơn rất nhiều. Chúng tôi vẫn đang tiếp tục thử nghiệm với các mô hình Agentic AI, nơi AI có thể tự động đề xuất các quy tắc làm sạch mới dựa trên sự thay đổi của dữ liệu. Đây là hướng đi hứa hẹn, nhưng vẫn cần thêm thời gian để đánh giá độ tin cậy trong môi trường sản xuất thực tế. Con đường làm sạch dữ liệu AI không có điểm dừng, nhưng mỗi bước tiến đều giúp doanh nghiệp tiết kiệm được những giờ làm việc vô bổ và tập trung hơn vào giá trị cốt lõi của dữ liệu.
Còn nhiều thứ không gói được trong một bài viết. Bạn có thể đọc tiếp các bài khác của AIVISION, xem giải pháp chấm điểm trưng bày hoặc nói chuyện trực tiếp với chúng tôi.