Hợp nhất dữ liệu CRM
Khách hàng xuất hiện nhiều lần với cách viết tên, số điện thoại hoặc email khác nhau.
Tiền xử lý dữ liệu (Data Preprocessing) là quá trình chuẩn bị dữ liệu thô trước khi đưa vào phân tích, báo cáo, học máy hoặc hệ thống tự động. Công việc có thể gồm làm sạch dữ liệu, xử lý giá trị thiếu, loại bản ghi trùng, chuẩn hóa định dạng, mã hóa biến, tích hợp dữ liệu và kiểm tra đầu ra. Nếu tập dữ liệu chứa dữ liệu cá nhân, các thao tác này không chỉ là vấn đề kỹ thuật mà còn cần được đặt trong quy trình tuân thủ pháp luật về bảo vệ dữ liệu cá nhân.
Đầu vào: dữ liệu thô, có thể thiếu, sai định dạng, trùng lặp hoặc chưa phù hợp cho mục tiêu phân tích.
Quá trình: kiểm tra → làm sạch → chuẩn hóa/mã hóa → tích hợp/biến đổi → kiểm tra chất lượng.
Đầu ra: tập dữ liệu nhất quán và phù hợp hơn cho phân tích, báo cáo, AI hoặc mục đích vận hành.
Không phải: cứ xóa dữ liệu càng nhiều thì dữ liệu càng “sạch”; preprocessing phải bám mục tiêu sử dụng và giữ lại thông tin có giá trị.
Nếu có dữ liệu cá nhân: làm sạch, kết hợp, mã hóa, phân tích hoặc chuyển đổi vẫn có thể nằm trong hoạt động xử lý dữ liệu cá nhân và cần được quản trị theo Luật Bảo vệ dữ liệu cá nhân.
Data Preprocessing là giai đoạn biến dữ liệu thô thành dữ liệu có cấu trúc và chất lượng phù hợp hơn với mục tiêu sử dụng. “Phù hợp” quan trọng hơn “sạch tuyệt đối”: một tập dữ liệu phục vụ báo cáo tài chính có yêu cầu khác với dữ liệu huấn luyện mô hình dự báo hoặc dữ liệu dùng cho CRM.
Các vấn đề phổ biến của dữ liệu thô gồm:

| Tiêu chí | Data Cleaning | Data Preprocessing |
|---|---|---|
| Mục tiêu | Sửa hoặc loại các vấn đề về chất lượng dữ liệu. | Chuẩn bị toàn bộ dữ liệu cho mục tiêu phân tích/mô hình/hệ thống. |
| Công việc điển hình | Missing values, duplicate, lỗi chính tả, sai định dạng, outlier theo trường hợp. | Cleaning + encoding + scaling + transformation + integration + feature selection/reduction + validation. |
| Phạm vi | Hẹp hơn. | Rộng hơn. |
| Kết quả | Dữ liệu sạch hơn. | Dữ liệu sẵn sàng hơn cho mục đích sử dụng cụ thể. |
Khách hàng xuất hiện nhiều lần với cách viết tên, số điện thoại hoặc email khác nhau.
Dữ liệu từ nhiều phòng ban dùng định dạng, mã sản phẩm hoặc đơn vị đo khác nhau.
Mô hình cần dữ liệu có cấu trúc, biến đầu vào phù hợp và hạn chế nhiễu có thể làm sai kết quả.
Dữ liệu từ phần mềm cũ cần được làm sạch và ánh xạ trước khi đưa sang ERP, CRM hoặc cloud mới.
Không có một pipeline duy nhất áp dụng cho mọi dự án. Một quy trình thường có thể được tổ chức theo các bước sau:
Kiểm tra cấu trúc, kiểu dữ liệu, số lượng bản ghi, tỷ lệ thiếu, duplicate, phân bố và các dấu hiệu bất thường trước khi sửa dữ liệu.
Sửa lỗi nhập liệu, loại hoặc gộp bản ghi trùng theo quy tắc và xử lý dữ liệu không hợp lệ.
Quyết định giữ, loại, thay thế hoặc suy diễn giá trị dựa trên ý nghĩa nghiệp vụ; không mặc định dùng một công thức cho mọi cột dữ liệu.
Đồng nhất định dạng, đơn vị, kiểu dữ liệu; mã hóa biến phân loại hoặc chuẩn hóa thang đo khi mục tiêu phân tích yêu cầu.
Kết hợp dữ liệu từ nhiều nguồn dựa trên khóa và quy tắc rõ ràng, tránh ghép sai người, sai khách hàng hoặc sai giao dịch.
Chỉ thực hiện nếu có mục tiêu giảm độ phức tạp, tối ưu hiệu suất hoặc loại biến không có giá trị với mô hình.
Đối chiếu thống kê, lấy mẫu kiểm tra và lưu quy tắc biến đổi để bảo đảm tập dữ liệu có thể truy vết và sử dụng đúng mục đích.

Giả sử doanh nghiệp có 10.000 bản ghi khách hàng từ website, cửa hàng và đội sales:
Pipeline có thể chuẩn hóa tên và số điện thoại, kiểm tra email, xác định quy tắc duplicate rồi liên kết lịch sử mua hàng theo mã phù hợp.
Điểm quan trọng: dữ liệu “sạch hơn” vẫn có thể là dữ liệu cá nhân. Việc thay tên hiển thị, chuẩn hóa số điện thoại hoặc gắn mã khách hàng không tự động làm mất tính chất dữ liệu cá nhân nếu dữ liệu vẫn xác định hoặc giúp xác định một người cụ thể.
Hai người cùng tên bị gộp thành một khách hàng hoặc hai giao dịch hợp lệ bị xóa.
Thay tất cả giá trị thiếu bằng trung bình dù biến dữ liệu không phù hợp với cách suy diễn đó.
Dữ liệu bất thường đôi khi lại là tín hiệu gian lận, lỗi vận hành hoặc một nhóm khách hàng quan trọng.
Không thể giải thích dữ liệu đầu ra được tạo từ dữ liệu gốc bằng quy tắc nào.
Có thể có. “Tiền xử lý dữ liệu” là thuật ngữ kỹ thuật, không phải tên một thủ tục pháp lý riêng. Nhưng nếu dữ liệu đầu vào là dữ liệu cá nhân thì các thao tác như làm sạch, sửa đổi, kết hợp, truy xuất, mã hóa, phân tích hoặc chuyển đổi đều cần được xem trong tổng thể hoạt động xử lý dữ liệu cá nhân.
Từ ngày 01/01/2026, khung pháp lý trọng tâm là Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 và Nghị định 356/2025/NĐ-CP. Nghị định 13/2023/NĐ-CP đã hết hiệu lực kể từ ngày Nghị định 356 có hiệu lực.
Do đó, câu hỏi đúng không phải là “preprocessing có cần xin phép không?” mà là: tập dữ liệu có dữ liệu cá nhân không, doanh nghiệp đang đóng vai trò gì, mục đích xử lý là gì, dữ liệu đi qua những hệ thống/bên thứ ba nào và nghĩa vụ hồ sơ nào phát sinh.
| Checkpoint | Câu hỏi cần trả lời | Ví dụ |
|---|---|---|
| 1. Phân loại dữ liệu | Tập dữ liệu có dữ liệu cá nhân cơ bản/nhạy cảm không? | CRM có số điện thoại, lịch sử mua hàng, vị trí. |
| 2. Mục đích xử lý | Việc làm sạch/ghép dữ liệu phục vụ mục đích nào? Có mở rộng mục đích so với khi thu thập không? | Dữ liệu chăm sóc khách hàng được dùng thêm để train mô hình chấm điểm. |
| 3. Vai trò các bên | Ai là bên kiểm soát, bên xử lý, vendor hay bên thứ ba? | Doanh nghiệp thuê cloud/vendor xử lý CRM. |
| 4. Quyền truy cập và bảo mật | Ai được truy cập dữ liệu thô và dữ liệu đã biến đổi? | Data team chỉ cần một phần trường dữ liệu nhưng đang được cấp toàn bộ hồ sơ khách hàng. |
| 5. Hồ sơ và luồng dữ liệu | Pipeline đã được phản ánh trong chính sách, hợp đồng, DPIA và luồng chuyển dữ liệu theo trường hợp chưa? | Vendor mới, cloud ở nước ngoài hoặc mục đích AI mới. |
Nghị định 356/2025/NĐ-CP yêu cầu các bên có trách nhiệm lập và lưu hồ sơ đánh giá tác động xử lý dữ liệu cá nhân theo trường hợp. Vì vậy khi pipeline thay đổi đáng kể, doanh nghiệp nên rà soát xem hồ sơ hiện có còn phản ánh đúng hệ thống và hoạt động xử lý thực tế hay không.
Nếu cần rà soát nghĩa vụ này, xem dịch vụ lập hồ sơ đánh giá tác động xử lý dữ liệu cá nhân năm 2026.
Preprocessing là bước thường xuyên trước khi dữ liệu được đưa vào hệ thống AI hoặc mô hình phân tích lớn. Khi training data chứa dữ liệu cá nhân, doanh nghiệp cần kiểm tra không chỉ dataset cuối cùng mà cả:
Nghị định 356/2025 có quy định riêng về xử lý dữ liệu lớn có chứa dữ liệu cá nhân, yêu cầu giới hạn thu thập/xử lý/lưu trữ theo mục đích và duy trì các biện pháp bảo vệ phù hợp.
Trong thực tế, doanh nghiệp có thể gửi dữ liệu cho đơn vị cung cấp cloud, AI, data analytics hoặc outsourcing để thực hiện preprocessing.
Trước khi chuyển dữ liệu, nên rà soát:
Không thể kết luận chỉ dựa trên tên dịch vụ “Data Preprocessing”.
Nếu doanh nghiệp chỉ xử lý dữ liệu nội bộ của chính mình, bài toán pháp lý khác với trường hợp nhận dữ liệu cá nhân của khách hàng để phân tích, làm sạch, mã hóa, khai thác hoặc xử lý thay cho khách hàng.
Nghị định 356/2025/NĐ-CP đã quy định nhóm dịch vụ xử lý dữ liệu cá nhân và điều kiện kinh doanh tương ứng. Vì vậy, nếu mô hình dịch vụ thực tế liên quan đến xử lý dữ liệu cá nhân cho bên khác, cần phân loại hoạt động trước khi quảng bá hoặc ký hợp đồng.
Không phải mọi công ty làm Data Cleaning đều tự động cần cùng một giấy phép. Cần xem loại dữ liệu, vai trò trong chuỗi xử lý, phạm vi dịch vụ và cách doanh nghiệp vận hành thực tế.

Luật Dương Trí tập trung vào phần pháp lý và quản trị tuân thủ của data flow, không thay thế đội kỹ thuật thực hiện Data Cleaning hoặc xây dựng mô hình Machine Learning.
Xác định loại dữ liệu, nguồn thu thập, mục đích, hệ thống, vendor và luồng chuyển dữ liệu.
Phân tích bên kiểm soát, bên xử lý, bên kiểm soát và xử lý hoặc các bên thứ ba theo mô hình thực tế.
Rà soát nghĩa vụ DPIA, hồ sơ xuyên biên giới và cập nhật khi hệ thống hoặc mục đích xử lý thay đổi.
Đối chiếu điều khoản với vendor, retention, quyền truy cập, xóa dữ liệu, xử lý sự cố và quyền của chủ thể dữ liệu.
Là quá trình chuẩn bị dữ liệu thô để dữ liệu có chất lượng, cấu trúc và định dạng phù hợp hơn với mục tiêu phân tích, báo cáo, AI hoặc vận hành.
Data Cleaning là một phần của Data Preprocessing. Preprocessing còn có thể gồm mã hóa, chuẩn hóa thang đo, tích hợp, biến đổi và lựa chọn đặc trưng.
Không nhất thiết. Thu thập thường xảy ra trước preprocessing. Quy trình preprocessing thường bắt đầu từ việc profiling dữ liệu đã có.
Không. Giảm chiều/chọn đặc trưng chỉ cần khi phù hợp mục tiêu, cấu trúc và quy mô của bộ dữ liệu.
Nếu các thao tác tác động đến dữ liệu có thể xác định hoặc giúp xác định cá nhân thì cần được xem trong phạm vi hoạt động xử lý dữ liệu cá nhân theo luật hiện hành.
Không nên mặc định. Nếu dữ liệu vẫn có thể được liên kết hoặc giải mã để xác định một người thì vẫn cần quản trị theo tính chất thực tế của dữ liệu.
Có. Việc chuyển từ chăm sóc khách hàng sang huấn luyện/phân tích AI có thể làm thay đổi mục đích, hệ thống và rủi ro xử lý, nên cần được rà soát trong data flow và hồ sơ tuân thủ.
Không. Nghị định 356/2025/NĐ-CP quy định Nghị định 13/2023/NĐ-CP hết hiệu lực từ ngày 01/01/2026.
Không có một giấy phép mang tên “giấy phép tiền xử lý dữ liệu”. Tuy nhiên nếu doanh nghiệp cung cấp dịch vụ xử lý dữ liệu cá nhân cho bên khác thì cần phân loại mô hình theo quy định về dịch vụ xử lý dữ liệu cá nhân.
Cần xác định loại dữ liệu vendor nhận, vai trò các bên, mục đích xử lý, nhà thầu phụ, vị trí lưu trữ, thời hạn lưu/xóa và trách nhiệm bảo mật trong hợp đồng.
Bạn có thể gửi sơ đồ hệ thống, nguồn dữ liệu, mục đích sử dụng và các vendor đang tham gia. Luật Dương Trí sẽ hỗ trợ rà soát data flow, vai trò các bên và các nghĩa vụ bảo vệ dữ liệu cá nhân cần phản ánh trong hồ sơ, hợp đồng và quy trình nội bộ.