14/01/2025 | Chia sẻ

Tiền xử lý dữ liệu là gì? 7 bước và lưu ý pháp lý khi xử lý dữ liệu cá nhân

Ngày đăng: Tác giả: Cập nhật:

Tiền xử lý dữ liệu (Data Preprocessing) là quá trình chuẩn bị dữ liệu thô trước khi đưa vào phân tích, báo cáo, học máy hoặc hệ thống tự động. Công việc có thể gồm làm sạch dữ liệu, xử lý giá trị thiếu, loại bản ghi trùng, chuẩn hóa định dạng, mã hóa biến, tích hợp dữ liệu và kiểm tra đầu ra. Nếu tập dữ liệu chứa dữ liệu cá nhân, các thao tác này không chỉ là vấn đề kỹ thuật mà còn cần được đặt trong quy trình tuân thủ pháp luật về bảo vệ dữ liệu cá nhân.

Tiền xử lý dữ liệu là gì? Hiểu nhanh trong 60 giây

Đầu vào: dữ liệu thô, có thể thiếu, sai định dạng, trùng lặp hoặc chưa phù hợp cho mục tiêu phân tích.

Quá trình: kiểm tra → làm sạch → chuẩn hóa/mã hóa → tích hợp/biến đổi → kiểm tra chất lượng.

Đầu ra: tập dữ liệu nhất quán và phù hợp hơn cho phân tích, báo cáo, AI hoặc mục đích vận hành.

Không phải: cứ xóa dữ liệu càng nhiều thì dữ liệu càng “sạch”; preprocessing phải bám mục tiêu sử dụng và giữ lại thông tin có giá trị.

Nếu có dữ liệu cá nhân: làm sạch, kết hợp, mã hóa, phân tích hoặc chuyển đổi vẫn có thể nằm trong hoạt động xử lý dữ liệu cá nhân và cần được quản trị theo Luật Bảo vệ dữ liệu cá nhân.

Tiền xử lý dữ liệu là gì?

Data Preprocessing là giai đoạn biến dữ liệu thô thành dữ liệu có cấu trúc và chất lượng phù hợp hơn với mục tiêu sử dụng. “Phù hợp” quan trọng hơn “sạch tuyệt đối”: một tập dữ liệu phục vụ báo cáo tài chính có yêu cầu khác với dữ liệu huấn luyện mô hình dự báo hoặc dữ liệu dùng cho CRM.

Các vấn đề phổ biến của dữ liệu thô gồm:

Giá trị bị thiếu.
Bản ghi bị trùng.
Ngày tháng, số điện thoại, đơn vị đo không thống nhất.
Dữ liệu sai kiểu hoặc lỗi nhập liệu.
Nhiều nguồn dùng mã định danh khác nhau.
Dữ liệu ngoại lệ cần được kiểm tra.
Tiền xử lý dữ liệu Data Preprocessing là gì
Tiền xử lý tạo cầu nối giữa dữ liệu thô và dữ liệu sẵn sàng cho mục tiêu sử dụng cụ thể.

Data Cleaning và Data Preprocessing khác nhau thế nào?

Tiêu chí Data Cleaning Data Preprocessing
Mục tiêu Sửa hoặc loại các vấn đề về chất lượng dữ liệu. Chuẩn bị toàn bộ dữ liệu cho mục tiêu phân tích/mô hình/hệ thống.
Công việc điển hình Missing values, duplicate, lỗi chính tả, sai định dạng, outlier theo trường hợp. Cleaning + encoding + scaling + transformation + integration + feature selection/reduction + validation.
Phạm vi Hẹp hơn. Rộng hơn.
Kết quả Dữ liệu sạch hơn. Dữ liệu sẵn sàng hơn cho mục đích sử dụng cụ thể.

Khi nào doanh nghiệp cần tiền xử lý dữ liệu?

Hợp nhất dữ liệu CRM

Khách hàng xuất hiện nhiều lần với cách viết tên, số điện thoại hoặc email khác nhau.

Báo cáo quản trị

Dữ liệu từ nhiều phòng ban dùng định dạng, mã sản phẩm hoặc đơn vị đo khác nhau.

Machine Learning/AI

Mô hình cần dữ liệu có cấu trúc, biến đầu vào phù hợp và hạn chế nhiễu có thể làm sai kết quả.

Chuyển đổi hệ thống

Dữ liệu từ phần mềm cũ cần được làm sạch và ánh xạ trước khi đưa sang ERP, CRM hoặc cloud mới.

7 bước tiền xử lý dữ liệu thường gặp

Không có một pipeline duy nhất áp dụng cho mọi dự án. Một quy trình thường có thể được tổ chức theo các bước sau:

Bước 1 – Khám phá và profiling dữ liệu

Kiểm tra cấu trúc, kiểu dữ liệu, số lượng bản ghi, tỷ lệ thiếu, duplicate, phân bố và các dấu hiệu bất thường trước khi sửa dữ liệu.

Bước 2 – Làm sạch dữ liệu

Sửa lỗi nhập liệu, loại hoặc gộp bản ghi trùng theo quy tắc và xử lý dữ liệu không hợp lệ.

Bước 3 – Xử lý giá trị thiếu và ngoại lệ

Quyết định giữ, loại, thay thế hoặc suy diễn giá trị dựa trên ý nghĩa nghiệp vụ; không mặc định dùng một công thức cho mọi cột dữ liệu.

Bước 4 – Chuẩn hóa, mã hóa và chuyển đổi

Đồng nhất định dạng, đơn vị, kiểu dữ liệu; mã hóa biến phân loại hoặc chuẩn hóa thang đo khi mục tiêu phân tích yêu cầu.

Bước 5 – Tích hợp dữ liệu

Kết hợp dữ liệu từ nhiều nguồn dựa trên khóa và quy tắc rõ ràng, tránh ghép sai người, sai khách hàng hoặc sai giao dịch.

Bước 6 – Chọn đặc trưng/giảm chiều khi cần

Chỉ thực hiện nếu có mục tiêu giảm độ phức tạp, tối ưu hiệu suất hoặc loại biến không có giá trị với mô hình.

Bước 7 – Kiểm tra dữ liệu đầu ra

Đối chiếu thống kê, lấy mẫu kiểm tra và lưu quy tắc biến đổi để bảo đảm tập dữ liệu có thể truy vết và sử dụng đúng mục đích.

Các bước tiền xử lý dữ liệu Data Preprocessing
Quy trình tốt cần lưu được logic biến đổi, không chỉ xuất ra một file dữ liệu “đã làm sạch”.

Ví dụ: tiền xử lý dữ liệu khách hàng trong CRM

Giả sử doanh nghiệp có 10.000 bản ghi khách hàng từ website, cửa hàng và đội sales:

  • “Nguyen Van A”, “Nguyễn Văn A” và “NGUYỄN VĂN A” có thể là cùng một người;
  • một số số điện thoại có +84, một số bắt đầu bằng 0;
  • email có khoảng trắng hoặc sai định dạng;
  • ngày sinh thiếu ở một phần dữ liệu;
  • lịch sử mua hàng nằm ở hệ thống khác.

Pipeline có thể chuẩn hóa tên và số điện thoại, kiểm tra email, xác định quy tắc duplicate rồi liên kết lịch sử mua hàng theo mã phù hợp.

Điểm quan trọng: dữ liệu “sạch hơn” vẫn có thể là dữ liệu cá nhân. Việc thay tên hiển thị, chuẩn hóa số điện thoại hoặc gắn mã khách hàng không tự động làm mất tính chất dữ liệu cá nhân nếu dữ liệu vẫn xác định hoặc giúp xác định một người cụ thể.

Những lỗi khiến dữ liệu “sạch” nhưng kết quả lại sai

Xóa duplicate sai khóa

Hai người cùng tên bị gộp thành một khách hàng hoặc hai giao dịch hợp lệ bị xóa.

Điền missing value máy móc

Thay tất cả giá trị thiếu bằng trung bình dù biến dữ liệu không phù hợp với cách suy diễn đó.

Xóa mọi outlier

Dữ liệu bất thường đôi khi lại là tín hiệu gian lận, lỗi vận hành hoặc một nhóm khách hàng quan trọng.

Không lưu transformation log

Không thể giải thích dữ liệu đầu ra được tạo từ dữ liệu gốc bằng quy tắc nào.

Tiền xử lý dữ liệu cá nhân có phải “xử lý dữ liệu cá nhân” không?

Có thể có. “Tiền xử lý dữ liệu” là thuật ngữ kỹ thuật, không phải tên một thủ tục pháp lý riêng. Nhưng nếu dữ liệu đầu vào là dữ liệu cá nhân thì các thao tác như làm sạch, sửa đổi, kết hợp, truy xuất, mã hóa, phân tích hoặc chuyển đổi đều cần được xem trong tổng thể hoạt động xử lý dữ liệu cá nhân.

Từ ngày 01/01/2026, khung pháp lý trọng tâm là Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 và Nghị định 356/2025/NĐ-CP. Nghị định 13/2023/NĐ-CP đã hết hiệu lực kể từ ngày Nghị định 356 có hiệu lực.

Do đó, câu hỏi đúng không phải là “preprocessing có cần xin phép không?” mà là: tập dữ liệu có dữ liệu cá nhân không, doanh nghiệp đang đóng vai trò gì, mục đích xử lý là gì, dữ liệu đi qua những hệ thống/bên thứ ba nào và nghĩa vụ hồ sơ nào phát sinh.

Checkpoint Câu hỏi cần trả lời Ví dụ
1. Phân loại dữ liệu Tập dữ liệu có dữ liệu cá nhân cơ bản/nhạy cảm không? CRM có số điện thoại, lịch sử mua hàng, vị trí.
2. Mục đích xử lý Việc làm sạch/ghép dữ liệu phục vụ mục đích nào? Có mở rộng mục đích so với khi thu thập không? Dữ liệu chăm sóc khách hàng được dùng thêm để train mô hình chấm điểm.
3. Vai trò các bên Ai là bên kiểm soát, bên xử lý, vendor hay bên thứ ba? Doanh nghiệp thuê cloud/vendor xử lý CRM.
4. Quyền truy cập và bảo mật Ai được truy cập dữ liệu thô và dữ liệu đã biến đổi? Data team chỉ cần một phần trường dữ liệu nhưng đang được cấp toàn bộ hồ sơ khách hàng.
5. Hồ sơ và luồng dữ liệu Pipeline đã được phản ánh trong chính sách, hợp đồng, DPIA và luồng chuyển dữ liệu theo trường hợp chưa? Vendor mới, cloud ở nước ngoài hoặc mục đích AI mới.

Nghị định 356/2025/NĐ-CP yêu cầu các bên có trách nhiệm lập và lưu hồ sơ đánh giá tác động xử lý dữ liệu cá nhân theo trường hợp. Vì vậy khi pipeline thay đổi đáng kể, doanh nghiệp nên rà soát xem hồ sơ hiện có còn phản ánh đúng hệ thống và hoạt động xử lý thực tế hay không.

Nếu cần rà soát nghĩa vụ này, xem dịch vụ lập hồ sơ đánh giá tác động xử lý dữ liệu cá nhân năm 2026.

Tiền xử lý dữ liệu cho AI và dữ liệu lớn cần lưu ý gì?

Preprocessing là bước thường xuyên trước khi dữ liệu được đưa vào hệ thống AI hoặc mô hình phân tích lớn. Khi training data chứa dữ liệu cá nhân, doanh nghiệp cần kiểm tra không chỉ dataset cuối cùng mà cả:

Nguồn dữ liệu ban đầu.
Mục đích thu thập và mục đích dùng cho AI.
Biến nào thực sự cần thiết cho mô hình.
Dữ liệu nhạy cảm có đang được đưa vào pipeline không.
Ai có quyền truy cập dữ liệu trước/sau preprocessing.
Thời gian lưu training dataset và các bản sao.

Nghị định 356/2025 có quy định riêng về xử lý dữ liệu lớn có chứa dữ liệu cá nhân, yêu cầu giới hạn thu thập/xử lý/lưu trữ theo mục đích và duy trì các biện pháp bảo vệ phù hợp.

Thuê vendor làm sạch hoặc xử lý dữ liệu cần kiểm tra gì?

Trong thực tế, doanh nghiệp có thể gửi dữ liệu cho đơn vị cung cấp cloud, AI, data analytics hoặc outsourcing để thực hiện preprocessing.

Trước khi chuyển dữ liệu, nên rà soát:

  • vendor nhận chính xác loại dữ liệu nào;
  • vendor xử lý theo chỉ dẫn hay tự quyết định mục đích;
  • có nhà thầu phụ hay không;
  • dữ liệu lưu ở Việt Nam hay nước ngoài;
  • thời gian lưu và cơ chế xóa/trả dữ liệu;
  • biện pháp bảo mật và quản lý sự cố;
  • hợp đồng đã phân rõ trách nhiệm về dữ liệu cá nhân hay chưa.

Doanh nghiệp cung cấp dịch vụ Data Preprocessing có cần giấy phép không?

Không thể kết luận chỉ dựa trên tên dịch vụ “Data Preprocessing”.

Nếu doanh nghiệp chỉ xử lý dữ liệu nội bộ của chính mình, bài toán pháp lý khác với trường hợp nhận dữ liệu cá nhân của khách hàng để phân tích, làm sạch, mã hóa, khai thác hoặc xử lý thay cho khách hàng.

Nghị định 356/2025/NĐ-CP đã quy định nhóm dịch vụ xử lý dữ liệu cá nhân và điều kiện kinh doanh tương ứng. Vì vậy, nếu mô hình dịch vụ thực tế liên quan đến xử lý dữ liệu cá nhân cho bên khác, cần phân loại hoạt động trước khi quảng bá hoặc ký hợp đồng.

Không phải mọi công ty làm Data Cleaning đều tự động cần cùng một giấy phép. Cần xem loại dữ liệu, vai trò trong chuỗi xử lý, phạm vi dịch vụ và cách doanh nghiệp vận hành thực tế.

Checklist trước khi chạy một pipeline tiền xử lý dữ liệu

Đã xác định mục tiêu đầu ra của preprocessing.
Đã profiling dữ liệu trước khi sửa.
Có quy tắc duplicate/missing/outlier rõ ràng.
Có log hoặc tài liệu transformation để truy vết.
Đã kiểm tra dataset có dữ liệu cá nhân không.
Đã xác định dữ liệu nhạy cảm nếu có.
Chỉ cấp quyền truy cập theo nhu cầu công việc.
Đã xác định mục đích dùng dataset sau preprocessing.
Đã kiểm tra vendor/nhà thầu phụ nếu thuê ngoài.
Đã rà soát DPIA/hợp đồng/chuyển dữ liệu nếu phát sinh.
Vai trò của tiền xử lý dữ liệu trong phân tích và bảo vệ dữ liệu cá nhân
Pipeline dữ liệu tốt cần đồng thời kiểm soát chất lượng, quyền truy cập và khả năng truy vết.

Luật Dương Trí hỗ trợ doanh nghiệp ở phần nào của quy trình dữ liệu?

Luật Dương Trí tập trung vào phần pháp lý và quản trị tuân thủ của data flow, không thay thế đội kỹ thuật thực hiện Data Cleaning hoặc xây dựng mô hình Machine Learning.

Rà soát data flow

Xác định loại dữ liệu, nguồn thu thập, mục đích, hệ thống, vendor và luồng chuyển dữ liệu.

Xác định vai trò pháp lý

Phân tích bên kiểm soát, bên xử lý, bên kiểm soát và xử lý hoặc các bên thứ ba theo mô hình thực tế.

Hồ sơ đánh giá tác động

Rà soát nghĩa vụ DPIA, hồ sơ xuyên biên giới và cập nhật khi hệ thống hoặc mục đích xử lý thay đổi.

Hợp đồng và chính sách

Đối chiếu điều khoản với vendor, retention, quyền truy cập, xóa dữ liệu, xử lý sự cố và quyền của chủ thể dữ liệu.

Căn cứ pháp lý về dữ liệu áp dụng năm 2026

  • Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15, có hiệu lực từ 01/01/2026.
  • Nghị định 356/2025/NĐ-CP quy định chi tiết Luật Bảo vệ dữ liệu cá nhân, có hiệu lực từ 01/01/2026.
  • Luật Dữ liệu số 60/2024/QH15, có hiệu lực từ 01/07/2025.
  • Nghị định 13/2023/NĐ-CP đã hết hiệu lực từ 01/01/2026.

Câu hỏi thường gặp

1. Tiền xử lý dữ liệu là gì?

Là quá trình chuẩn bị dữ liệu thô để dữ liệu có chất lượng, cấu trúc và định dạng phù hợp hơn với mục tiêu phân tích, báo cáo, AI hoặc vận hành.

2. Data Cleaning có phải Data Preprocessing không?

Data Cleaning là một phần của Data Preprocessing. Preprocessing còn có thể gồm mã hóa, chuẩn hóa thang đo, tích hợp, biến đổi và lựa chọn đặc trưng.

3. Thu thập dữ liệu có phải luôn là bước đầu tiên của preprocessing?

Không nhất thiết. Thu thập thường xảy ra trước preprocessing. Quy trình preprocessing thường bắt đầu từ việc profiling dữ liệu đã có.

4. Có bắt buộc phải giảm chiều dữ liệu không?

Không. Giảm chiều/chọn đặc trưng chỉ cần khi phù hợp mục tiêu, cấu trúc và quy mô của bộ dữ liệu.

5. Làm sạch dữ liệu cá nhân có phải là xử lý dữ liệu cá nhân?

Nếu các thao tác tác động đến dữ liệu có thể xác định hoặc giúp xác định cá nhân thì cần được xem trong phạm vi hoạt động xử lý dữ liệu cá nhân theo luật hiện hành.

6. Mã hóa dữ liệu có làm dữ liệu không còn là dữ liệu cá nhân?

Không nên mặc định. Nếu dữ liệu vẫn có thể được liên kết hoặc giải mã để xác định một người thì vẫn cần quản trị theo tính chất thực tế của dữ liệu.

7. Dùng dữ liệu khách hàng để train AI có cần rà soát lại mục đích không?

Có. Việc chuyển từ chăm sóc khách hàng sang huấn luyện/phân tích AI có thể làm thay đổi mục đích, hệ thống và rủi ro xử lý, nên cần được rà soát trong data flow và hồ sơ tuân thủ.

8. Năm 2026 còn áp dụng Nghị định 13/2023/NĐ-CP không?

Không. Nghị định 356/2025/NĐ-CP quy định Nghị định 13/2023/NĐ-CP hết hiệu lực từ ngày 01/01/2026.

9. Tiền xử lý dữ liệu có cần “giấy phép” không?

Không có một giấy phép mang tên “giấy phép tiền xử lý dữ liệu”. Tuy nhiên nếu doanh nghiệp cung cấp dịch vụ xử lý dữ liệu cá nhân cho bên khác thì cần phân loại mô hình theo quy định về dịch vụ xử lý dữ liệu cá nhân.

10. Khi thuê vendor làm sạch dữ liệu cần quan tâm gì nhất?

Cần xác định loại dữ liệu vendor nhận, vai trò các bên, mục đích xử lý, nhà thầu phụ, vị trí lưu trữ, thời hạn lưu/xóa và trách nhiệm bảo mật trong hợp đồng.

Nội dung liên quan

Doanh nghiệp đang làm sạch, hợp nhất hoặc đưa dữ liệu khách hàng vào AI?

Bạn có thể gửi sơ đồ hệ thống, nguồn dữ liệu, mục đích sử dụng và các vendor đang tham gia. Luật Dương Trí sẽ hỗ trợ rà soát data flow, vai trò các bên và các nghĩa vụ bảo vệ dữ liệu cá nhân cần phản ánh trong hồ sơ, hợp đồng và quy trình nội bộ.

Zalo Luật Sư Hotline WhatsApp