Xử lý giá trị khuyết (Missing value) trong SPSS là quy trình phân tích nguyên nhân, đánh giá cơ chế phân bố và áp dụng các kỹ thuật thống kê nhằm xử lý những ô dữ liệu bị bỏ trống trong tập dữ liệu khảo sát hoặc chuỗi thời gian. Dữ liệu khuyết xuất hiện phổ biến trong nghiên cứu thực nghiệm do đáp viên vô tình bỏ sót câu hỏi, từ chối trả lời các thông tin nhạy cảm về thu nhập hoặc do lỗi kỹ thuật trong quá trình thu thập thông tin. Nếu không được xử lý cẩn trọng, dữ liệu khuyết sẽ làm suy giảm kích thước mẫu hiệu dụng và gây ra sự sai lệch nghiêm trọng cho kết quả ước lượng mô hình.

3 cơ chế phân bố dữ liệu khuyết theo phân loại của Rubin (1976)
Trước khi quyết định phương pháp xử lý, nhà nghiên cứu bắt buộc phải xác định cơ chế phát sinh dữ liệu khuyết:
1. Khuyết hoàn toàn ngẫu nhiên (Missing Completely at Random – MCAR)
Dữ liệu khuyết hoàn toàn ngẫu nhiên khi xác suất xảy ra khuyết dữ liệu không có bất kỳ mối liên hệ nào với các giá trị quan sát được cũng như các giá trị bị khuyết. Đây là trường hợp lý tưởng vì dữ liệu khuyết không làm sai lệch tính đại diện của mẫu khảo sát.
2. Khuyết ngẫu nhiên (Missing at Random – MAR)
Xác suất xảy ra khuyết dữ liệu phụ thuộc vào các biến số quan sát được khác trong tệp dữ liệu, nhưng không phụ thuộc vào chính giá trị của biến bị khuyết đó (ví dụ: Nam giới thường có xu hướng bỏ qua câu hỏi về chăm sóc da hơn nữ giới, nhưng trong cùng nhóm nam giới thì việc bỏ qua là ngẫu nhiên).
3. Khuyết không ngẫu nhiên (Missing Not at Random – MNAR)
Xác suất khuyết dữ liệu phụ thuộc trực tiếp vào chính giá trị của biến số đó (ví dụ: Những người có thu nhập rất cao hoặc rất thấp thường từ chối trả lời câu hỏi về thu nhập cá nhân). Đây là dạng khuyết nghiêm trọng gây ra thiên lệch chọn lọc (Selection Bias).
“Hiểu rõ bản chất cơ chế khuyết dữ liệu là điều kiện tiên quyết để lựa chọn giải pháp: Xử lý sai phương pháp có thể gây ra sai lệch ước lượng lớn hơn cả việc chấp nhận một cỡ mẫu nhỏ hơn.”

Kiểm định Little’s MCAR Test trong SPSS
Để kiểm tra xem tập dữ liệu có thỏa mãn cơ chế khuyết hoàn toàn ngẫu nhiên hay không, SPSS cung cấp kiểm định Little’s MCAR Test qua menu Analyze → Missing Value Analysis…:
- Giả thuyết H0: Dữ liệu bị khuyết hoàn toàn ngẫu nhiên (MCAR).
- Giả thuyết H1: Dữ liệu không khuyết hoàn toàn ngẫu nhiên.
- Quy tắc quyết định: Nếu giá trị Sig. (p-value) > 0.05, ta chấp nhận H0 và kết luận dữ liệu thỏa mãn cơ chế MCAR, cho phép áp dụng an toàn các kỹ thuật loại bỏ hoặc điền khuyết.

Các kỹ thuật xử lý dữ liệu khuyết phổ biến trên SPSS
Khoa học thống kê cung cấp hai nhóm giải pháp cơ bản:
1. Nhóm phương pháp loại bỏ dữ liệu (Deletion Methods)
- Loại bỏ theo danh sách (Listwise Deletion): Loại bỏ hoàn toàn quan sát (hàng) nếu có ít nhất một giá trị bị khuyết trong bất kỳ biến số nào tham gia mô hình. Phương pháp này đơn giản nhưng làm giảm mạnh cỡ mẫu.
- Loại bỏ theo cặp (Pairwise Deletion): Chỉ loại bỏ quan sát khi biến số cụ thể trong phép toán đó bị khuyết, tận dụng tối đa dữ liệu còn lại cho các phép tính khác.
2. Nhóm phương pháp điền khuyết dữ liệu (Imputation Methods)
- Thay thế bằng giá trị trung bình (Mean Substitution): Điền giá trị trung bình của chuỗi biến số vào ô trống. Phương pháp này đơn giản nhưng làm giảm phương sai tự nhiên của dữ liệu.
- Nội suy tuyến tính (Linear Interpolation): Áp dụng hiệu quả cho dữ liệu chuỗi thời gian bằng cách lấy giá trị trung bình nội suy giữa điểm trước và điểm sau.
- Điền khuyết bằng mô hình hồi quy (Regression Imputation): Sử dụng các biến số hoàn chỉnh làm biến độc lập để dự báo giá trị cho ô bị khuyết.
- Điền khuyết đa biến lặp (Multiple Imputation – MI): Phương pháp hiện đại tạo ra nhiều bộ dữ liệu mô phỏng để bảo toàn trọn vẹn phương sai và tính ngẫu nhiên của dữ liệu gốc.
Bảng tổng hợp so sánh các kỹ thuật xử lý Missing Value
Dưới đây là bảng phân tích so sánh chi tiết giữa các phương pháp:
| Kỹ thuật xử lý | Cơ chế áp dụng thích hợp | Ưu điểm nổi bật | Hạn chế chủ yếu |
|---|---|---|---|
| Listwise Deletion | MCAR (Tỷ lệ khuyết < 5%) | Đơn giản, không làm méo mó cấu trúc dữ liệu | Làm giảm mạnh quy mô mẫu, lãng phí thông tin |
| Mean Substitution | MCAR (Tỷ lệ khuyết rất nhỏ) | Giữ nguyên cỡ mẫu ban đầu, dễ thực hiện | Bóp nghẹt phương sai, làm suy giảm hệ số tương quan |
| Regression Imputation | MAR hoặc MCAR | Tận dụng mối quan hệ giữa các biến số quan sát | Thổi phồng độ khớp R² của mô hình hồi quy |
| Multiple Imputation | MAR và MCAR | Chuẩn mực khoa học cao, bảo toàn phương sai mẫu | Đòi hỏi quy trình phức tạp và phần mềm chuyên dụng |
Hướng dẫn thao tác điền khuyết Replace Missing Values trên SPSS
Để thực hiện thay thế giá trị khuyết trên phần mềm SPSS bằng lệnh tự động:
- Trên thanh công cụ chính chọn Transform → Replace Missing Values…
- Chọn biến số có chứa giá trị khuyết chuyển sang khung New Variable(s).
- Tại mục Method, lựa chọn phương pháp điền khuyết phù hợp:
- Series mean: Thay bằng giá trị trung bình của toàn bộ chuỗi dữ liệu.
- Mean of nearby points: Thay bằng trung bình của các điểm lân cận.
- Median of nearby points: Thay bằng trung vị của các điểm xung quanh.
- Linear interpolation: Nội suy tuyến tính dựa trên giá trị liền kề.
- Nhấp Change rồi nhấn OK. SPSS sẽ tự động tạo ra một cột biến mới đã được điền khuyết hoàn chỉnh.

Nghiên cứu so sánh hiệu quả giữa Listwise Deletion và Multiple Imputation
Khi giải quyết bài toán Xử lý giá trị khuyết (Missing value) trong SPSS, việc lựa chọn giữa việc xóa bỏ hay điền khuyết có tác động trực tiếp đến kết quả ước lượng mô hình:
- Trường hợp cỡ mẫu khảo sát lớn (N = 600) với tỷ lệ khuyết cực thấp (< 2%): Phương pháp loại bỏ danh sách (Listwise Deletion) là lựa chọn tối ưu vì chỉ làm mất khoảng 10-12 quan sát, mẫu còn lại vẫn đạt trên 580 quan sát, hoàn toàn bảo đảm lực kiểm định thống kê và không làm phát sinh thêm giả định nhân tạo nào vào dữ liệu.
- Trường hợp cỡ mẫu nhỏ hoặc vừa (N = 180) nhưng tỷ lệ khuyết rải rác ở nhiều biến (10% – 15%): Nếu dùng Listwise Deletion, bạn có thể bị mất tới 40-50 quan sát, làm cỡ mẫu tụt xuống dưới ngưỡng an toàn (N < 150). Khi đó, phương pháp Điền khuyết đa biến lặp (Multiple Imputation – MI) qua menu Analyze → Multiple Imputation → Impute Missing Data Values… là giải pháp bắt buộc. Thuật toán sẽ tạo ra 5 bộ dữ liệu hoàn chỉnh (m = 5), sau đó kết hợp các ước lượng (Pooled Estimates) để tạo ra kết quả hồi quy chuẩn xác và bảo toàn độ tin cậy.
Nhà nghiên cứu cần trình bày rõ ràng trong phần phương pháp luận về lý do lựa chọn kỹ thuật điền khuyết để thuyết phục hội đồng khoa học.

Câu hỏi thường gặp về xử lý giá trị khuyết (Missing value) trong SPSS (FAQ)
Tỷ lệ khuyết dữ liệu bao nhiêu phần trăm thì được coi là an toàn để loại bỏ mẫu?
Theo các chuyên gia thống kê (Hair et al., 2010), nếu tỷ lệ khuyết dưới 5% trên một biến số và dữ liệu thỏa mãn MCAR thì việc loại bỏ quan sát (Listwise) hầu như không ảnh hưởng đến kết quả hồi quy.
Nếu một biến quan sát có tỷ lệ khuyết vượt quá 20% thì nên xử lý thế nào?
Khi một biến có hơn 20% dữ liệu bị khuyết, nhà nghiên cứu nên xem xét loại bỏ hoàn toàn biến số đó khỏi mô hình phân tích để tránh làm sai lệch kết quả.
Tại sao không nên tự ý điền số điểm ngẫu nhiên vào bảng khảo sát bị khuyết?
Hành vi tự điền số liệu vi phạm nghiêm trọng đạo đức nghiên cứu khoa học, làm biến dạng phân phối xác suất thực tế và có thể dẫn đến việc kết luận nghiên cứu hoàn toàn vô giá trị.
Kết luận và định hướng thực hành
Làm chủ kỹ thuật Xử lý giá trị khuyết (Missing value) trong SPSS giúp nhà nghiên cứu bảo toàn kích thước mẫu, nâng cao độ tin cậy thống kê và tự tin công bố kết quả nghiên cứu. Để tham khảo thêm các tệp dữ liệu thực hành điền khuyết nâng cao trên SPSS, mời bạn đọc truy cập thầy Phương.

Giảng viên Nguyễn Thanh Phương là chuyên gia chuyên sâu về Nghiên cứu khoa học, Ứng dụng AI, Digital Marketing và Quản trị bản thân. Với kinh nghiệm giảng dạy thực chiến, tác giả trực tiếp hướng dẫn ứng dụng phương pháp luận và phân tích dữ liệu chuyên sâu cho người học nên được sinh viên gọi là Thầy giáo quốc dân. Mọi nội dung chia sẻ đều tuân thủ nguyên tắc khách quan, thực chứng và mang giá trị ứng dụng cao, hướng tới mục tiêu cốt lõi: “Làm bạn tốt hơn!




