ELECTE 4.0 đã ra mắt — AI Agent đã có mặt.Xem tính năng mới
Dữ liệu & phân tích18 phút đọc

Xử Lý Dữ Liệu Thiếu: Hướng Dẫn Phân Tích Kinh Doanh

Tìm hiểu cách xử lý dữ liệu thiếu giúp cải thiện độ chính xác của phân tích kinh doanh. Khám phá các phương pháp thực tiễn để xử lý bộ dữ liệu không đầy đủ trong năm 2026.

Missing Data Imputation: A Business Analytics Guide

Tóm tắt bài viết này bằng AI

Một quản lý bán hàng khu vực mở bảng điều khiển doanh thu hàng tuần vào sáng thứ Hai và thấy các ô trống của ba cửa hàng. Hệ thống điểm bán hàng đã không đồng bộ hóa được qua đêm. Tổng doanh thu có vẻ như đã giảm, dự báo đi theo chiều hướng xuống, và cả nhóm bắt đầu tranh luận về một chương trình khuyến mãi cấp tốc dựa trên một xu hướng có thể không hề tồn tại.

Đây chính là rủi ro kinh doanh của dữ liệu không đầy đủ. Một giá trị bị thiếu không tự động bằng không, và việc xóa dòng dữ liệu bị ảnh hưởng không làm cho sự bất định tiềm ẩn biến mất. Nó có thể làm sai lệch một KPI, gián đoạn một dự báo, hoặc khiến báo cáo dành cho lãnh đạo đi theo hướng sai lầm.

Xử lý dữ liệu thiếu (missing data imputation) cung cấp một cách tiếp cận có cấu trúc để ước tính các giá trị bị thiếu trong khi vẫn giữ lại thông tin cần thiết cho việc phân tích. Phương pháp bạn chọn rất quan trọng vì một giá trị có vẻ hợp lý vẫn có thể dẫn đến một quyết định sai lầm. Hướng dẫn này giải thích các cơ chế thiếu dữ liệu chính, so sánh các phương pháp xử lý thực tiễn, chỉ ra cách xác thực kết quả, và kết nối mỗi lựa chọn kỹ thuật với các quyết định về báo cáo, dự báo, bán lẻ và tài chính.

Mục lục

  • Khi Dữ Liệu Thiếu Làm Hỏng Báo Cáo Kinh Doanh Của Bạn
    • Vì sao thời điểm xử lý lại quan trọng
  • Hiểu Về Các Cơ Chế MCAR, MAR và MNAR
    • MCAR nghĩa là các khoảng trống không liên quan đến nhau
    • MAR nghĩa là thông tin quan sát được lý giải cho các khoảng trống
    • MNAR nghĩa là giá trị bị thiếu tự nó mang thông tin
  • So Sánh Các Phương Pháp Xử Lý Dữ Liệu Thiếu Từ Đơn Giản Đến Nâng Cao
    • Bắt đầu với một phương pháp nền tảng
    • Bổ sung các mối quan hệ khi dữ liệu cho phép
    • Sử dụng các mô hình nâng cao khi có lý do rõ ràng
  • Chọn Kỹ Thuật Phù Hợp Cho Dữ Liệu Của Bạn
    • Bốn câu hỏi giúp thu hẹp lựa chọn
    • Một lộ trình quyết định thực tiễn
  • Đánh Giá Chất Lượng Xử Lý Dữ Liệu Thiếu Và Tránh Các Sai Lầm Thường Gặp
    • Kiểm tra phân phối dữ liệu
    • Kiểm định quyết định, không chỉ kiểm định ước tính
  • Xử Lý Dữ Liệu Thiếu Trong Bối Cảnh Kinh Doanh Bán Lẻ Và Tài Chính
    • Các quyết định bán lẻ phụ thuộc vào sự phân biệt này
    • Tài chính cần được hiệu chỉnh và có khả năng kiểm toán
  • Cách ELECTE Tự Động Hóa Xử Lý Dữ Liệu Thiếu Trong Các Quy Trình Phân Tích
    • Quy trình gồm bốn giai đoạn thực tiễn
    • Tự động hóa vẫn cần sự kiểm soát của con người
  • Những Điểm Chính Cần Ghi Nhớ Và Bước Tiếp Theo
    • Một danh sách kiểm tra bạn có thể áp dụng ngay ngày mai


Khi Dữ Liệu Thiếu Làm Hỏng Báo Cáo Kinh Doanh Của Bạn

Bản năng đầu tiên của người quản lý là điều dễ hiểu: kiểm tra xem các cửa hàng bị thiếu dữ liệu có phải đã có một ngày bán hàng tệ hay không. Nhưng bảng điều khiển không thể trả lời câu hỏi đó vì các bản ghi chưa bao giờ được gửi về. Coi các ô trống là bằng không sẽ biến một sự cố hệ thống thành một sự sụt giảm doanh thu có vẻ như thật. Loại bỏ các cửa hàng này sẽ che giấu vấn đề trong khi làm thu hẹp phạm vi so sánh khu vực.

Một cách phản ứng tốt hơn bắt đầu bằng việc phân tách những gì dữ liệu thể hiện với những gì dữ liệu đã không thể ghi nhận được. Các cửa hàng có thể đã bán hàng bình thường, trải qua một sự sụt giảm thực sự, hoặc theo một mô hình thiếu dữ liệu liên quan đến quy mô cửa hàng, vị trí, loại thiết bị, hoặc khối lượng giao dịch. Mỗi khả năng dẫn đến một cách xử lý khác nhau.

Quy tắc kinh doanh: Đừng bao giờ để một ô trống chưa được xem xét quyết định việc bạn có cắt giảm hàng tồn kho, triển khai một chương trình khuyến mãi, hay sửa đổi một dự báo hay không.

Xử lý dữ liệu thiếu ước tính một giá trị từ thông tin còn lại. Trong một chuỗi thời gian, điều đó có thể có nghĩa là sử dụng các quan sát lân cận. Trong một bộ dữ liệu rộng hơn, điều đó có thể có nghĩa là sử dụng các biến liên quan như định dạng cửa hàng, khu vực, mùa vụ, hoặc hoạt động giao dịch. Giá trị ước tính không phải là một sự thật được khôi phục. Đó là một giả định minh bạch cho phép việc phân tích tiếp tục diễn ra trong khi vẫn giữ lại tính bất định.


Vì sao thời điểm xử lý lại quan trọng

Các giá trị bị thiếu cần được xử lý trước khi một KPI, dự báo, hoặc báo cáo dành cho lãnh đạo được tin tưởng sử dụng. Nếu một bộ phận điền các khoảng trống bằng số không, một bộ phận khác mang giá trị được biết đến gần nhất chuyển tiếp, và một bộ phận thứ ba xóa các dòng dữ liệu không đầy đủ, tổ chức không còn có các định nghĩa nhất quán cho cùng một chỉ số nữa.

Điều đó làm suy yếu khái niệm nguồn dữ liệu duy nhất đáng tin cậy (single source of truth). Một quy trình tập trung nên ghi lại giá trị thô, giá trị đã được xử lý, phương pháp được áp dụng, và lý do phương pháp đó được lựa chọn.

Lịch sử của việc xử lý dữ liệu thiếu cho thấy ngành học này đã phát triển như thế nào. Allan và Wishart đã công bố một ví dụ đầu tiên vào năm 1930, ước tính các giá trị ô thí nghiệm bị thiếu trong công việc thực địa thử nghiệm. Đến thập niên 1950, cuộc Tổng điều tra dân số Canada đã sử dụng phương pháp Deming để xử lý các giá trị bị thiếu dựa trên phân phối của các cuộc điều tra dân số trước đó. Việc xử lý dữ liệu thiếu xuất hiện trong bối cảnh khảo sát hiện đại vào năm 1953, sau đó đạt được một bước đột phá lớn vào thập niên 1970 thông qua phương pháp hợp lý cực đại và xử lý dữ liệu thiếu bội (multiple imputation), bao gồm công trình mang tính bước ngoặt của Dempster, Laird, và Rubin vào năm 1977, tiếp theo là các công bố của Rubin vào năm 19781987. Bản ghi chép lịch sử này cho thấy việc xử lý dữ liệu thiếu không phải là một mẹo làm sạch dữ liệu nhanh gọn. Đó là một lĩnh vực thống kê được xây dựng dựa trên các giả định, sự bất định, và các quyết định thực tiễn.


Hiểu Về Các Cơ Chế MCAR, MAR và MNAR

Trước khi chọn kỹ thuật, hãy xác định tại sao giá trị bị thiếu. Ba cơ chế tiêu chuẩn là MCAR, MAR, và MNAR. Tên gọi của chúng nghe có vẻ kỹ thuật, nhưng một phép ẩn dụ về hàng tồn kho bán lẻ sẽ giúp phân biệt dễ áp dụng hơn.


MCAR nghĩa là các khoảng trống không liên quan đến điều gì

Giả sử một xe nâng va vào một pallet và làm hỏng vài tờ giấy kiểm kê. Các bản ghi kệ hàng bị thiếu nằm rải rác trên nhiều sản phẩm và cửa hàng. Sự vắng mặt của chúng không liên quan đến nhu cầu, giá sản phẩm, mức tồn kho, hay bất kỳ giá trị quan sát được hoặc không quan sát được nào khác.

Đó là Missing Completely At Random, hay MCAR. Tình trạng thiếu dữ liệu không liên quan đến cả giá trị quan sát được lẫn không quan sát được, theo định nghĩa trong tổng quan về các cơ chế dữ liệu thiếu này. Các phương pháp đơn giản có thể chấp nhận được cho công việc khám phá khi các khoảng trống bị cô lập, mặc dù bạn vẫn nên kiểm tra giả định đó thay vì mặc định chấp nhận tính ngẫu nhiên.


MAR nghĩa là thông tin quan sát được giải thích các khoảng trống

Bây giờ hãy xem xét các cửa hàng có lưu lượng cao. Máy quét cũ của họ gặp khó khăn khi hoạt động cường độ cao, nên nhân viên thường không ghi lại số liệu kiểm kê cuối ngày ở các địa điểm lớn. Bản thân giá trị tồn kho bị thiếu không phải là nguyên nhân gây ra bản ghi bị thiếu. Kích thước cửa hàng và loại máy quét, cả hai đều là biến số được ghi nhận, giải thích tại sao giá trị đó vắng mặt.

Đây là Missing At Random, hay MAR. Tình trạng thiếu dữ liệu phụ thuộc vào dữ liệu quan sát được, vì vậy một mô hình có thể sử dụng các mối quan hệ đó. Kích thước cửa hàng, khu vực, loại máy quét, khối lượng bán hàng, và thông tin lịch có thể giúp ước tính số lượng bị thiếu.


MNAR nghĩa là giá trị bị thiếu mang theo thông tin

Cuối cùng, hãy tưởng tượng các sản phẩm cao cấp bị cố tình bỏ ra khỏi báo cáo tồn kho vì ai đó muốn che giấu một khoản thất thoát. Xác suất thiếu dữ liệu phụ thuộc vào chính giá trị không được quan sát, hoặc vào thông tin không quan sát được khác. Đó là Missing Not At Random, còn được gọi là NMAR hoặc MNAR.

Bạn không thể giải quyết vấn đề này một cách đáng tin cậy chỉ bằng cách nhìn vào các cột đã hoàn thành. Bạn cần kiến thức chuyên môn, phân tích độ nhạy, tổng số bên ngoài, hoặc một mô hình thể hiện rõ ràng quá trình gây thiếu dữ liệu. Trong dữ liệu khảo sát và kinh doanh, sự phân biệt này rất quan trọng vì một phương pháp tạo ra sai số dự đoán thấp vẫn có thể làm sai lệch tổng số hoặc che giấu một thiên lệch mang tính hệ thống.

Câu hỏi chẩn đoán: Ai có nhiều khả năng có bản ghi trống hơn, và người đó, cửa hàng, khách hàng, hay giao dịch đó sẽ cho bạn biết điều gì?


So Sánh Các Phương Pháp Điền Khuyết Từ Đơn Giản Đến Nâng Cao

Không có phương pháp điền khuyết đơn lẻ nào chiến thắng cho mọi tập dữ liệu. Lựa chọn thực tế phụ thuộc vào loại biến số, hình dạng của dữ liệu, cơ chế thiếu dữ liệu, và hậu quả của việc chọn sai.

Phương pháp

Phù hợp nhất với

Đánh đổi chính

Trung bình, trung vị, hoặc yếu vị

Các khoảng trống nhỏ, riêng lẻ trong cột số hoặc phân loại đơn giản

Nhanh và dễ, nhưng có thể làm giảm sự biến thiên và bỏ qua các mối quan hệ

Điền tiến hoặc điền lùi

Chuỗi thời gian có thứ tự với các khoảng trống ngắn

Duy trì tính liên tục, nhưng có thể lan truyền một giá trị trước đó không chính xác

k-láng giềng gần nhất

Tập dữ liệu số hỗn hợp mà các bản ghi tương tự mang tính tham khảo

Sử dụng sự tương đồng đặc trưng, nhưng có thể tốn kém và nhạy cảm với việc chuẩn hóa thang đo

Điền khuyết bằng hồi quy

Các cột có mối quan hệ chặt chẽ với các biến dự đoán đã quan sát

Có mục tiêu rõ ràng hơn, nhưng có thể gây quá khớp hoặc áp đặt một mối quan hệ không phù hợp

MICE và các phương pháp lặp

Dữ liệu đa biến với các biến có liên quan và các mẫu kiểu MAR

Duy trì các mối quan hệ tốt hơn, nhưng đòi hỏi thiết kế mô hình cẩn thận

Thuật toán EM

Ước lượng dựa trên khả năng hợp lý khi các giả định phân phối có thể bảo vệ được

Có cơ sở thống kê vững chắc, nhưng các giả định và cách triển khai đòi hỏi chuyên môn

Điền khuyết bằng rừng ngẫu nhiên

Các mối quan hệ phi tuyến và hiệu ứng dự đoán hỗn hợp

Linh hoạt, nhưng tốn nhiều tài nguyên tính toán hơn và kém minh bạch hơn

Bộ mã hóa tự động và GAIN

Các cấu trúc dạng bảng phức tạp, nhiều chiều

Có thể mô hình hóa các mẫu khó, nhưng cần xác thực chặt chẽ và nguồn lực vận hành lớn


Bắt đầu với một mốc tham chiếu

Các phương pháp trung bình, trung vị, và yếu vị là những điểm tham chiếu hữu ích. Trung vị có thể ít bị ảnh hưởng bởi các giá trị cực đoan hơn so với trung bình, trong khi việc thay thế bằng yếu vị có thể phù hợp với một trường phân loại. Các phương pháp này không suy luận ra một mẫu hình phong phú, nên chúng phù hợp hơn với phân tích khám phá nhanh so với một dự báo có mức độ rủi ro cao.

Đối với chuỗi thời gian, điền tiến mang giá trị đã biết gần nhất vào một khoảng trống ở phía sau, trong khi điền lùi sử dụng một quan sát ở phía sau. Điều này có thể hợp lý đối với các thuộc tính thay đổi chậm, nhưng có thể gây hiểu lầm khi doanh số, tồn kho, hoặc giá cả biến động nhanh.


Bổ sung các mối quan hệ khi dữ liệu cho phép

k-láng giềng gần nhất tìm các bản ghi giống với bản ghi thiếu và sử dụng giá trị của chúng làm căn cứ. Điền khuyết bằng hồi quy dự đoán cột bị thiếu từ các biến dự đoán đã quan sát. Cả hai đều có thể vượt trội hơn một phép tóm tắt đơn giản khi các mối quan hệ ổn định, nhưng cả hai cũng có thể tạo ra sự tự tin sai lệch nếu các biến dự đoán yếu hoặc chưa được chuẩn hóa thang đo phù hợp.

MICE, hay Multiple Imputation by Chained Equations, mô hình hóa các cột theo cách lặp lại và tạo ra nhiều tập dữ liệu hoàn chỉnh. Hướng dẫn của Columbia Public Health cho biết 5 đến 10 tập dữ liệu được gán giá trị là đủ trong hầu hết các trường hợp, trong khi một số nhà phân tích khuyến nghị chỉ cần 3 hoặc nhiều tới 20 tập. Cùng hướng dẫn đó nhấn mạnh rằng mô hình nên bao gồm các biến dự đoán cả tình trạng thiếu dữ liệu lẫn giá trị bị thiếu, để việc gán giá trị nắm bắt được các mối liên hệ trong dữ liệu. Đọc hướng dẫn của Columbia về multiple imputation.


Sử dụng các mô hình nâng cao khi có lý do xác đáng

Thuật toán EM, random forest, autoencoder và GAIN có thể biểu diễn các cấu trúc phức tạp hơn. Sự linh hoạt bổ sung đó không tự động là một lợi thế. Nghiên cứu về gán giá trị trong dữ liệu nhiều chiều đã chỉ ra rằng việc lựa chọn biến dự đoán dựa trên lasso và phân tích thành phần chính (PCA) cho dữ liệu bổ trợ hoạt động tốt, củng cố quan điểm rằng lựa chọn đặc trưng và giảm chiều dữ liệu là yếu tố cốt lõi của chất lượng. So sánh của SAGE ủng hộ một kết luận thực tiễn: giảm bớt các đầu vào không liên quan trước khi tăng độ phức tạp của mô hình.


Chọn Kỹ Thuật Phù Hợp Cho Dữ Liệu Của Bạn

Việc lựa chọn phương pháp cần dựa theo quyết định, chứ không phải ngược lại. Thay thế bằng trung vị có thể hoàn toàn phù hợp cho một biểu đồ khám phá nội bộ, nhưng lại không thể chấp nhận được nếu cùng cột đó được dùng để tính điểm rủi ro tín dụng, báo cáo tuân thủ quy định, hoặc đơn đặt hàng bổ sung.


Bốn câu hỏi giúp thu hẹp lựa chọn

Loại dữ liệu là yếu tố đầu tiên. Dữ liệu số có thể hỗ trợ các phương pháp trung vị, hồi quy, hoặc dựa trên lân cận (neighbour-based). Các trường phân loại có thể cần một hạng mục "không xác định" có ý nghĩa hoặc một mô hình tôn trọng cấu trúc phân loại. Chuỗi thời gian đòi hỏi chú ý đến thứ tự và tính mùa vụ. Các bảng dữ liệu hỗn hợp loại thường cần một phương pháp được thiết kế để xử lý đồng thời các dạng biến khác nhau.

Tỷ lệ thiếu dữ liệu làm thay đổi mức độ rủi ro. Vài ô trống rải rác có thể được xử lý bằng một phương pháp cơ bản đơn giản. Khi khoảng trống trở nên thường xuyên hơn hoặc tập trung thành cụm, ước tính sẽ phụ thuộc nhiều hơn vào các giả định của mô hình. Hãy coi các mốc tỷ lệ dưới 5%, 5% đến 20%, và trên 20% là các gợi ý để xem xét thực tế, không phải quy tắc tự động. Khoảng trống càng lớn, việc kiểm tra xem các hàng đã quan sát có còn đại diện cho các hàng bị thiếu hay không càng trở nên quan trọng.

Cơ chế gây thiếu dữ liệu quyết định bằng chứng nào là hợp lệ. MCAR với tỷ lệ thấp trên dữ liệu số có thể biện minh cho việc dùng trung vị hoặc forward-fill được giới hạn cẩn thận. MAR với các đặc trưng có tương quan hướng tới MICE, k-nearest neighbours, hoặc hồi quy. MNAR đòi hỏi các quy tắc dựa trên chuyên môn lĩnh vực, các mô hình chuyên biệt, các chuẩn đối sánh bên ngoài, và phân tích độ nhạy.

Mục đích sử dụng ở hạ nguồn đặt ra tiêu chuẩn. Các bảng điều khiển mô tả đôi khi có thể chấp nhận một phương pháp cơ bản minh bạch. Các dự báo và mô hình dự đoán cần được kiểm định chặt chẽ hơn. Việc chấm điểm tuân thủ và báo cáo cấp điều hành đòi hỏi các giả định phải được ghi chép lại, vì một bảng dữ liệu có vẻ hoàn chỉnh vẫn có thể che giấu sự bất định đáng kể.


Một quy trình quyết định thực tiễn

Hãy sử dụng trình tự này trước khi ghi đè bất kỳ ô trống nào:

  1. Lập hồ sơ cột dữ liệu. Ghi lại loại dữ liệu, mẫu hình thiếu dữ liệu, các trường liên quan, và mục đích báo cáo.
  2. Kiểm tra cơ chế gây thiếu dữ liệu. Tìm mối quan hệ giữa tình trạng thiếu dữ liệu và các thuộc tính đã quan sát được của cửa hàng, khách hàng, thời gian, hoặc giao dịch.
  3. Chọn phương pháp đơn giản nhất có thể biện minh được. Đừng trả chi phí tính toán và quản trị của một mô hình phức tạp nếu một phương pháp cơ bản đã được kiểm định vẫn đảm bảo được quyết định.
  4. Nâng cấp mức độ khi rủi ro tăng lên. Dự báo, rủi ro, tuân thủ, và báo cáo bên ngoài xứng đáng được kiểm định có tính đến cơ chế gây thiếu dữ liệu.
  5. Giữ lại dữ liệu gốc. Lưu trữ riêng biệt giá trị thô và giá trị đã được gán, kèm theo lý do cho mỗi phép biến đổi.

Một bộ kỹ thuật kiểm định dữ liệu dành cho doanh nghiệp vừa và nhỏ hữu ích có thể giúp các nhóm chính thức hóa những kiểm tra này. ELECTE áp dụng khung này bằng cách chấm điểm các cột dựa trên loại dữ liệu, mẫu hình thiếu dữ liệu, các chỉ báo về cơ chế gây thiếu, và bối cảnh sử dụng ở hạ nguồn, sau đó đề xuất một phương pháp kèm theo lý giải được ghi chép rõ ràng trước khi một giá trị bị ghi đè.


Đánh Giá Chất Lượng Gán Giá Trị Và Tránh Các Sai Lầm Thường Gặp

Một bảng dữ liệu đã hoàn chỉnh vẫn có thể dẫn đến một quyết định kinh doanh kém. Hãy kiểm tra chất lượng gán giá trị qua ba góc nhìn: hình dạng thống kê, hành vi ở hạ nguồn, và tính hợp lý về mặt kinh doanh. Mục tiêu không phải là làm cho mọi ô trống biến mất. Mục tiêu là hiểu được mỗi ước tính có thể làm thay đổi một dự báo, đánh giá rủi ro, hoặc báo cáo quản trị như thế nào.


Kiểm tra phân phối dữ liệu

So sánh các giá trị đã được gán và giá trị đã quan sát thông qua trung bình, phương sai, và các phân vị. Nếu các ước tính tập trung quá gần nhau quanh giá trị trung tâm, một phương pháp đơn giản có thể đã xóa bỏ sự biến động thực sự. Đối với các trường phân loại, hãy so sánh tần suất các hạng mục và tìm hiểu các thay đổi bất thường. Một chuỗi trông mượt mà hơn có thể dễ đọc hơn nhưng lại đánh giá thấp các biến động về nhu cầu hoặc các giao dịch bất thường.


Kiểm định quyết định, không chỉ ước tính

Ẩn các giá trị đã biết, gán giá trị thay thế cho chúng, rồi so sánh các ước tính với quan sát gốc. Sau đó chạy mô hình hoặc logic báo cáo ở tầng dưới trên cả tập dữ liệu đã gán giá trị lẫn tập con chỉ gồm các trường hợp đầy đủ. Một giá trị được điền vào có thể trông hợp lý nhưng vẫn làm thay đổi thứ hạng, dự báo, quy tắc phê duyệt, hoặc cảnh báo ngoại lệ. Hãy đo trực tiếp tác động kinh doanh đó.

Bằng chứng từ các benchmark trong lĩnh vực y tế củng cố cách tiếp cận này. Một benchmark cho thấy nội suy tuyến tính đạt RMSE thấp nhất trên tất cả các cơ chế và nhóm nhân khẩu học được kiểm tra, trong khi cách đánh giá kiểu MCAR có thể xếp hạng sai các phương pháp khi tình trạng mất dữ liệu thực tế phụ thuộc vào cơ chế gây mất dữ liệu. Xem benchmark chuỗi thời gian trong y tế. Hãy kiểm định dựa trên quá trình mất dữ liệu mà bạn dự kiến sẽ gặp, thay vì chỉ dựa vào việc xóa ngẫu nhiên.

Cạm bẫy

Hậu quả

Cách khắc phục

Gán giá trị trước khi chia dữ liệu huấn luyện và kiểm tra

Thông tin rò rỉ từ dữ liệu đánh giá vào mô hình

Chia dữ liệu trước, sau đó khớp quá trình gán giá trị trên dữ liệu huấn luyện

Gán giá trị quá mức cho biến mục tiêu

Mô hình học các ước tính được trình bày như thể là kết quả thực tế

Xác định cách xử lý biến mục tiêu riêng biệt và giữ lại các cờ đánh dấu mục tiêu bị thiếu

Bỏ qua các tín hiệu MNAR

Sai lệch hệ thống có thể vẫn tồn tại mà không bị phát hiện

Sử dụng đánh giá chuyên môn theo lĩnh vực, phân tích độ nhạy, và kiểm tra tính nhất quán bên ngoài

Coi các ước tính như dữ kiện đã quan sát được

Báo cáo đánh giá thấp mức độ không chắc chắn

Gắn cờ các ô đã được gán giá trị và thể hiện cách xử lý trong metadata

Chỉ kiểm định một kiểu mất dữ liệu

Một phương pháp có thể thất bại khi gặp tình trạng mất dữ liệu có cấu trúc

Kiểm tra nhiều cơ chế và mức độ nghiêm trọng khác nhau

Các benchmark gần đây trên dữ liệu dạng bảng cho thấy vì sao một điểm số trung bình duy nhất không thể quyết định được lựa chọn. MissBench bao gồm 42 bộ dữ liệu dạng bảng thực tế từ OpenML13 kiểu mất dữ liệu tổng hợp, trong khi IMAGIC-500 đánh giá 14 phương pháp trên năm mức tỷ lệ mất dữ liệu từ 10% đến 50%ba cơ chế. Xem tổng quan benchmark. Các đội ngũ trong lĩnh vực bán lẻ, tài chính, y tế và khảo sát nên kiểm tra những kiểu mất dữ liệu có thể ảnh hưởng đến quyết định của họ.

Các phân tích chuyên sâu cũng cần tuân theo kỷ luật tương tự. Đối với các đầu vào điều tra tài chính chưa đầy đủ, các công cụ phân tích thông minh về tiền mã hóa của Qoory minh họa vì sao chất lượng nguồn dữ liệu và bối cảnh giao dịch phải luôn được hiển thị rõ trong quá trình phân tích. AI Agent của ELECTE áp dụng nguyên tắc này trong các quy trình báo cáo tự động bằng cách mang theo các giả định có nhận thức về cơ chế, cờ đánh dấu gán giá trị, và kết quả kiểm định cùng với mỗi kết quả đầu ra. Nhờ đó, các nhà quản lý có thể biết được liệu một thay đổi được báo cáo phản ánh một giá trị đã quan sát hay chỉ là một ước tính.


Gán giá trị trong bối cảnh kinh doanh bán lẻ và tài chính

Một quản lý ngành hàng bán lẻ theo dõi doanh số theo từng SKU trên các cửa hàng. Các giai đoạn khuyến mãi tạo ra nhu cầu bất thường, trong khi tình trạng hết hàng tạo ra những ngày có rất ít hoặc không có doanh số được ghi nhận. Một giá trị trống có thể có nghĩa là sản phẩm không bán được, sản phẩm không có sẵn, luồng dữ liệu khuyến mãi bị lỗi, hoặc cửa hàng chưa gửi file dữ liệu của mình.

Một quy trình MICE có nhận thức về MAR có thể sử dụng quy mô cửa hàng, khu vực, và tính mùa vụ làm biến dự báo khi các biến này giúp giải thích được bản ghi doanh số nào bị thiếu. Kết quả đầu ra không phải là sự tái tạo kỳ diệu của mọi giao dịch. Nó tạo ra một chuỗi liên tục có thể bảo vệ được để phục vụ dự báo và bổ sung hàng, đồng thời vẫn giữ lại các cờ đánh dấu cho biết nơi nào các ước tính đã được đưa vào dữ liệu.


Các quyết định trong bán lẻ phụ thuộc vào sự phân biệt này

Hãy xem xét hai kết quả sau:

  • Dự báo: Một giai đoạn khuyến mãi bị thiếu có thể kéo nhu cầu dự kiến xuống thấp nếu quy trình xử lý coi khoảng trống đó là con số không.
  • Bổ sung hàng: Một chuỗi doanh số bị đánh giá thấp có thể khuyến khích một đơn đặt hàng đến quá muộn, trong khi một chuỗi bị đánh giá cao lại có thể tạo ra hàng tồn kho dư thừa.
  • Báo cáo: Một bảng điều khiển theo danh mục nên phân biệt nhu cầu yếu với dữ liệu nguồn bị thiếu trước khi các nhà quản lý diễn giải một bảng xếp hạng.

Do đó, mục tiêu đánh giá đúng đắn là sự ổn định của quyết định. Nếu một số kịch bản gán giá trị có thể biện minh được đều cho ra cùng một hướng bổ sung hàng, thì độ tin cậy sẽ tăng lên. Nếu khuyến nghị thay đổi, bảng điều khiển nên làm rõ sự bất định đó thay vì hiển thị một ước tính như thể đó là sự thật.

Lĩnh vực tài chính đặt ra một vấn đề khác. Một nhóm rủi ro AML phát hiện rằng nhiều hồ sơ khách hàng giá trị cao có các trường thông tin việc làm bị bỏ trống vì một biểu mẫu tuân thủ đã thay đổi giữa chu kỳ báo cáo. Một quy tắc dựa trên lĩnh vực chuyên môn có thể xác định trạng thái tự kinh doanh từ các mô hình thu nhập, sau đó kết hợp quy tắc đó với phương pháp gán giá trị dựa trên mô hình cho những hồ sơ có bằng chứng yếu hơn.


Tài chính cần sự hiệu chỉnh và khả năng kiểm toán

Mục tiêu không phải là lấp đầy một cột dữ liệu. Đó là bảo toàn sự hiệu chỉnh của mô hình rủi ro và giảm dương tính giả mà không che giấu sự bất định. Mọi quy tắc cần được ghi chép, kiểm tra đối chiếu với các hồ sơ đã biết, và được nhân viên tuân thủ xem xét.

Đối với các quy trình tài chính và tuân thủ, việc gán giá trị không phải là tư vấn tài chính và không nên thay thế cho việc rà soát pháp lý, quy định hoặc tuân thủ. Các nhóm phải xác nhận rằng cách xử lý của họ phù hợp với các nghĩa vụ hiện hành, chính sách nội bộ và yêu cầu kiểm toán.

Những ví dụ này đều chia sẻ chung một bài học. Giá trị kinh doanh đến từ các quyết định được khôi phục, chứ không phải từ các hàng dữ liệu được khôi phục. Tính liên tục tốt hơn có thể hỗ trợ dự báo, ít cảnh báo không cần thiết hơn có thể giúp các điều tra viên tập trung, và cách xử lý nhất quán có thể rút ngắn chu kỳ báo cáo. Không có kết quả nào trong số đó được đảm bảo chỉ bởi việc gán giá trị. Chúng phụ thuộc vào chẩn đoán cơ chế, thiết kế kiểm định và cơ chế quản trị xung quanh kết quả.


Cách ELECTE Tự Động Hóa Việc Gán Giá Trị Trong Các Quy Trình Phân Tích

Việc gán giá trị thủ công thường thất bại về mặt vận hành vì các nhà phân tích áp dụng các quy tắc khác nhau cho các tệp khác nhau. Một báo cáo có thể sử dụng giá trị trung vị, một báo cáo khác có thể mang giá trị chuyển tiếp, và báo cáo thứ ba có thể loại bỏ các hồ sơ không đầy đủ. Tự động hóa chỉ hữu ích khi nó bảo toàn được lý do đằng sau mỗi phép biến đổi.

ELECTE, một nền tảng phân tích dữ liệu ứng dụng AI dành cho các doanh nghiệp vừa và nhỏ, sử dụng một AI Agent để kiểm tra các mẫu hình dữ liệu thiếu bên trong các tập dữ liệu được tải lên và kết nối cách xử lý với báo cáo tự động. Quy trình dự kiến minh bạch chứ không ẩn giấu: phát hiện khoảng trống, phân loại bằng chứng, định tuyến biến số, và ghi lại những gì đã xảy ra.


Quy trình gồm bốn giai đoạn thực tiễn

  1. Phát hiện: Agent quét các cột, xác định các giá trị bị thiếu, đo lường phân bố của chúng, và kiểm tra mối quan hệ với các trường dữ liệu hiện có.
  2. Phân loại: Nó đánh giá các chỉ báo liên quan đến MCAR, MAR và MNAR, đồng thời nhận thức rằng việc phân loại cơ chế là một phán đoán phân tích chứ không phải một sự đảm bảo.
  3. Định tuyến: Nó gửi các biến số đến một phương pháp phù hợp, chẳng hạn như một mô hình cơ sở cho một mẫu hình đơn giản, một mô hình dựa trên mối quan hệ cho các tín hiệu MAR, hoặc xử lý chuyên biệt và gắn cờ khi xuất hiện rủi ro MNAR.
  4. Báo cáo: Nó tạo ra một tập dữ liệu đã được gán giá trị cùng với thông tin về phương pháp, các giá trị nguồn được giữ lại, và các cờ minh bạch.

Dấu vết kiểm toán đó kết nối trực tiếp với các kết quả kinh doanh. Việc làm mới theo lịch trình có thể giảm bớt công việc chuẩn bị lặp lại, các quy tắc nhất quán có thể ngăn các phòng ban xử lý cùng một trường dữ liệu theo những cách khác nhau, và các cờ hiển thị có thể giảm khả năng một KPI bị lệch lạc đến tay các bên liên quan mà không có bối cảnh đi kèm.


Tự động hóa vẫn cần sự kiểm soát của con người

Một quy trình có trách nhiệm không khóa các nhà phân tích ra ngoài. Người dùng cần có khả năng kiểm tra các con số thô và các con số đã gán giá trị, so sánh các phiên bản tập dữ liệu, xem xét khả năng truy vết nguồn, và ghi đè phương pháp mặc định của agent khi kiến thức chuyên môn ủng hộ một lựa chọn khác.

Việc kết hợp dữ liệu từ nhiều nguồn tạo ra một thách thức vận hành khác. Nếu các bảng khách hàng, giao dịch và sản phẩm được kết nối thông qua các định danh chung, quy trình cần bảo toàn những mối quan hệ đó khi việc gán giá trị diễn ra. Tính năng tích hợp nguồn dữ liệu của ELECTE hỗ trợ một quy trình làm việc kết nối, trong đó nguồn gốc dữ liệu vẫn hiển thị rõ ràng trên toàn bộ dữ liệu được liên kết.

Agent cũng có thể nhúng trạng thái gán giá trị vào bên trong các bảng điều khiển được tạo ra, để một nhà quản lý không chỉ nhìn thấy một KPI mà còn biết liệu chuỗi dữ liệu cơ bản có chứa các giá trị ước tính hay không. Thiết kế đó giữ cho việc tự động hóa hữu ích mà không biến nó thành một hộp đen. Nhà phân tích vẫn chịu trách nhiệm về quyết định, trong khi nền tảng xử lý việc phát hiện, định tuyến, ghi chép và logic làm mới có thể lặp lại.


Những Điểm Chính và Các Bước Tiếp Theo

Việc gán giá trị cho dữ liệu thiếu là một quy trình kiểm soát quyết định. Phương pháp này ảnh hưởng đến việc liệu một nhà quản lý có nhìn thấy sự sụt giảm doanh số thực sự, một lỗi báo cáo, hay một ước tính cần được xem xét lại hay không.

  1. Chẩn đoán trước tiên. Xác định liệu tình trạng thiếu dữ liệu giống với MCAR, MAR hay MNAR. Cơ chế này định hướng những giả định nào có thể chấp nhận được.
  2. Cân đối độ phức tạp với rủi ro. Một mô hình cơ sở đơn giản đã được kiểm định có thể phù hợp cho việc khám phá. Các dự báo, đánh giá rủi ro, tuân thủ và báo cáo cấp điều hành đòi hỏi phải xem xét kỹ lưỡng hơn về các mối quan hệ và sự bất định.
  3. Kiểm định bằng dữ liệu giữ lại. Che giấu các giá trị đã biết, kiểm tra các mẫu hình thiếu dữ liệu hợp lý, và so sánh cách mỗi phương pháp thay đổi quyết định kinh doanh.
  4. Tính đến các yếu tố phụ thuộc. Bao gồm các biến số có liên quan đến cả tình trạng thiếu dữ liệu và giá trị bị thiếu, đặc biệt khi MAR có khả năng xảy ra.
  5. Gắn cờ và ghi chép. Giữ lại các giá trị thô và giá trị đã gán, tên phương pháp, các giả định và dấu thời gian.
  6. Giám sát sự trôi dạt. Một thay đổi về hệ thống hoặc quy trình có thể tạo ra một mẫu hình thiếu dữ liệu mới ngay cả khi nguồn dữ liệu trước đó có vẻ ổn định.


Danh sách kiểm tra bạn có thể áp dụng ngay ngày mai

Bắt đầu với việc kiểm tra ở cấp độ cột. Nhóm các giá trị trống theo cửa hàng, phân khúc khách hàng, khoảng thời gian, hệ thống nguồn và quy trình nghiệp vụ. Đánh dấu các trường dữ liệu nuôi các báo cáo quan trọng, sau đó thiết lập cảnh báo cho những khoảng trống bất thường.

Chạy mô phỏng holdout trên một mẫu đại diện. So sánh phương pháp cơ sở với phương pháp dựa trên mối quan hệ, xem xét phân phối dữ liệu, và hỏi các chủ sở hữu nghiệp vụ xem các ước tính có hỗ trợ hành động hợp lý hay không. Hiển thị phương pháp và mức độ không chắc chắn ngay bên cạnh KPI, thay vì giấu chúng trong một nhật ký kỹ thuật.

Tập trung hóa việc xử lý trong một quy trình tự động. ELECTE kết nối các nguồn dữ liệu nghiệp vụ với báo cáo tự động và thông tin chuyên sâu ứng dụng AI, trong khi việc suy diễn dữ liệu có nhận biết cơ chế và các cờ đánh dấu xử lý hiển thị giúp các nhà phân tích phân biệt những thay đổi được quan sát với các lỗi thu thập dữ liệu. Các nhóm có thể xem lại số liệu thô và số liệu ước tính, giữ lại một đường dẫn ghi đè, và đảm bảo các lần làm mới dữ liệu luôn nhất quán. Các tổ chức đang tìm hiểu những nguyên tắc này có thể xem cách ELECTE áp dụng chúng vào các tập dữ liệu thực tế và quy trình báo cáo.

Bình luận

Chưa có bình luận nào — hãy bắt đầu cuộc trò chuyện.