據(jù)清洗實(shí)戰(zhàn):異常值檢測與處理全流程解析)
1. 項(xiàng)目概述從一道數(shù)學(xué)建模題說起幾年前我接手指導(dǎo)一個(gè)學(xué)生團(tuán)隊(duì)參加全國大學(xué)生數(shù)學(xué)建模競賽CUMCM他們抽到的題目是2011年的A題關(guān)于城市表層土壤重金屬污染分析。拿到數(shù)據(jù)的第一刻團(tuán)隊(duì)里編程最好的同學(xué)就懵了——Excel里密密麻麻的采樣點(diǎn)數(shù)據(jù)夾雜著大量明顯不合理甚至為負(fù)數(shù)的重金屬濃度值。直接拿這樣的數(shù)據(jù)去擬合、做空間插值結(jié)果必然是失真的甚至可能得出“某區(qū)域土壤重金屬含量為負(fù)”這種荒謬結(jié)論。這就是異常值數(shù)據(jù)分析路上第一只也是最常見的“攔路虎”。這個(gè)項(xiàng)目我們就以這個(gè)真實(shí)的數(shù)學(xué)建模賽題為背景用Python這把“手術(shù)刀”來系統(tǒng)性地處理數(shù)據(jù)中的異常值。這不僅僅是刪除幾個(gè)數(shù)字那么簡單它關(guān)乎你后續(xù)所有模型的可信度。無論是數(shù)學(xué)建模、商業(yè)分析還是科研數(shù)據(jù)處理清洗數(shù)據(jù)尤其是識(shí)別并妥善處理異常值是決定項(xiàng)目成敗的第一步。如果你正在為數(shù)據(jù)中的“噪點(diǎn)”頭疼或者想系統(tǒng)學(xué)習(xí)Python在數(shù)據(jù)清洗中的實(shí)戰(zhàn)技巧那么這篇基于真實(shí)項(xiàng)目復(fù)盤的經(jīng)驗(yàn)分享就是為你準(zhǔn)備的。我們將從原理到實(shí)操一步步拆解如何用Pandas、NumPy、Matplotlib等工具像偵探一樣找出數(shù)據(jù)中的“異類”并科學(xué)地決定它們的去留。2. 核心思路為什么不能簡單“一刪了之”面對(duì)異常值新手最容易犯的錯(cuò)誤就是直接刪除。在2011年A題的數(shù)據(jù)里看到“砷(As)”濃度出現(xiàn)一個(gè)“-999”或者“0.001”這種與其他樣本相差幾個(gè)數(shù)量級(jí)的值第一反應(yīng)可能就是把它當(dāng)成錯(cuò)誤數(shù)據(jù)扔掉。但且慢在動(dòng)刀之前我們必須先回答三個(gè)問題它真的是“異常”嗎如果是它為什么會(huì)出現(xiàn)我們應(yīng)該如何處理它2.1 異常值的本質(zhì)與分類異常值或稱離群點(diǎn)是指與數(shù)據(jù)集中其他觀測值顯著不同的數(shù)據(jù)點(diǎn)。這種“不同”可能源于數(shù)據(jù)錄入或測量錯(cuò)誤這是最理想的情況比如儀器故障、記錄筆誤多輸了一個(gè)0、單位混淆把mg/kg記成了g/kg。2011年A題中部分負(fù)值濃度很可能就屬于此類。采樣誤差或?qū)嶒?yàn)變異例如采樣點(diǎn)恰好位于一個(gè)污染源排放口其濃度自然遠(yuǎn)高于背景值。這雖然是“異常”的但卻是真實(shí)的、有價(jià)值的信息直接刪除會(huì)掩蓋重要的污染特征。數(shù)據(jù)本身的自然分布某些數(shù)據(jù)本身就服從重尾分布如金融收益、某些環(huán)境污染物濃度存在極端值是正常的概率事件。因此我們的處理策略絕不能是“一刀切”。處理異常值的核心思路是一個(gè)決策流程檢測 - 診斷 - 處理。檢測是用統(tǒng)計(jì)或可視化方法找出嫌疑點(diǎn)診斷是結(jié)合業(yè)務(wù)背景在數(shù)學(xué)建模中就是題目背景和專業(yè)知識(shí)判斷嫌疑點(diǎn)的性質(zhì)處理則是根據(jù)診斷結(jié)果選擇保留、修正、刪除或用穩(wěn)健方法替代。2.2 數(shù)學(xué)建模場景下的特殊考量在數(shù)學(xué)建模競賽中處理異常值還需額外考慮兩點(diǎn)可解釋性你的處理方法必須在論文中清晰闡述并給出令人信服的理由。直接說“我們刪除了大于3倍標(biāo)準(zhǔn)差的數(shù)據(jù)”是蒼白的必須結(jié)合題目背景如土壤環(huán)境質(zhì)量標(biāo)準(zhǔn)、重金屬的地球化學(xué)背景值來論證閾值設(shè)定的合理性。數(shù)據(jù)完整性競賽數(shù)據(jù)通常有限每一個(gè)樣本都可能攜帶關(guān)鍵信息。盲目刪除可能導(dǎo)致樣本量過小影響后續(xù)建模如插值生成污染分布圖時(shí)邊界出現(xiàn)空洞。因此修正或插補(bǔ)往往是比刪除更優(yōu)的選擇。基于以上思路我們?yōu)楸敬螌?shí)戰(zhàn)設(shè)計(jì)了一個(gè)四步流程首先進(jìn)行探索性數(shù)據(jù)分析EDA可視化異常其次運(yùn)用統(tǒng)計(jì)方法進(jìn)行定量檢測然后結(jié)合背景知識(shí)進(jìn)行診斷與閾值確定最后根據(jù)診斷結(jié)果選擇適當(dāng)?shù)奶幚聿呗圆?shí)現(xiàn)。下面我們就用Python一步步實(shí)現(xiàn)它。3. 環(huán)境準(zhǔn)備與數(shù)據(jù)加載工欲善其事必先利其器。我們首先搭建一個(gè)用于數(shù)據(jù)清洗的Python環(huán)境。我個(gè)人強(qiáng)烈推薦使用Anaconda來管理環(huán)境它能很好地解決包依賴問題。3.1 創(chuàng)建專屬分析環(huán)境打開你的終端或Anaconda Prompt執(zhí)行以下命令來創(chuàng)建一個(gè)純凈的、包含所有必要庫的環(huán)境。# 創(chuàng)建一個(gè)名為data_cleaning的新環(huán)境指定Python版本為3.9兼容性好 conda create -n data_cleaning python3.9 # 激活該環(huán)境 conda activate data_cleaning # 安裝核心數(shù)據(jù)分析庫 conda install pandas numpy matplotlib seaborn scipy jupyter -y # 安裝用于更高級(jí)統(tǒng)計(jì)和插值的庫可選但推薦 conda install scikit-learn statsmodels -y注意如果你沒有安裝Anaconda也可以直接使用pip install命令安裝上述包。但使用虛擬環(huán)境venv或conda env是一個(gè)好習(xí)慣可以避免不同項(xiàng)目間的包版本沖突。3.2 加載與初窺數(shù)據(jù)由于2011年A題的原始數(shù)據(jù)需要從賽題頁面下載這里我模擬生成了一份結(jié)構(gòu)、特征相似的合成數(shù)據(jù)集以便完整演示流程。假設(shè)我們有一個(gè)soil_heavy_metal.csv文件包含采樣點(diǎn)ID、坐標(biāo)X Y以及8種重金屬As, Cd, Cr, Cu, Hg, Ni, Pb, Zn的濃度數(shù)據(jù)。import pandas as pd import numpy as np import matplotlib.pyplot as plt import seaborn as sns # 設(shè)置繪圖風(fēng)格讓圖表更好看 plt.style.use(seaborn-v0_8-darkgrid) sns.set_palette(husl) # 1. 加載數(shù)據(jù) df pd.read_csv(soil_heavy_metal.csv) print(數(shù)據(jù)形狀行列:, df.shape) print(\n前5行數(shù)據(jù)) print(df.head()) print(\n數(shù)據(jù)基本信息) print(df.info()) print(\n描述性統(tǒng)計(jì)) print(df.describe())運(yùn)行這段代碼你會(huì)立刻對(duì)數(shù)據(jù)有個(gè)整體印象有多少行、多少列、是否有缺失值、各重金屬濃度的均值、標(biāo)準(zhǔn)差、最小最大值等。df.describe()輸出的最大值、最小值往往是發(fā)現(xiàn)異常值的第一條線索。比如你看到某元素的最小值是負(fù)數(shù)或者最大值是均值的上千倍紅燈就亮起了。3.3 數(shù)據(jù)質(zhì)量初步檢查在深入分析前先做一次快速體檢。# 檢查缺失值 missing_sum df.isnull().sum() print(各列缺失值數(shù)量\n, missing_sum[missing_sum 0]) if missing_sum.sum() 0: print(數(shù)據(jù)集中暫無缺失值。) # 檢查重復(fù)行 duplicate_rows df.duplicated().sum() print(f\n重復(fù)行數(shù)量{duplicate_rows}) # 檢查明顯不合理的值例如濃度為負(fù) negative_cols [] for col in df.columns: if df[col].dtype in [int64, float64]: # 只檢查數(shù)值列 if (df[col] 0).any(): negative_cols.append(col) print(f\n存在負(fù)值的列{negative_cols}) if negative_cols: for col in negative_cols: neg_count (df[col] 0).sum() print(f {col}: {neg_count} 個(gè)負(fù)值例如{df.loc[df[col] 0, col].iloc[:3].values})這一步能幫你快速抓住最明顯的“硬傷”比如錄入錯(cuò)誤導(dǎo)致的負(fù)值。對(duì)于這些明顯的錯(cuò)誤我們可以在后續(xù)步驟中優(yōu)先處理。4. 異常值檢測可視化與統(tǒng)計(jì)方法雙管齊下檢測異常值我習(xí)慣“先看圖再算數(shù)”。可視化能給你直觀感受統(tǒng)計(jì)方法則提供定量依據(jù)。4.1 可視化檢測讓異常值無所遁形4.1.1 箱線圖Boxplot箱線圖是識(shí)別異常值的經(jīng)典工具。它顯示了數(shù)據(jù)的中位數(shù)、上下四分位數(shù)Q1, Q3以及“須”的范圍。通常落在Q1 - 1.5IQR四分位距以下或Q3 1.5IQR以上的點(diǎn)被視為潛在的異常值在箱線圖中常以圓點(diǎn)形式標(biāo)出。# 繪制所有重金屬濃度的箱線圖 heavy_metal_cols [As, Cd, Cr, Cu, Hg, Ni, Pb, Zn] plt.figure(figsize(14, 8)) df[heavy_metal_cols].boxplot() plt.title(重金屬濃度箱線圖初步識(shí)別異常值) plt.ylabel(濃度 (mg/kg)) plt.xticks(rotation45) plt.tight_layout() plt.show()通過箱線圖你可以一眼看出哪些元素的濃度分布存在大量“飛點(diǎn)”以及這些異常值是偏于高值還是低值。例如Cd鎘可能顯示出較多的高位異常點(diǎn)這很可能對(duì)應(yīng)著局部的強(qiáng)污染源。4.1.2 直方圖與Q-Q圖直方圖看分布形態(tài)Q-Q圖分位數(shù)-分位數(shù)圖檢驗(yàn)數(shù)據(jù)是否服從正態(tài)分布。許多統(tǒng)計(jì)檢測方法如3σ原則基于正態(tài)假設(shè)如果數(shù)據(jù)嚴(yán)重偏離正態(tài)這些方法可能失效。fig, axes plt.subplots(2, 4, figsize(16, 10)) axes axes.ravel() for idx, col in enumerate(heavy_metal_cols): # 直方圖 axes[idx].hist(df[col].dropna(), bins30, edgecolorblack, alpha0.7) axes[idx].set_title(f{col} 分布) axes[idx].set_xlabel(濃度) axes[idx].set_ylabel(頻數(shù)) plt.suptitle(重金屬濃度直方圖, fontsize16) plt.tight_layout() plt.show() # 以As為例繪制Q-Q圖 import scipy.stats as stats plt.figure(figsize(6,6)) stats.probplot(df[As].dropna(), distnorm, plotplt) plt.title(As濃度Q-Q圖檢驗(yàn)正態(tài)性) plt.show()如果直方圖嚴(yán)重右偏長尾在右且Q-Q圖上的點(diǎn)明顯偏離對(duì)角線說明數(shù)據(jù)非正態(tài)。這時(shí)你需要考慮使用基于中位數(shù)和四分位數(shù)的穩(wěn)健方法如箱線圖法而不是基于均值和標(biāo)準(zhǔn)差的方法。4.1.3 散點(diǎn)圖矩陣觀察多個(gè)變量之間的關(guān)系以及是否存在遠(yuǎn)離主體群的觀測點(diǎn)。# 選擇幾個(gè)關(guān)鍵元素繪制散點(diǎn)圖矩陣 sns.pairplot(df[[As, Cd, Pb, Zn]], diag_kindkde, cornerTrue) plt.suptitle(關(guān)鍵重金屬元素散點(diǎn)圖矩陣, y1.02) plt.show()有時(shí)單變量看不是異常但在多變量空間里卻是異常比如As和Cd濃度都異常高。散點(diǎn)圖能幫你發(fā)現(xiàn)這種多維異常。4.2 統(tǒng)計(jì)方法檢測設(shè)定定量閾值可視化給了我們直覺接下來需要用數(shù)字說話。4.2.1 標(biāo)準(zhǔn)差法3σ原則適用于近似正態(tài)分布的數(shù)據(jù)。認(rèn)為99.7%的數(shù)據(jù)落在均值上下3個(gè)標(biāo)準(zhǔn)差的范圍內(nèi)之外的即為異常值。def detect_outliers_std(df, column, n_std3): 使用標(biāo)準(zhǔn)差法檢測異常值 mean df[column].mean() std df[column].std() lower_bound mean - n_std * std upper_bound mean n_std * std outliers df[(df[column] lower_bound) | (df[column] upper_bound)] return outliers, lower_bound, upper_bound # 檢測As的異常值 as_outliers_std, low_std, up_std detect_outliers_std(df, As, n_std3) print(fAs濃度 - 標(biāo)準(zhǔn)差法±3σ:) print(f 邊界[{low_std:.2f}, {up_std:.2f}]) print(f 異常值數(shù)量{len(as_outliers_std)}) print(f 異常值索引示例{as_outliers_std.index[:5].tolist()})4.2.2 箱線圖法IQR法這是一種更穩(wěn)健的方法不依賴于正態(tài)分布假設(shè)對(duì)極端值不敏感。def detect_outliers_iqr(df, column): 使用IQR法檢測異常值 Q1 df[column].quantile(0.25) Q3 df[column].quantile(0.75) IQR Q3 - Q1 lower_bound Q1 - 1.5 * IQR upper_bound Q3 1.5 * IQR outliers df[(df[column] lower_bound) | (df[column] upper_bound)] return outliers, lower_bound, upper_bound # 檢測As的異常值IQR法 as_outliers_iqr, low_iqr, up_iqr detect_outliers_iqr(df, As) print(f\nAs濃度 - IQR法1.5IQR:) print(f 邊界[{low_iqr:.2f}, {up_iqr:.2f}]) print(f 異常值數(shù)量{len(as_outliers_iqr)})實(shí)操心得對(duì)比兩種方法的結(jié)果。對(duì)于嚴(yán)重偏態(tài)的數(shù)據(jù)標(biāo)準(zhǔn)差法可能會(huì)誤將許多正常數(shù)據(jù)判為異常因?yàn)榫当粯O端值拉偏而IQR法通常更可靠。在數(shù)學(xué)建模論文中我建議同時(shí)報(bào)告兩種方法的結(jié)果并解釋為什么最終選擇其中一種例如“由于數(shù)據(jù)呈右偏分布我們采用對(duì)極端值不敏感的IQR法進(jìn)行異常值識(shí)別”。4.2.3 基于模型的方法孤立森林對(duì)于更復(fù)雜的數(shù)據(jù)集可以使用機(jī)器學(xué)習(xí)算法。孤立森林通過隨機(jī)劃分特征空間來隔離樣本異常點(diǎn)因?yàn)椤芭c眾不同”而容易被快速隔離。from sklearn.ensemble import IsolationForest # 假設(shè)我們針對(duì)所有重金屬濃度特征進(jìn)行檢測 X df[heavy_metal_cols].fillna(df[heavy_metal_cols].median()) # 用中位數(shù)填充缺失值 # 初始化并訓(xùn)練孤立森林模型 # contamination參數(shù)估計(jì)異常值比例可根據(jù)箱線圖結(jié)果大致設(shè)定 iso_forest IsolationForest(contamination0.05, random_state42) outlier_labels iso_forest.fit_predict(X) # 標(biāo)記異常值-1表示異常 df[iso_forest_outlier] outlier_labels outlier_count (df[iso_forest_outlier] -1).sum() print(f\n孤立森林檢測出的異常樣本數(shù){outlier_count})孤立森林能捕捉多維異常但解釋性稍差。在數(shù)學(xué)建模中可以作為輔助驗(yàn)證手段不建議作為主要判定依據(jù)因?yàn)檎撐闹行枰逦山忉尩拈撝怠?. 異常值診斷與處理策略制定檢測出的“嫌疑點(diǎn)”名單有了現(xiàn)在進(jìn)入關(guān)鍵的診斷與決策階段。這一步需要結(jié)合題目背景知識(shí)。5.1 診斷它是“錯(cuò)誤”還是“特征”以2011年A題為例我們需要查閱《土壤環(huán)境質(zhì)量 農(nóng)用地土壤污染風(fēng)險(xiǎn)管控標(biāo)準(zhǔn)試行》GB 15618-2018等資料了解各重金屬的背景值范圍和風(fēng)險(xiǎn)篩選值。例如某區(qū)域土壤砷的背景值可能在5-15 mg/kg如果檢測到一個(gè)200 mg/kg的點(diǎn)它很可能是一個(gè)真實(shí)的高污染點(diǎn)特征而非錯(cuò)誤。反之一個(gè)-1 mg/kg的值顯然是錯(cuò)誤。診斷流程對(duì)照物理/化學(xué)極限濃度不能為負(fù)通常有檢測下限。負(fù)值和低于檢測下限的異常低值可初步判定為錯(cuò)誤。對(duì)照背景值或標(biāo)準(zhǔn)值查閱文獻(xiàn)或國家標(biāo)準(zhǔn)了解該區(qū)域該元素的正常范圍。遠(yuǎn)超正常范圍上限的可能是污染點(diǎn)遠(yuǎn)低于下限的可能是分析誤差或特殊地質(zhì)背景。空間關(guān)聯(lián)分析在地圖上標(biāo)出異常點(diǎn)。如果高值點(diǎn)聚集在工業(yè)區(qū)、交通干線附近則很可能是真實(shí)污染如果孤立且遠(yuǎn)離任何潛在源則錯(cuò)誤可能性增大。元素比值分析某些重金屬之間存在穩(wěn)定的地球化學(xué)比值。計(jì)算異常點(diǎn)的元素比值如Pb/Zn Cu/Ni看是否偏離區(qū)域背景比值輔助判斷。# 示例結(jié)合空間位置分析異常值 # 假設(shè)df中有X, Y坐標(biāo)列 as_outliers, _, _ detect_outliers_iqr(df, As) plt.figure(figsize(10, 8)) # 繪制所有采樣點(diǎn) plt.scatter(df[X], df[Y], cblue, alpha0.5, label正常點(diǎn), s20) # 高亮標(biāo)注As異常點(diǎn) plt.scatter(as_outliers[X], as_outliers[Y], cred, marker^, s100, labelAs異常點(diǎn) (IQR法)) plt.xlabel(X坐標(biāo)) plt.ylabel(Y坐標(biāo)) plt.title(As濃度異常點(diǎn)空間分布) plt.legend() plt.grid(True, alpha0.3) plt.tight_layout() plt.show()5.2 處理策略選擇根據(jù)診斷結(jié)果選擇處理方式診斷結(jié)果可能原因推薦處理策略Python實(shí)現(xiàn)思路明顯錯(cuò)誤錄入錯(cuò)誤、儀器故障、負(fù)值、低于檢測限的零值刪除或修正直接刪除行或用np.nan標(biāo)記后插補(bǔ)真實(shí)異常污染點(diǎn)局部強(qiáng)污染源保留但單獨(dú)分析保留數(shù)據(jù)在后續(xù)建模中可作為重點(diǎn)研究對(duì)象或使用穩(wěn)健統(tǒng)計(jì)方法如中位數(shù)真實(shí)異常自然極端數(shù)據(jù)本身重尾分布保留或穩(wěn)健處理使用對(duì)數(shù)變換、Box-Cox變換使數(shù)據(jù)更接近正態(tài)或使用非參數(shù)方法不確定信息不足無法判斷多重插補(bǔ)或標(biāo)記用多重插補(bǔ)法生成多個(gè)可能值或創(chuàng)建布爾列標(biāo)記為“可疑點(diǎn)”在數(shù)學(xué)建模中的建議對(duì)于明顯錯(cuò)誤在論文中明確說明“我們發(fā)現(xiàn)了N個(gè)負(fù)值/零值數(shù)據(jù)點(diǎn)這些在物理意義上不可能判定為錄入錯(cuò)誤予以刪除。”對(duì)于疑似真實(shí)高值不要輕易刪除可以這樣處理“識(shí)別出M個(gè)顯著高于背景值的采樣點(diǎn)如As X mg/kg。經(jīng)查這些點(diǎn)均位于歷史工業(yè)區(qū)附近我們認(rèn)為是真實(shí)污染予以保留。在后續(xù)空間插值時(shí)我們采用了穩(wěn)健的克里金方法以降低這些極端值對(duì)整體插值面的過度影響。”穩(wěn)健性處理在計(jì)算區(qū)域平均濃度、進(jìn)行相關(guān)性分析時(shí)使用中位數(shù)和Spearman秩相關(guān)代替均值和Pearson相關(guān)它們對(duì)異常值不敏感。6. 異常值處理實(shí)操Python代碼實(shí)現(xiàn)現(xiàn)在我們將診斷決策轉(zhuǎn)化為具體的Python操作。假設(shè)我們對(duì)As列的診斷結(jié)果是負(fù)值均為錯(cuò)誤予以刪除部分極高值 Q3 3IQR為真實(shí)污染保留但標(biāo)記其他IQR法檢測出的高值用中位數(shù)插補(bǔ)。6.1 處理明顯錯(cuò)誤如負(fù)值# 記錄原始數(shù)據(jù)形狀 original_shape df.shape print(f原始數(shù)據(jù)形狀{original_shape}) # 1. 處理負(fù)值直接刪除或設(shè)為NaN # 假設(shè)我們判定所有負(fù)值為錯(cuò)誤 for col in heavy_metal_cols: # 首先查看負(fù)值情況 neg_mask df[col] 0 if neg_mask.any(): print(f在 {col} 列中發(fā)現(xiàn) {neg_mask.sum()} 個(gè)負(fù)值正在刪除對(duì)應(yīng)行...) # 刪除任何重金屬濃度為負(fù)的整行數(shù)據(jù)因?yàn)橐粋€(gè)點(diǎn)采樣所有元素?cái)?shù)據(jù)應(yīng)同進(jìn)退 df df[~neg_mask] print(f刪除負(fù)值后數(shù)據(jù)形狀{df.shape}) print(f共刪除 {original_shape[0] - df.shape[0]} 行。)6.2 處理疑似異常高值分情況處理# 2. 識(shí)別并分情況處理高異常值 # 2.1 使用更嚴(yán)格的IQR邊界如3倍IQR識(shí)別“極端高值”我們認(rèn)為是真實(shí)污染保留但標(biāo)記。 def get_extreme_high_outliers(df, column, iqr_multiplier3): Q1 df[column].quantile(0.25) Q3 df[column].quantile(0.75) IQR Q3 - Q1 upper_bound_extreme Q3 iqr_multiplier * IQR extreme_outliers df[df[column] upper_bound_extreme] return extreme_outliers, upper_bound_extreme # 以As為例 as_extreme, as_extreme_bound get_extreme_high_outliers(df, As, iqr_multiplier3) print(f\nAs濃度極端高值 Q33IQR {as_extreme_bound:.2f}數(shù)量{len(as_extreme)}) print(這些點(diǎn)將被保留并標(biāo)記為‘真實(shí)污染點(diǎn)’。) # 在數(shù)據(jù)框中添加標(biāo)記列 df[As_extreme_high] df[As] as_extreme_bound # 2.2 對(duì)于普通高異常值Q31.5IQR value Q33IQR我們認(rèn)為是可能的誤差或輕度異常用中位數(shù)插補(bǔ)。 as_normal_outliers, low_bound, up_bound detect_outliers_iqr(df, As]) # 1.5IQR邊界 # 注意這里的as_normal_outliers包含了極端高值我們需要排除它們 as_normal_outliers as_normal_outliers[~as_normal_outliers[As_extreme_high]] if not as_normal_outliers.empty: print(f\nAs濃度普通高異常值1.5IQR value 3IQR數(shù)量{len(as_normal_outliers)}) print(這些點(diǎn)將用該列中位數(shù)進(jìn)行插補(bǔ)。) # 計(jì)算中位數(shù)排除極端高值避免被它們拉高 median_as df.loc[~df[As_extreme_high], As].median() # 記錄原始值便于追溯 df[As_original] df[As].copy() # 進(jìn)行插補(bǔ) df.loc[as_normal_outliers.index, As] median_as print(f用于插補(bǔ)的中位數(shù)為{median_as:.4f}) else: print(\n未發(fā)現(xiàn)需要插補(bǔ)的普通高異常值。)6.3 處理其他元素的異常值我們可以將上述邏輯封裝成函數(shù)批量處理所有重金屬列。def process_column_outliers(df, column_name, extreme_multiplier3, normal_multiplier1.5): 處理單列異常值 1. 負(fù)值已在前一步刪除此處不考慮。 2. 識(shí)別極端高值 Q3extreme_multiplier*IQR保留并標(biāo)記。 3. 識(shí)別普通高異常值Q3normal_multiplier*IQR value Q3extreme_multiplier*IQR用中位數(shù)插補(bǔ)。 # 創(chuàng)建標(biāo)記列 extreme_flag_col f{column_name}_extreme_high original_col f{column_name}_original # 計(jì)算邊界 Q1 df[column_name].quantile(0.25) Q3 df[column_name].quantile(0.75) IQR Q3 - Q1 upper_bound_extreme Q3 extreme_multiplier * IQR upper_bound_normal Q3 normal_multiplier * IQR # 標(biāo)記極端高值 df[extreme_flag_col] df[column_name] upper_bound_extreme # 識(shí)別普通高異常值在正常邊界和極端邊界之間且未被標(biāo)記為極端 normal_high_mask (df[column_name] upper_bound_normal) (df[column_name] upper_bound_extreme) (~df[extreme_flag_col]) # 保存原始值 if original_col not in df.columns: df[original_col] df[column_name] # 插補(bǔ)普通高異常值 if normal_high_mask.any(): # 使用非極端值的中位數(shù)進(jìn)行插補(bǔ) median_val df.loc[~df[extreme_flag_col], column_name].median() df.loc[normal_high_mask, column_name] median_val print(f {column_name}: 插補(bǔ)了 {normal_high_mask.sum()} 個(gè)普通高異常值使用中位數(shù) {median_val:.4f}) else: print(f {column_name}: 無普通高異常值需插補(bǔ)。) # 返回極端高值數(shù)量和信息 extreme_count df[extreme_flag_col].sum() return extreme_count, upper_bound_extreme print(\n--- 開始批量處理各重金屬列 ---) for col in heavy_metal_cols: if col in df.columns: # 確保列還存在未被刪除 extreme_cnt, bound process_column_outliers(df, col, extreme_multiplier3, normal_multiplier1.5) print(f {col}: 保留了 {extreme_cnt} 個(gè)極端高值 {bound:.2f}視為潛在污染點(diǎn)。)6.4 處理后的數(shù)據(jù)驗(yàn)證與保存處理完成后務(wù)必驗(yàn)證數(shù)據(jù)質(zhì)量并保存清洗后的數(shù)據(jù)。# 驗(yàn)證再次繪制箱線圖觀察異常值處理效果 plt.figure(figsize(14, 8)) df[heavy_metal_cols].boxplot() plt.title(異常值處理后重金屬濃度箱線圖) plt.ylabel(濃度 (mg/kg)) plt.xticks(rotation45) plt.tight_layout() plt.show() # 查看處理摘要 print(\n 數(shù)據(jù)處理摘要 ) print(f最終數(shù)據(jù)形狀{df.shape}) print(\n各列極端高值真實(shí)污染點(diǎn)數(shù)量) extreme_cols [col for col in df.columns if _extreme_high in col] for col in extreme_cols: metal col.replace(_extreme_high, ) count df[col].sum() print(f {metal}: {count}) # 保存清洗后的數(shù)據(jù) output_file soil_heavy_metal_cleaned.csv df.to_csv(output_file, indexFalse) print(f\n清洗后的數(shù)據(jù)已保存至{output_file})7. 高級(jí)話題與常見問題排查在實(shí)際操作中你肯定會(huì)遇到比教程更復(fù)雜的情況。下面分享一些進(jìn)階技巧和踩坑經(jīng)驗(yàn)。7.1 缺失值、異常值與插補(bǔ)的協(xié)同處理很多時(shí)候數(shù)據(jù)集中同時(shí)存在缺失值NaN和異常值。處理順序很重要。我推薦的流程是標(biāo)記異常值先用IQR或業(yè)務(wù)規(guī)則找出異常值但不急于修改或刪除只是新增一個(gè)布爾列進(jìn)行標(biāo)記。處理缺失值對(duì)缺失值進(jìn)行插補(bǔ)。關(guān)鍵點(diǎn)插補(bǔ)時(shí)應(yīng)排除那些被標(biāo)記為異常值的樣本避免用異常值去影響插補(bǔ)模型。例如用KNN插補(bǔ)時(shí)特征矩陣中不應(yīng)包含異常值樣本。處理異常值根據(jù)診斷對(duì)標(biāo)記的異常值進(jìn)行刪除、修正或保留操作。# 示例在插補(bǔ)缺失值時(shí)排除異常值 from sklearn.impute import KNNImputer # 假設(shè)我們已經(jīng)有了‘As_is_extreme’標(biāo)記列 # 1. 創(chuàng)建用于插補(bǔ)的數(shù)據(jù)副本并將極端異常值暫時(shí)設(shè)為NaN不參與建模 df_for_impute df[heavy_metal_cols].copy() for col in heavy_metal_cols: extreme_flag f{col}_extreme_high if extreme_flag in df.columns: df_for_impute.loc[df[extreme_flag], col] np.nan # 2. 使用KNN插補(bǔ)缺失值現(xiàn)在包括原始的缺失值和被我們暫時(shí)設(shè)為NaN的異常值位置 imputer KNNImputer(n_neighbors5) df_imputed_array imputer.fit_transform(df_for_impute) df_imputed pd.DataFrame(df_imputed_array, columnsheavy_metal_cols, indexdf.index) # 3. 將插補(bǔ)后的值填回原數(shù)據(jù)集僅填充原為NaN或我們暫時(shí)設(shè)為NaN的位置 for col in heavy_metal_cols: mask_original_missing df[col].isna() mask_extreme_set_nan df_for_impute[col].isna() ~mask_original_missing fill_mask mask_original_missing | mask_extreme_set_nan df.loc[fill_mask, col] df_imputed.loc[fill_mask, col]7.2 基于業(yè)務(wù)規(guī)則的定制化檢測統(tǒng)計(jì)方法有其局限性必須結(jié)合領(lǐng)域知識(shí)。例如在環(huán)境領(lǐng)域常用“背景值幾何標(biāo)準(zhǔn)差”的方法。def detect_outliers_geometric(df, column, log_base10, n_std2): 基于對(duì)數(shù)正態(tài)分布假設(shè)的異常值檢測。 適用于濃度等通常呈對(duì)數(shù)正態(tài)分布的環(huán)境數(shù)據(jù)。 # 取對(duì)數(shù)處理前確保沒有0或負(fù)值 data_log np.log10(df[column].clip(lower1e-10)) # clip避免0 geometric_mean np.power(10, data_log.mean()) geometric_std np.power(10, data_log.std()) lower_bound geometric_mean / (geometric_std ** n_std) upper_bound geometric_mean * (geometric_std ** n_std) outliers df[(df[column] lower_bound) | (df[column] upper_bound)] return outliers, lower_bound, upper_bound # 使用示例 as_outliers_geo, low_geo, up_geo detect_outliers_geometric(df, As, n_std2) print(f幾何法檢測2倍幾何標(biāo)準(zhǔn)差邊界[{low_geo:.2f}, {up_geo:.2f}]) print(f異常值數(shù)量{len(as_outliers_geo)})7.3 常見問題與排查技巧實(shí)錄問題1處理后的數(shù)據(jù)分布嚴(yán)重變形現(xiàn)象箱線圖顯示數(shù)據(jù)被“壓扁”在一個(gè)很窄的范圍內(nèi)失去了變異信息。原因可能過于激進(jìn)地刪除了大量“異常值”或者用中位數(shù)/均值插補(bǔ)了太多點(diǎn)。排查檢查異常值檢測的閾值是否過嚴(yán)如用了2σ而非3σ。回顧診斷步驟確認(rèn)被處理的是否大部分是“真實(shí)錯(cuò)誤”而非“真實(shí)特征”。解決放寬閾值或?qū)Α耙伤普鎸?shí)異常”采用更保守的處理方式如Winsorizing縮尾法僅將極端值替換為指定分位數(shù)而非全部替換為中位數(shù)。def winsorize_column(series, limits(0.05, 0.05)): 縮尾處理將兩端極端值替換為指定分位數(shù) from scipy.stats.mstats import winsorize # limits(0.05, 0.05) 表示將最低5%和最高5%的值縮尾 winsorized_data winsorize(series, limitslimits) return pd.Series(winsorized_data, indexseries.index) # 對(duì)As列進(jìn)行5%縮尾處理 df[As_winsorized] winsorize_column(df[As], limits(0.05, 0.05))問題2多變量異常檢測結(jié)果與單變量不一致現(xiàn)象用孤立森林找出的異常點(diǎn)在單個(gè)變量的箱線圖上看起來并不極端。原因該樣本在所有單變量維度上都正常但多個(gè)變量的組合關(guān)系異常例如Cd濃度中等Pb濃度中等但兩者的比值異常高。排查檢查這些樣本在多維散點(diǎn)圖或降維圖如PCA得分圖上的位置。解決這類異常點(diǎn)可能揭示了特殊污染類型或數(shù)據(jù)質(zhì)量問題需要結(jié)合空間位置和背景知識(shí)深入分析不能簡單忽略。問題3處理后后續(xù)建模如克里金插值在異常點(diǎn)位置出現(xiàn)“空洞”或“尖峰”現(xiàn)象刪除異常點(diǎn)后插值圖在該區(qū)域出現(xiàn)空白保留極端高值則產(chǎn)生不合理的“污染島”。原因空間插值方法對(duì)數(shù)據(jù)密度和極值敏感。解決對(duì)于刪除的點(diǎn)考慮使用考慮變量相關(guān)性的多重插補(bǔ)方法在刪除點(diǎn)位置生成合理的估計(jì)值再參與插值。對(duì)于保留的極端點(diǎn)在插值時(shí)使用穩(wěn)健變異函數(shù)Robust Variogram估計(jì)它受極端值影響小。或者在插值前對(duì)數(shù)據(jù)進(jìn)行對(duì)數(shù)轉(zhuǎn)換以緩和極端值的影響。# 使用Ordinary Kriging插值前進(jìn)行對(duì)數(shù)轉(zhuǎn)換 df[As_log] np.log1p(df[As]) # log1p log(1x)避免x0的問題 # 或者使用穩(wěn)健變異函數(shù)需要專業(yè)地統(tǒng)計(jì)學(xué)庫如pykrige或gstools # 這里以概念為例問題4自動(dòng)化腳本在處理新數(shù)據(jù)集時(shí)效果不佳現(xiàn)象為2011年數(shù)據(jù)寫的處理流程用在2012年數(shù)據(jù)上要么漏掉很多異常值要么把正常值誤殺了。原因不同數(shù)據(jù)集的數(shù)據(jù)分布、量級(jí)、背景值可能不同。硬編碼的閾值如固定倍數(shù)IQR不具備普適性。解決將閾值參數(shù)化并編寫一個(gè)數(shù)據(jù)質(zhì)量報(bào)告生成函數(shù)在新數(shù)據(jù)上先運(yùn)行報(bào)告人工審查建議的閾值再進(jìn)行調(diào)整。def generate_data_quality_report(df, numeric_cols): 生成數(shù)據(jù)質(zhì)量報(bào)告輔助設(shè)定閾值 report {} for col in numeric_cols: desc df[col].describe(percentiles[.01, .05, .25, .5, .75, .95, .99]) Q1, Q3 desc[25%], desc[75%] IQR Q3 - Q1 report[col] { mean: desc[mean], std: desc[std], min: desc[min], 1%: desc[1%], 5%: desc[5%], median: desc[50%], 95%: desc[95%], 99%: desc[99%], max: desc[max], IQR: IQR, 建議箱線圖法上限 (Q31.5IQR): Q3 1.5 * IQR, 建議箱線圖法下限 (Q1-1.5IQR): Q1 - 1.5 * IQR, 偏度: df[col].skew(), 峰度: df[col].kurtosis() } report_df pd.DataFrame(report).T return report_df # 生成報(bào)告 quality_report generate_data_quality_report(df, heavy_metal_cols) print(quality_report[[min, 1%, 建議箱線圖法下限, median, 建議箱線圖法上限, 99%, max, 偏度]])這份報(bào)告能幫你快速了解每個(gè)變量的分布特別是“偏度”指標(biāo)。如果偏度遠(yuǎn)大于0右偏那么基于均值的標(biāo)準(zhǔn)差法就可能不適用報(bào)告中的百分位數(shù)1% 99%和箱線圖法建議邊界能給你更合理的調(diào)整起點(diǎn)。數(shù)據(jù)處理尤其是異常值處理從來不是一道有標(biāo)準(zhǔn)答案的數(shù)學(xué)題。它混合了統(tǒng)計(jì)學(xué)、領(lǐng)域知識(shí)和實(shí)際經(jīng)驗(yàn)。在數(shù)學(xué)建模中清晰記錄你的處理流程、每一步的理由以及參數(shù)選擇的依據(jù)比追求一個(gè)“完美”的結(jié)果更重要。因?yàn)樵u(píng)審專家看的正是你面對(duì)真實(shí)、混亂數(shù)據(jù)時(shí)所展現(xiàn)出的科學(xué)決策能力和嚴(yán)謹(jǐn)態(tài)度。希望這篇長文能為你提供一套可復(fù)現(xiàn)、可解釋的方法論工具箱。