
做數據分析的人經常遇到一個場景從網上下載了一份看起來很規整的數據集比如 Airbnb Listings打開一看密密麻麻的字段有價格、有評論、有坐標、有房東信息。你以為接下來可以直接建模了結果df.info()一跑發現價格是字符串、缺失值占了三成、同一套房源重復出現了五次甚至還有經緯度在海洋里的數據。這時候才意識到真正決定分析項目成敗的往往不是后面用了什么高級模型而是前面這兩個環節數據清洗Data Cleaning和數據整形Data Shaping。這篇文章就以 Airbnb Listings 數據集為例完整拆解一份原始房源數據從“沒法用”到“能用、好用”的全過程。我們會先講清楚清洗和整形各自解決什么問題再給出可復制的 Python 代碼最后補充實際項目中的排查思路和工程建議。讀完這篇文章你不僅會處理 Airbnb 數據還能把同樣的方法遷移到電商商品、招聘信息、二手房掛牌等其他表格型數據集上。1. 這篇文章真正要解決的問題很多初學者對數據清洗有個誤會覺得它就是“刪掉空值”“去一下重復”屬于體力活沒什么技術含量。但真實項目里數據清洗和整形往往是耗時最久、最容易出錯、也最影響最終結論質量的環節。曾有統計說數據分析師 60% 以上的時間花在數據準備上這個比例放在 Airbnb 這類真實數據集上一點都不夸張。Airbnb Listings 數據集之所以適合拿來學習是因為它具備真實業務數據的幾乎所有典型問題字段類型錯亂價格列里包含了$、,甚至可能是$1,200.00這種格式pandas 默認讀進來是字符串。缺失值復雜有些字段缺失是可以直接刪的有些字段缺失需要填充還有些字段缺失本身就是一種業務信號。重復數據同一房源可能因為房東多次更新、爬蟲重復抓取而出現多行記錄。異常值價格可能填成了 0評論數可能是天文數字經緯度可能完全偏離城市范圍。存儲格式不適合分析日期是字符串、臥室數寫在文本里、多個設施用逗號拼在一個單元格里比如WiFi,Kitchen,Heating。如果跳過這些問題直接建模輕則指標失真重則整個分析結論被帶偏。比如價格列不轉成數值df[price].mean()就會直接報錯如果錯誤地忽略了重復項統計房源數量時會虛高如果不對異常價格做處理中位數可能被幾個極端值拉到一個完全不符合市場認知的位置。這篇文章要解決的問題就是建立一套可復用的 Airbnb Listings 數據清洗與數據整形流程。我們會從最原始的 CSV 文件開始一步一步完成數據加載、字段檢查、缺失值處理、重復值處理、異常值處理、類型轉換、特征提取和寬表轉長表。每一步都會解釋“為什么這么做”而不是只給代碼。2. 數據清洗與數據整形到底差在哪先做一個概念區分。很多文章把 Data Cleaning 和 Data Shaping 混在一起講但在工程實踐中它們的職責邊界很清晰。數據清洗Data Cleaning解決的是“數據對不對”的問題。它處理的是臟數據包括缺失值、重復值、異常值、格式錯誤、類型錯誤、不一致的取值等。清洗的目標是讓每一行數據真實、準確、可比較。比如把$100.00變成100.0把3 beds變成3把明顯偏離城市范圍的經緯度刪除這些都是清洗。數據整形Data Shaping解決的是“數據好不好用”的問題。它處理的是數據的組織方式包括列的選擇與重命名、行與列的轉換、從現有字段中提取新特征、把寬表變長表、把長表變寬表等。整形不改變數據本身的真實性但會改變數據的結構讓它更適合后續可視化、建模或統計分析。比如從last_review日期中提取出年份和月份把amenities從逗號分隔的字符串拆成多個布爾列把每個房源的多個設施記錄從一行展開成多行這些都是整形。可以用一句話概括清洗是把數據變干凈整形是把數據變順手。實際項目中這兩個步驟往往是交替進行的。比如你發現price列有缺失值這是清洗問題但如果你想把價格按照neighbourhood_group分組填充中位數這又涉及分組和轉換屬于整形的思路。所以本文不會強行把它們割裂成兩條互不相干的流程而是按照“先清洗后整形”的順序組織這樣對新手最友好。下面用一個表格對比它們的核心差異對比維度數據清洗Data Cleaning數據整形Data Shaping核心問題數據對不對數據好不好用主要操作處理缺失值、重復值、異常值、類型轉換列選、重命名、行列轉換、特征提取典型字段price、last_review、coordinatesamenities、host_verifications、date失敗后果分析結果失真分析無法開展或效率低判斷標準每一行數據真實可靠數據結構適合當前分析任務3. 環境準備與數據集說明整個流程只需要 Python 環境和 pandas 庫不需要額外安裝機器學習框架。建議在虛擬環境中操作避免依賴沖突。以下是我推薦的安裝方式python -m venv venv source venv/bin/activate # Windows 下使用 venv\Scripts\activate pip install pandas numpy jupyter版本方面pandas 的 1.x 和 2.x 都支持本文代碼具體以你本機安裝的版本為準。如果是在 Jupyter Notebook 里操作記得把代碼按單元格拆開執行方便隨時查看中間結果。數據集方面本文以 Airbnb 公開的 Listings 數據集為例。這類數據一般以 CSV 格式提供包含房源 ID、房東 ID、價格、房間類型、經緯度、評論數、最低住宿晚數、發布日期等幾十個字段。你可以在 Airbnb 官方的公開數據頁面獲取也可以使用 Kaggle 和 Inside Airbnb 上的版本。不同渠道的字段略有差異但核心字段基本一致本文代碼會在讀取數據后先做字段概覽所以即使字段名不完全相同也能快速調整。需要特別說明的是本文不會依賴某個特定版本的 CSV 文件。真實項目中你拿到的數據字段可能比我這里演示的多或少但只要掌握了“先概覽、再清洗、后整形”的思路任何版本的 Airbnb Listings 數據都能處理。4. Airbnb Listings 數據清洗核心流程拆解從這一節開始進入正題。我們先讀取數據并做初步體檢然后按照“缺失值 → 重復值 → 異常值 → 類型轉換”的順序完成清洗。4.1 讀取數據并做初步體檢拿到 CSV 后的第一件事不是急著清洗而是先搞清楚數據長什么樣。建議按下面的代碼先做一輪快速體檢import pandas as pd import numpy as np # 讀取數據 df pd.read_csv(listings.csv) # 先看行列數 print(數據集形狀:, df.shape) # 看前幾行了解字段類型和大概內容 print(df.head(3).T) # 看字段類型 print(df.dtypes) # 看缺失情況 print(df.isnull().sum().sort_values(ascendingFalse).head(20))這里head(3).T是為了把一行數據轉置成豎排方便觀察每個字段的值。dtypes能告訴我們哪些字段被讀成了對象類型哪些是數值類型。isnull().sum()則是看缺失值分布。這一步跑完你通常會看到兩種情況很多字段是object類型比如price、last_review、amenities。缺失值集中在少數幾個字段比如last_review、review_scores_rating、neighbourhood_group。在這個階段不需要做任何處理先記錄觀察結果再進入下一步。4.2 缺失值處理先分類再決定策略缺失值處理的錯誤做法是直接dropna()一把梭。很多新手對所有缺失字段統一刪除結果把數據集刪得只剩一半或者把有業務含義的缺失變成無意義的數據損失。正確的做法是先回答三個問題這個字段的缺失占比是多少這個字段后續分析中是否需要用到缺失本身有沒有業務含義比如在 Airbnb 數據中id、host_id、price這些關鍵字段如果缺失通常建議刪除對應行因為無法填充且影響核心分析。neighbourhood_group缺失但latitude、longitude存在時可以考慮通過逆地理編碼補全或者直接標記為“未知區域”。last_review缺失往往意味著該房源從未收到過評論這是一個有業務含義的信號不應該簡單刪除而應該在整形階段用 0 或“無評論”標記。review_scores_rating缺失如果該房源評論數為 0那缺失是合理的不需要強行填一個分數。下面是一個實用的處理策略示例# 先看關鍵字段缺失比例 key_cols [id, host_id, price, last_review, review_scores_rating] missing_ratio df[key_cols].isnull().mean().sort_values(ascendingFalse) print(missing_ratio) # 策略1核心標識字段缺失直接刪除 df df.dropna(subset[id, host_id, price]) # 策略2對評分類字段先看評論數評論數為0則缺失合理 # 將缺失評分填充為0表示暫無評分 df[review_scores_rating] df[review_scores_rating].fillna(0) # 策略3last_review 缺失填充為 NaT后續整形時轉為“無評論” df[last_review] pd.to_datetime(df[last_review], errorscoerce)這里的關鍵點是先給缺失值定性再選擇刪除、填充還是保留。如果缺失字段用于建模且缺失比例超過 50%基本可以放棄該字段如果缺失集中在少數行直接刪除這些行更省事如果缺失字段具有業務含義就不要強行填充。4.3 重復值處理不能只按整行去重數據去重也有坑。df.drop_duplicates()默認按整行完全重復來判斷但實際業務場景中Airbnb 房源很可能只是部分字段重復。舉例來說同一個房源被爬蟲抓取了兩次可能id、host_id、price完全相同但last_review因為抓取時間不同而不同。這時如果按整行去重根本去不掉。正確做法是選定一組關鍵字段作為去重依據。# 方案1按整行去重 df df.drop_duplicates() # 方案2按房源ID去重保留最后一次抓取記錄 df df.sort_values(last_scraped, ascendingFalse).drop_duplicates(subset[id], keepfirst)如果數據里沒有last_scraped字段就按id去重并保留第一條即可df df.drop_duplicates(subset[id], keepfirst)去重之后記得重置索引df df.reset_index(dropTrue)這里需要說明drop_duplicates的subset參數很靈活。比如你想知道同一個房東是不是重復發布了同樣的房源可以把host_id和name組合起來判斷。這個決策完全取決于業務上如何定義“重復”。4.4 異常值處理用業務常識圈定合理范圍異常值的判定不能只靠統計方法還必須結合業務常識。Airbnb 數據里有幾個典型場景價格字段中price為 0 是明顯異常的。即使是免費房源也會用特殊字段標識不會直接把價格寫成 0。price高達幾萬美元而房間類型只是“Private room”也很可疑。這類極端值會嚴重影響后續的均值計算。處理思路是先看分布print(df[price].describe())然后結合業務常識設定合理范圍。比如可以認為正常房源的單晚價格應該在 10 到 2000 美元之間超出這個區間單獨檢查而不是直接一刀切。# 先轉成數值 df[price] df[price].replace([\$,], , regexTrue).astype(float) # 查看異常分布 print(df[price].describe(percentiles[0.01, 0.05, 0.5, 0.95, 0.99])) # 用業務閾值過濾 df df[(df[price] 10) (df[price] 2000)]經緯度也可以用業務常識判斷。比如目標城市是紐約那么緯度應該在 40.5 到 41.0 之間經度應該在 -74.3 到 -73.5 之間。超出這個范圍的數據要么是抓取錯誤要么是坐標漂移。df df[(df[latitude].between(40.5, 41.0)) (df[longitude].between(-74.3, -73.5))]這種基于業務范圍過濾的方式比單純靠 3σ 原則更加穩健因為你是在用領域知識約束數據而不是讓數據自己定義“正常”。4.5 類型轉換用pd.to_numeric和pd.to_datetime收尾清洗的最后一步是類型轉換。pandas 在讀 CSV 時經常把數值列讀成字符串尤其是包含貨幣符號、千分位分隔符時更是如此。# 價格轉數值前面已經做過 df[price] df[price].replace([\$,], , regexTrue).astype(float) # 評論數轉數值 df[number_of_reviews] pd.to_numeric(df[number_of_reviews], errorscoerce) # 日期轉 datetime df[last_review] pd.to_datetime(df[last_review], errorscoerce) # 最低住宿晚數轉整數 df[minimum_nights] pd.to_numeric(df[minimum_nights], errorscoerce).astype(Int64)這里要注意errorscoerce的作用。它會把無法轉換的值變成NaN而不是直接報錯中斷。這在真實數據集中非常重要因為你永遠不知道 CSV 里會混進什么奇怪內容。轉換之后再次用df.dtypes檢查確保關鍵字段都變成了float64、datetime64[ns]等對應類型。5. Airbnb Listings 數據整形與特征工程實戰清洗完成之后數據已經“干凈”了但還不一定“好用”。這一節我們專注于數據整形目標是把原始字段轉換成更利于分析的結構。5.1 列選擇與重命名Airbnb Listings 原始數據可能有 70 多個字段但實際分析往往只需要其中十幾個。建議先做一次列選擇避免后面代碼頻繁在字段名上打轉。# 只保留分析需要的字段 cols [ id, host_id, host_name, neighbourhood_group, neighbourhood, latitude, longitude, room_type, price, minimum_nights, number_of_reviews, last_review, reviews_per_month, calculated_host_listings_count, availability_365 ] df df[cols] # 重命名為更簡潔、更符合 Python 習慣的列名 df df.rename(columns{ neighbourhood_group: district, calculated_host_listings_count: host_listings_count, availability_365: available_days, number_of_reviews: review_count })重命名時推薦使用小寫下劃線的命名規范這樣可以減少后續寫代碼時的大寫切換。列名本身就是代碼的一部分一個好的列名能節省大量溝通成本。5.2 從日期字段中提取新特征last_review是日期類型后可以方便地提取年份和月份。比如你想研究“哪個季節房源評論最多”就需要把月份單獨提取出來。df[last_review_year] df[last_review].dt.year df[last_review_month] df[last_review].dt.month # 缺失日期的房源沒有評論用 0 填充年份 df[last_review_year] df[last_review_year].fillna(0).astype(int) df[last_review_month] df[last_review_month].fillna(0).astype(int)這里再次體現了清洗和整形的銜接。last_review的缺失值在清洗階段被保留為NaT到整形階段才轉化為“0年0月”這種業務語義。整個過程分成兩步走每一步都清楚可控。5.3 對連續型字段做分段price是連續數值但有些分析場景下把它分成幾個價格帶更有價值。比如看“不同價位房源的評論數差異”用數值價格當然能做散點圖但用價格帶做分組對比更直觀。bins [0, 50, 100, 200, 500, 5000] labels [0-50, 50-100, 100-200, 200-500, 500] df[price_range] pd.cut(df[price], binsbins, labelslabels)pd.cut是等寬分段如果數據分布極不均勻也可以用pd.qcut做等頻分段讓每個區間樣本量接近。選哪個取決于分析目的沒有絕對標準。5.4 從文本字段中提取標志位Airbnb 數據中room_type的取值有Entire home/apt、Private room、Shared room、Hotel room。如果后續建模時想把房間類型作為特征最簡單的辦法是 One-Hot 編碼。# 房間類型獨熱編碼 room_type_dummies pd.get_dummies(df[room_type], prefixroom) df pd.concat([df, room_type_dummies], axis1)需要注意pd.get_dummies默認生成的列名會包含原始值中的空格和斜杠比如room_Entire home/apt。這種列名在后續用字符串操作時容易出問題建議在生成后統一重命名room_type_dummies.columns [ col.lower().replace( , _).replace(/, _) for col in room_type_dummies.columns ]處理完后room_type原始列可以保留也可以刪除。建議在建模前刪除因為獨熱編碼已經表達了同樣的信息。5.5 逗號拼接字段的拆解Airbnb 的amenities字段是典型的“一列多值”結構比如WiFi,Kitchen,Heating,Smoke detector,Essentials這樣的數據直接用于分析很困難。你很難用df[amenities].value_counts()知道有多少房源提供 WiFi因為每個單元格都包含多個設施。正確的做法是把多個值拆開。如果你只需要判斷“是否包含某個設施”可以先生成標志位def has_amenity(amenities_str, keyword): return int(keyword in str(amenities_str)) df[has_wifi] df[amenities].apply(lambda x: has_amenity(x, WiFi)) df[has_kitchen] df[amenities].apply(lambda x: has_amenity(x, Kitchen)) df[has_heating] df[amenities].apply(lambda x: has_amenity(x, Heating))如果你想把設施從寬表轉成長表為每個房源和每個設施生成一行記錄可以使用explode# 先把字符串拆成列表 df[amenities_list] df[amenities].str.split(,) # 拆分為長表 amenity_long df.explode(amenities_list) print(amenity_long[[id, amenities_list]].head(10))explode是 pandas 整形中非常強大的方法。它的作用是把一個單元格中的列表展開成多行同時復制其他字段。這在處理標簽、分類、多值屬性時非常常用。5.6 長表和寬表的相互轉換除了explodepivot和melt也是數據整形的高頻操作。這里用一個簡單例子說明它們的應用場景。假設你想按district和room_type統計平均價格初始數據是每個房源一行。用pivot_table可以把這個長表轉換成以district為行、room_type為列的寬表pivot_price df.pivot_table( indexdistrict, columnsroom_type, valuesprice, aggfuncmean ) print(pivot_price)反過來如果你從某個接口拿到的是寬表數據每一行是一個district每一列是一種room_type但你想用 matplotlib 或 seaborn 畫分組柱狀圖就需要轉回長表。這時候用meltlong_price pivot_price.reset_index().melt( id_varsdistrict, var_nameroom_type, value_nameavg_price ) print(long_price.head())長表和寬表的轉換是數據整形里最考驗理解力的部分。記住一個核心規則行是樣本、列是特征就是寬表用多行表達一個樣本的多個屬性就是長表。分析建模常用寬表可視化繪圖和部分統計模型常用長表。6. 運行結果與效果驗證清洗和整形的代碼寫完不是跑完沒報錯就算成功。你需要一套驗證方法來確認每一步都做對了。6.1 驗證清洗效果清洗完成后的驗證清單# 1. 沒有缺失值或缺失值已按業務規則處理 print(清洗后缺失值總數:, df.isnull().sum().sum()) # 2. 沒有重復房源 print(房源 ID 重復數:, df[id].duplicated().sum()) # 3. 關鍵字段類型正確 print(df[[price, review_count, last_review]].dtypes) # 4. 價格字段的統計量符合業務預期 print(df[price].describe()) # 5. 數據范圍沒有異常 print(經緯度范圍:, df[latitude].min(), df[latitude].max(), df[longitude].min(), df[longitude].max())預期輸出中缺失值總數應該為 0 或者嚴格等于你刻意保留的、具有業務含義的缺失值。id重復數應該是 0。price應該是float64review_count應該是數值類型last_review應該是datetime64[ns]。價格的最大值不超過你設定的業務閾值。6.2 驗證整形效果整形后的驗證重點在于結構是否符合后續分析需要。# 1. 新特征是否生成 print(df.columns.tolist()) # 2. 價格分段是否均勻分布 print(df[price_range].value_counts()) # 3. 獨熱編碼列是否只有 0/1 print(df[[room_entire_home_apt, room_private_room, room_shared_room]].apply(lambda x: x.unique())) # 4. 長表展開后每個房源的設施行數是否準確 amenity_long_counts amenity_long.groupby(id).size() print(每個房源平均設施數:, amenity_long_counts.mean())如果某個price_range區間內房源數極少比如 0 個說明你的分箱邊界可能不合理需要調整 bins。如果獨熱編碼列出現了大于 1 的值說明room_type列存在異常值需要回到清洗階段處理。6.3 用可視化快速驗證除了打印統計量畫圖是發現數據問題的另一個高效手段。import matplotlib.pyplot as plt # 檢查價格分布 df[price].hist(bins50) plt.title(Price Distribution After Cleaning) plt.xlabel(Price) plt.ylabel(Count) plt.show()如果價格分布仍然出現極端長尾比如右側拖出很長一條尾巴并且明顯不符合業務認知就需要回到異常值過濾步驟調整閾值。如果分布相對集中整體呈右偏形態這是長尾數據的正常表現可以接受。7. 常見問題與排查思路數據清洗和整形過程中有幾個問題幾乎每個人都會遇到。這里整理成表格方便你直接對照排查。問題現象可能原因排查方式解決方案pd.read_csv后價格列是 objectCSV 中包含$、,等符號查看df[price].head(10)確認格式用replace去掉符號后astype(float)dropna()后數據量驟降缺失值占比過高不該統一刪除先計算各字段缺失比例分字段制定策略不要dropna()一把梭df[price].mean()報錯列類型仍是字符串查看df.dtypes先做類型轉換再計算日期字段轉 datetime 失敗包含NaT或非法格式串用errorscoerce后檢查新產生的缺失值修正源格式或統一填充規則去重后 ID 仍有重復重復行的id相同但其他字段不同檢查df[id].duplicated().sum()按 ID 去重時指定subset[id]獨熱編碼生成的列名帶特殊字符原始分類取值包含空格和斜杠打印df[room_type].unique()獨熱編碼后統一重命名列名價格異常值導致均值遠高于中位數存在極端高價或 0 價用describe(percentiles[...])看分布按業務閾值過濾或做分箱explode后數據量暴增設施字段包含大量值檢查展開前后行數差異確認展開口徑是否符合業務需求這里特別想強調一個新手容易犯的錯誤看到read_csv不報錯就以為數據至少能用了。實際上pandas 在數據類型解析失敗時默認不會報錯而是把整列讀成object類型。所以不報錯不等于數據類型正確必須在清洗后主動檢查dtypes。8. 最佳實踐與工程建議數據清洗和整形做多了以后會發現有章可循。下面這些建議來自實際項目中的經驗總結能幫你少走很多彎路。8.1 清洗流程要寫成函數而不是腳本很多人習慣在 Notebook 里從頭到尾寫一長串清洗代碼跑完就完事。但真實項目的麻煩在于數據源會更新比如 Airbnb 每月發布一次新數據。如果清洗邏輯是散落的一堆單元格每次更新都要人工重跑很容易漏步驟。建議把清洗和整形封裝成函數def clean_listings(df): Airbnb Listings 清洗函數 df df.copy() df df.drop_duplicates(subset[id], keepfirst) df df.dropna(subset[id, host_id, price]) df[price] df[price].replace([\$,], , regexTrue).astype(float) df[last_review] pd.to_datetime(df[last_review], errorscoerce) df df[(df[price] 10) (df[price] 2000)] return df.reset_index(dropTrue) def shape_listings(df): Airbnb Listings 整形函數 df df.copy() df[last_review_year] df[last_review].dt.year df[last_review_month] df[last_review].dt.month df[price_range] pd.cut(df[price], bins[0, 50, 100, 200, 500, 5000]) return df封裝成函數之后每次數據更新只需要重新執行clean_listings(new_df)而且函數名本身就在記錄流程代碼的可讀性和可維護性能提升一個檔次。8.2 保留原始數據清洗結果另存一個非常實用的習慣永遠保留一份原始數據清洗后的數據另存為新的變量或者新的文件。# 先備份 raw_df pd.read_csv(listings.csv) df raw_df.copy() # 在 df 上執行清洗和整形 ...這樣做的好處是如果清洗規則需要調整比如修改價格閾值你不需要重新下載數據只需要重新執行從raw_df.copy()開始的單元格。另一個好處是當你需要追溯某條數據為什么被刪除時可以回到原始數據檢查。8.3 每一步清洗都要可審計在團隊協作或生產環境中數據清洗規則必須有記錄。最簡單的做法是在 Notebook 中為每一個處理步驟寫好注釋并且說明依據。# 刪除價格小于10美元或大于2000美元的房源 # 依據業務上低于10美元視為測試房源高于2000美元視為極端高價 # 影響影響約 1.2% 的行需業務確認后執行 df df[(df[price] 10) (df[price] 2000)]如果團隊使用版本管理工具清洗腳本也應該納入管理。數據清洗不是一次性工作它跟業務代碼一樣需要 review需要回溯。8.4 區分處理與分析避免過度清洗數據清洗有一個容易走偏的方向為了追求“完美數據”而過度清洗。比如某個字段缺失率達到 30%有人會想盡辦法用機器學習模型去填充它。但在大多數分析場景下刪除該字段或者簡單地標記缺失比復雜填充更穩妥。原則是清洗的目的是讓數據能回答問題而不是讓數據完美。如果某個字段在你要回答的問題中根本用不到就不需要為它花費大量時間。先明確分析目標再決定清洗的深度效率會高很多。8.5 在項目早期就約定列名規范Airbnb 數據集來自公開渠道列名比較混亂比如number_of_reviews和reviews_per_month很相似容易混淆。在項目開始時就統一重命名可以避免后面寫出df[number_of_reviews]和df[reviews_per_month]混用的情況。推薦的命名規范是全部小寫單詞間用下劃線連接。例如review_count、available_days、host_listings_count。這樣寫代碼時不需要記憶大小寫也符合 Python 社區的習慣。8.6 注意數據來源與合規性Airbnb 公開數據集的獲取和使用需要注意數據來源的授權條款。不同渠道發布的 Airbnb 數據集使用限制不完全相同有些僅限非商業用途。如果項目用于商業分析建議先確認數據的使用許可。另外Airbnb 數據中包含經緯度等空間信息在公開發表分析結果時如果房源數量較少應注意脫敏避免從細粒度坐標反推出具體房源位置。這類數據合規問題在真實項目里越來越重要建議從一開始就養成習慣。9. 總結與后續學習方向這篇文章以 Airbnb Listings 數據集為例完整走了一遍數據清洗和整形流程。核心結論可以濃縮成三句話第一數據清洗解決的是“數據對不對”的問題核心操作是缺失值、重復值、異常值和類型轉換數據整形解決的是“數據好不好用”的問題核心操作是列選擇、特征提取、寬表長表轉換。兩者不能互相替代也不該混為一談。第二清洗和整形都不是一次性任務而是需要反復迭代、驗證和審計的工程過程。每一步處理都要有依據、可追蹤并且保留原始數據作為對照。第三Airbnb Listings 數據集是練習數據清洗和整形的優質材料因為它幾乎包含了所有真實數據的典型問題。把這一套方法吃透之后遷移到電商訂單、招聘信息、房產掛牌等數據上只需要調整字段名和業務規則即可。后續可以從這幾個方向繼續深入把清洗和整形結果用于探索性數據分析比如研究紐約不同區域房源的定價差異。結合 scikit-learn 構建價格預測模型理解缺失值填充方式對模型效果的影響。學習更高級的數據整形工具比如pandas的pipe鏈式調用、polars的高性能數據框操作。建議收藏這篇文章等真正拿到一份 Airbnb Listings 數據時照著流程走一遍再把清洗函數改造成適合自己業務的版本。數據清洗沒有那么多“銀彈”多做幾次真實數據比看一百篇教程都管用。