戰(zhàn):邏輯回歸與判別分析原理、操作與評估全解析)
1. 項(xiàng)目概述當(dāng)數(shù)據(jù)需要“站隊(duì)”時(shí)我們該怎么做在數(shù)學(xué)建模尤其是涉及社會(huì)調(diào)查、醫(yī)學(xué)診斷、市場細(xì)分或信用評估的題目中我們常常會(huì)遇到一個(gè)核心問題如何根據(jù)已知的、帶有類別標(biāo)簽的數(shù)據(jù)比如“健康”與“患病”、“優(yōu)質(zhì)客戶”與“流失客戶”去建立一個(gè)可靠的規(guī)則以便對新的、未知類別的樣本進(jìn)行自動(dòng)歸類這就是分類模型要解決的核心任務(wù)。它不像回歸模型那樣預(yù)測一個(gè)連續(xù)的數(shù)值而是輸出一個(gè)離散的類別標(biāo)簽其本質(zhì)是尋找特征空間即由多個(gè)自變量構(gòu)成的坐標(biāo)系中的一個(gè)“決策邊界”將不同類別的樣本點(diǎn)分隔開來。SPSS作為一款歷史悠久、功能強(qiáng)大且界面友好的統(tǒng)計(jì)分析軟件是許多數(shù)學(xué)建模隊(duì)伍特別是非計(jì)算機(jī)專業(yè)背景隊(duì)伍的首選工具。它內(nèi)置了多種經(jīng)典的分類算法無需編寫復(fù)雜的代碼通過菜單點(diǎn)擊和參數(shù)設(shè)置就能完成從數(shù)據(jù)預(yù)處理、模型構(gòu)建到結(jié)果解讀的全過程。對于國賽、美賽等時(shí)間緊迫的競賽掌握SPSS中的分類模型應(yīng)用能讓你快速將數(shù)據(jù)轉(zhuǎn)化為有說服力的結(jié)論。很多人一提到分類就想到復(fù)雜的神經(jīng)網(wǎng)絡(luò)或支持向量機(jī)SVM但在實(shí)際建模中尤其是在數(shù)據(jù)量適中、特征關(guān)系相對明確的情況下SPSS提供的邏輯回歸Logistic Regression和判別分析Discriminant Analysis往往是更穩(wěn)健、解釋性更強(qiáng)的“利器”。本文將圍繞這兩個(gè)核心模型結(jié)合SPSS實(shí)操拆解分類建模的全流程從原理認(rèn)知、軟件操作到結(jié)果解讀與模型優(yōu)化讓你不僅能“跑出”結(jié)果更能“讀懂”和“用好”結(jié)果。2. 核心模型原理邏輯回歸與判別分析的“內(nèi)功心法”在動(dòng)手操作SPSS之前我們必須理解手頭“兵器”的工作原理。不同的分類模型基于不同的數(shù)學(xué)假設(shè)適用場景也不同。盲目套用模型很可能得到看似漂亮實(shí)則無用的結(jié)果。2.1 邏輯回歸計(jì)算“可能性”的法官邏輯回歸可能是應(yīng)用最廣泛的分類模型之一尤其適用于因變量是二分類如0/1是/否的情況。它的核心思想非常直觀不去直接預(yù)測類別而是預(yù)測某個(gè)樣本屬于特定類別的概率。我們可以這樣理解假設(shè)我們要根據(jù)學(xué)生的“學(xué)習(xí)時(shí)間”和“考前模擬成績”來預(yù)測其“是否通過考試”通過1未通過0。線性回歸會(huì)嘗試擬合一條直線但預(yù)測值可能會(huì)超出[0,1]這個(gè)概率范圍這顯然不合理。邏輯回歸的巧妙之處在于它引入了一個(gè)“邏輯函數(shù)”也叫Sigmoid函數(shù)這個(gè)函數(shù)能將線性回歸的結(jié)果一個(gè)任意實(shí)數(shù)映射到(0,1)區(qū)間內(nèi)完美地代表了概率。其模型公式為P(Y1|X) 1 / (1 e^-(β? β?X? ... β?X?))其中P(Y1|X)就是在給定自變量X的條件下樣本屬于類別1的概率。等式右邊的核心是β? β?X? ... β?X?這就是一個(gè)線性方程。SPSS所做的工作就是基于你的數(shù)據(jù)估算出這一系列β系數(shù)包括截距β?使得根據(jù)這個(gè)公式計(jì)算出的概率最符合你數(shù)據(jù)中實(shí)際的類別分布。關(guān)鍵輸出解讀SPSS中B值系數(shù)代表自變量的影響方向和強(qiáng)度。B為正說明該變量取值增加時(shí)樣本屬于類別1的概率Odds的對數(shù)會(huì)增加反之亦然。Exp(B)優(yōu)勢比這是更直觀的指標(biāo)。它表示自變量每增加一個(gè)單位樣本屬于類別1的“優(yōu)勢”O(jiān)dds即P/(1-P)變?yōu)樵瓉淼亩嗌俦丁@鏓xp(B)2.5意味著該變量增加一個(gè)單位屬于類別1的優(yōu)勢是原來的2.5倍。顯著性Sig.判斷該自變量是否對模型有顯著貢獻(xiàn)。通常以P值0.05作為顯著標(biāo)準(zhǔn)。邏輯回歸的適用場景與前提假設(shè)適用因變量是二分類或多分類有序或無序均可SPSS支持。假設(shè)自變量與因變量的對數(shù)優(yōu)勢Log Odds呈線性關(guān)系。不需要自變量服從正態(tài)分布但極端異常值會(huì)影響結(jié)果。2.2 判別分析尋找最佳“投影”的指揮官判別分析特別是線性判別分析LDA采用了另一種思路。它不再聚焦于概率而是致力于找到一個(gè)或幾個(gè)線性組合稱為判別函數(shù)將不同類別的樣本在低維空間通常是二維上盡可能地分離開。想象一下你有兩個(gè)類別的數(shù)據(jù)點(diǎn)混雜在三維空間中有三個(gè)特征。判別分析的目標(biāo)是找到一個(gè)最佳的二維平面將數(shù)據(jù)點(diǎn)投影到這個(gè)平面上后兩個(gè)類別的投影點(diǎn)團(tuán)各自內(nèi)部非常緊湊而兩個(gè)團(tuán)之間的距離盡可能遠(yuǎn)。這個(gè)投影的過程就是構(gòu)建判別函數(shù)的過程。其核心思想是最大化“類間方差”與“類內(nèi)方差”的比值。類間方差大說明不同類別區(qū)分得開類內(nèi)方差小說明同一類別內(nèi)部很集中。SPSS會(huì)計(jì)算出判別函數(shù)的系數(shù)類似于回歸系數(shù)。對于一個(gè)新樣本將其特征值代入各個(gè)判別函數(shù)可以得到一組判別分?jǐn)?shù)。通過比較這些分?jǐn)?shù)或者計(jì)算它到各類別中心在判別空間中的均值點(diǎn)的馬氏距離來判斷它最可能屬于哪個(gè)類別。關(guān)鍵輸出解讀SPSS中特征值衡量每個(gè)判別函數(shù)的重要性特征值越大說明該函數(shù)區(qū)分能力越強(qiáng)。威爾克Lambda值用于檢驗(yàn)判別函數(shù)的顯著性值越小越接近0表示判別函數(shù)越有效。標(biāo)準(zhǔn)化判別函數(shù)系數(shù)類似于回歸中的標(biāo)準(zhǔn)化系數(shù)可以用來判斷每個(gè)自變量在構(gòu)建該判別函數(shù)時(shí)的相對重要性。結(jié)構(gòu)矩陣自變量與判別函數(shù)之間的相關(guān)系數(shù)是解釋判別函數(shù)實(shí)際含義代表了哪些變量的綜合信息的關(guān)鍵。分類函數(shù)系數(shù)Fisher線性判別函數(shù)SPSS會(huì)直接給出用于分類的線性方程系數(shù)。將新樣本的自變量值代入每個(gè)類別的方程計(jì)算得分得分最高的類別即為預(yù)測類別。判別分析的適用場景與前提假設(shè)適用因變量是多分類且通常假設(shè)各類別樣本是隨機(jī)抽取的。假設(shè)要求較為嚴(yán)格自變量服從多元正態(tài)分布各類別的協(xié)方差矩陣相等即方差齊性。在SPSS中可以進(jìn)行Box‘s M檢驗(yàn)來驗(yàn)證協(xié)方差矩陣的齊性。當(dāng)該假設(shè)不滿足時(shí)可以考慮使用二次判別分析QDA或其他模型。模型選擇的心得在實(shí)際建模中我通常這樣快速抉擇如果研究重點(diǎn)是理解各個(gè)自變量如何影響結(jié)果發(fā)生的概率或者需要得到概率預(yù)測值邏輯回歸是首選它的結(jié)果Exp(B)在論文中非常好解釋。如果主要目標(biāo)是獲得高精度的分類且數(shù)據(jù)大致滿足正態(tài)性和方差齊性判別分析可能表現(xiàn)更優(yōu)它得到的分類函數(shù)用起來也很直接。一個(gè)實(shí)用的技巧是可以兩種方法都嘗試在訓(xùn)練集上構(gòu)建模型在預(yù)留的測試集上比較它們的分類準(zhǔn)確率同時(shí)結(jié)合模型的前提假設(shè)檢驗(yàn)結(jié)果來做最終選擇。3. SPSS實(shí)戰(zhàn)從數(shù)據(jù)導(dǎo)入到模型構(gòu)建的完整鏈路理解了原理我們進(jìn)入實(shí)戰(zhàn)環(huán)節(jié)。假設(shè)我們手頭有一份“銀行客戶流失預(yù)測”的數(shù)據(jù)包含客戶年齡、賬戶余額、交易次數(shù)、是否擁有信用卡二分類等特征以及“是否流失”是1否0這個(gè)目標(biāo)變量。我們將以此為例演示邏輯回歸在SPSS中的完整操作。3.1 數(shù)據(jù)準(zhǔn)備與預(yù)處理磨刀不誤砍柴工在SPSS中點(diǎn)擊“分析”菜單之前70%的建模工作其實(shí)已經(jīng)開始了。混亂的數(shù)據(jù)必然產(chǎn)生誤導(dǎo)的模型。數(shù)據(jù)導(dǎo)入與變量定義將你的Excel或CSV數(shù)據(jù)導(dǎo)入SPSS。在“變量視圖”中仔細(xì)檢查每個(gè)變量的“類型”數(shù)值、字符串等、“測量”度量、有序、名義。至關(guān)重要的一步是為你的分類變量包括因變量和自變量中的分類變量設(shè)置“值”標(biāo)簽。例如將“是否流失”的1定義為“是”0定義為“否”。這能讓你后續(xù)的解讀清晰無誤。缺失值處理使用“分析 - 描述統(tǒng)計(jì) - 頻率”或“分析 - 缺失值分析”查看缺失情況。對于分類模型常見的處理方式有整列刪除若某個(gè)樣本缺失關(guān)鍵變量且數(shù)量很少可直接刪除。眾數(shù)/中位數(shù)填補(bǔ)對于分類變量用眾數(shù)填補(bǔ)對于連續(xù)變量用中位數(shù)或均值填補(bǔ)SPSS可通過“轉(zhuǎn)換 - 替換缺失值”實(shí)現(xiàn)。作為單獨(dú)類別有時(shí)缺失本身可能有意義可以考慮將缺失值編碼為一個(gè)新的類別如“未知”。變量篩選與共線性診斷不是所有拿到的變量都要扔進(jìn)模型。高度相關(guān)的自變量多重共線性會(huì)嚴(yán)重影響邏輯回歸系數(shù)的穩(wěn)定性和解釋。可以先做一次線性回歸“分析 - 回歸 - 線性”勾選“共線性診斷”查看容差Tolerance和方差膨脹因子VIF。通常VIF10或更嚴(yán)格的5表明存在嚴(yán)重共線性需要考慮刪除其中一個(gè)變量或使用主成分分析等方法降維。數(shù)據(jù)分割強(qiáng)烈建議為了客觀評估模型性能避免過擬合務(wù)必進(jìn)行數(shù)據(jù)分割。使用“數(shù)據(jù) - 選擇個(gè)案”功能隨機(jī)選擇大約70%-80%的樣本作為“訓(xùn)練集”用于構(gòu)建模型剩余20%-30%作為“測試集”用于最終評估。可以創(chuàng)建一個(gè)新變量如sample1訓(xùn)練0測試來標(biāo)記。3.2 邏輯回歸二元操作步驟詳解我們以訓(xùn)練集數(shù)據(jù)為例進(jìn)行二元邏輯回歸分析。打開主對話框分析 - 回歸 - 二元Logistic。變量設(shè)置因變量將“是否流失”選入“因變量”框。協(xié)變量將選定的自變量如年齡、賬戶余額、交易次數(shù)、是否擁有信用卡選入“協(xié)變量”框。對于多分類的自變量如職業(yè)類型需要將其選入右側(cè)的“分類”框中并設(shè)置參考類別通常選擇“第一個(gè)”或“最后一個(gè)”。方法下拉菜單中有“輸入”、“向前條件”、“向后Wald”等。“輸入”是強(qiáng)行將所有變量納入模型。“向前/向后”是逐步回歸法基于統(tǒng)計(jì)檢驗(yàn)自動(dòng)篩選變量。對于探索性分析我推薦使用“向前LR”基于似然比檢驗(yàn)的向前法或“向后LR”這樣可以得到一個(gè)相對簡潔、只包含顯著變量的模型。關(guān)鍵選項(xiàng)配置點(diǎn)擊“分類”按鈕確保你的分類自變量已正確設(shè)置并檢查“參考類別”。點(diǎn)擊“保存”按鈕這是極其重要的一步勾選“預(yù)測值”下的“概率”和“組成員”。這樣SPSS會(huì)為數(shù)據(jù)集中每個(gè)個(gè)案計(jì)算其預(yù)測為“流失”類別1的概率并根據(jù)概率是否大于0.5默認(rèn)分割點(diǎn)給出預(yù)測類別。這些新變量將出現(xiàn)在數(shù)據(jù)視圖最后列用于后續(xù)計(jì)算準(zhǔn)確率、繪制ROC曲線等。點(diǎn)擊“選項(xiàng)”按鈕勾選“Exp(B)的CI”輸出優(yōu)勢比的置信區(qū)間和“分類圖”、“Hosmer-Lemeshow擬合優(yōu)度”。HL檢驗(yàn)的P值大于0.05表示模型擬合較好。運(yùn)行并解讀核心結(jié)果塊 0起始卡方僅包含常數(shù)項(xiàng)的模型擬合情況意義不大。塊 1模型系數(shù)的綜合檢驗(yàn)這里看“模型”行的顯著性Sig.若P0.05說明你納入的自變量整體上對模型有顯著貢獻(xiàn)。模型摘要關(guān)注“Cox Snell R 方”和“Nagelkerke R 方”它們類似于線性回歸中的R2表示模型對因變量變異的解釋程度值越大越好但通常不會(huì)很高。Hosmer-Lemeshow 檢驗(yàn)如前所述P0.05表示模型擬合良好。分類表這是模型在訓(xùn)練集上的表現(xiàn)。重點(diǎn)關(guān)注“總體百分比”即整體準(zhǔn)確率。但要注意如果兩類樣本數(shù)量不平衡如流失客戶只占10%一個(gè)把所有樣本都預(yù)測為“不流失”的模型也有90%的準(zhǔn)確率這沒有意義。因此必須同時(shí)觀察“靈敏度”實(shí)際為流失且被預(yù)測為流失的比例和“特異度”實(shí)際為不流失且被預(yù)測為不流失的比例。方程中的變量這是最核心的表格。查看每個(gè)自變量的B、Sig.、Exp(B)及Exp(B)的95%置信區(qū)間。例如“交易次數(shù)”的B為負(fù)值且顯著Exp(B)0.85意味著交易次數(shù)每增加一次客戶流失的優(yōu)勢變?yōu)樵瓉淼?.85倍即流失的可能性降低。3.3 判別分析操作步驟詳解現(xiàn)在我們換用判別分析來處理一個(gè)多分類問題例如根據(jù)花瓣長度、花瓣寬度、萼片長度、萼片寬度對鳶尾花的品種Setosa, Versicolor, Virginica進(jìn)行分類。打開主對話框分析 - 分類 - 判別式分析。變量設(shè)置分組變量將“鳶尾花品種”選入并點(diǎn)擊“定義范圍”按鈕輸入最小值1和最大值3假設(shè)三個(gè)品種編碼為1,2,3。自變量將四個(gè)測量變量選入“自變量”框。選擇變量可選如果需要使用部分樣本進(jìn)行分析可以在此指定。關(guān)鍵選項(xiàng)配置點(diǎn)擊“統(tǒng)計(jì)”按鈕務(wù)必勾選描述性均值、標(biāo)準(zhǔn)差。函數(shù)系數(shù)Fisher和未標(biāo)準(zhǔn)化。Fisher線性判別函數(shù)系數(shù)是直接用于分類的公式。矩陣組內(nèi)相關(guān)、組內(nèi)協(xié)方差、分組協(xié)方差和總協(xié)方差。組內(nèi)協(xié)方差矩陣相等是LDA的重要假設(shè)。點(diǎn)擊“分類”按鈕先驗(yàn)概率如果各類別樣本量差異大可以根據(jù)樣本量或自定義比例調(diào)整。輸出勾選“個(gè)案結(jié)果”這會(huì)輸出每個(gè)樣本的預(yù)測類別、判別分?jǐn)?shù)及后驗(yàn)概率。使用協(xié)方差矩陣選擇“組內(nèi)”這是線性判別。圖勾選“合并組”和“區(qū)域圖”可以直觀看到判別效果。點(diǎn)擊“保存”按鈕勾選“預(yù)測組成員”、“判別分?jǐn)?shù)”和“組成員概率”將預(yù)測結(jié)果保存到數(shù)據(jù)集中。運(yùn)行并解讀核心結(jié)果特征值表第一個(gè)判別函數(shù)特征值最大解釋了絕大部分的區(qū)分能力。看“方差百分比”和“累積%”。威爾克Lambda檢驗(yàn)檢驗(yàn)每個(gè)判別函數(shù)是否顯著。通常第一個(gè)函數(shù)是顯著的。標(biāo)準(zhǔn)化判別函數(shù)系數(shù)類似于因子載荷絕對值越大表示該自變量對該判別函數(shù)的貢獻(xiàn)越大。結(jié)合結(jié)構(gòu)矩陣自變量與判別函數(shù)的相關(guān)系數(shù)可以解釋判別函數(shù)的實(shí)際含義。例如第一個(gè)判別函數(shù)可能與“花瓣長度”和“花瓣寬度”高度相關(guān)代表“花朵大小”維度。分類函數(shù)系數(shù)在“Fisher的線性判別式函數(shù)系數(shù)”表中你會(huì)看到三組系數(shù)對應(yīng)三個(gè)品種。對于一個(gè)新樣本將其四個(gè)變量值分別代入三個(gè)方程計(jì)算三個(gè)得分得分最高的那個(gè)方程對應(yīng)的品種就是預(yù)測結(jié)果。分類結(jié)果查看“分類處理摘要”和“分類結(jié)果”表了解模型在訓(xùn)練集上的整體準(zhǔn)確率以及每個(gè)類別的分類情況。4. 模型評估與優(yōu)化超越“跑出結(jié)果”的深度思考構(gòu)建出模型只是第一步更重要的是評估它是否可靠、穩(wěn)健以及如何讓它變得更好。很多新手隊(duì)伍止步于SPSS輸出的默認(rèn)表格這是遠(yuǎn)遠(yuǎn)不夠的。4.1 分類性能的量化評估多維度透視準(zhǔn)確率只是一個(gè)粗略的指標(biāo)我們需要更細(xì)致的工具。混淆矩陣與衍生指標(biāo)SPSS的邏輯回歸和判別分析都會(huì)輸出分類表這就是混淆矩陣。從中我們可以計(jì)算靈敏度召回率TP / (TP FN)。模型找出所有正例的能力。特異度TN / (TN FP)。模型識別所有負(fù)例的能力。精確率TP / (TP FP)。模型預(yù)測為正例的樣本中真正為正例的比例。F1分?jǐn)?shù)精確率和召回率的調(diào)和平均數(shù)2 * (精確率 * 召回率) / (精確率 召回率)是綜合衡量指標(biāo)。在類別不平衡的數(shù)據(jù)中如欺詐檢測欺詐樣本極少只看總體準(zhǔn)確率會(huì)嚴(yán)重失真必須同時(shí)關(guān)注靈敏度和特異度。ROC曲線與AUC值邏輯回歸這是評估二分類模型性能的黃金標(biāo)準(zhǔn)。ROC曲線描繪了在不同分類閾值下模型的“靈敏度”與“1-特異度”假正率之間的關(guān)系。曲線下的面積AUC越接近1模型性能越好。AUC0.5相當(dāng)于隨機(jī)猜測。在SPSS中生成ROC曲線在邏輯回歸的“保存”選項(xiàng)中我們已經(jīng)保存了預(yù)測概率PRE_1。然后使用分析 - ROC曲線圖將保存的預(yù)測概率變量選為“檢驗(yàn)變量”將實(shí)際類別變量選為“狀態(tài)變量”并定義狀態(tài)變量的值如1。在“選項(xiàng)”中勾選“ROC曲線”和“帶對角參考線”。運(yùn)行后在輸出查看器的“圖表”部分就能看到ROC曲線并得到AUC值及其置信區(qū)間。解讀AUC值在0.9以上通常認(rèn)為模型區(qū)分能力優(yōu)秀0.8-0.9良好0.7-0.8一般0.7以下較差。Kappa系數(shù)用于評估分類的一致性特別適用于類別不平衡的情況。它考慮了隨機(jī)一致的可能性。Kappa值在-1到1之間大于0.6通常認(rèn)為一致性較好。SPSS在判別分析的“分類”輸出中如果勾選了相應(yīng)選項(xiàng)會(huì)提供Kappa系數(shù)。4.2 模型診斷與優(yōu)化策略如果模型表現(xiàn)不佳我們需要像醫(yī)生一樣進(jìn)行“診斷”。邏輯回歸模型診斷HL擬合優(yōu)度檢驗(yàn)P值應(yīng)大于0.05。如果顯著P0.05說明模型擬合不佳可能遺漏了重要變量、存在非線性關(guān)系或交互項(xiàng)。殘差分析檢查“保存”選項(xiàng)中的標(biāo)準(zhǔn)化殘差。絕對值大于3的個(gè)案可能是強(qiáng)影響點(diǎn)或異常值需要審查。共線性再檢查盡管邏輯回歸對共線性不如線性回歸敏感但嚴(yán)重的共線性仍會(huì)導(dǎo)致系數(shù)估計(jì)不穩(wěn)定。檢查VIF值。變量非線性關(guān)系如果懷疑某個(gè)連續(xù)自變量與因變量的對數(shù)優(yōu)勢不是線性關(guān)系可以嘗試將該變量進(jìn)行轉(zhuǎn)換如取對數(shù)、平方或?qū)⑵潆x散化為分類變量如按分位數(shù)分組后再納入模型。判別分析前提檢驗(yàn)多元正態(tài)性檢驗(yàn)SPSS沒有直接提供但可以通過考察每個(gè)變量的正態(tài)性Q-Q圖或使用其他專業(yè)軟件輔助判斷。在實(shí)際應(yīng)用中只要不是嚴(yán)重偏態(tài)LDA通常具有一定的穩(wěn)健性。Box‘s M 檢驗(yàn)在判別分析的“統(tǒng)計(jì)”選項(xiàng)中勾選后輸出。其零假設(shè)是各組協(xié)方差矩陣相等。如果檢驗(yàn)顯著P0.05則違背了LDA的核心假設(shè)。此時(shí)應(yīng)考慮使用二次判別分析QDA它不要求協(xié)方差矩陣相等。但SPSS的判別分析過程默認(rèn)是線性的實(shí)現(xiàn)QDA需要更復(fù)雜的操作或使用其他軟件如R、Python。使用邏輯回歸它對數(shù)據(jù)分布沒有嚴(yán)格要求。嘗試對變量進(jìn)行變換如對數(shù)變換使數(shù)據(jù)更接近正態(tài)分布。特征工程與模型調(diào)優(yōu)交互項(xiàng)在邏輯回歸中可以考慮加入自變量的交互項(xiàng)如“年齡信用卡狀態(tài)”看看兩個(gè)變量的聯(lián)合效應(yīng)是否顯著。在SPSS的Logistic回歸對話框中可以同時(shí)選中兩個(gè)變量然后點(diǎn)擊旁邊的“ab”按鈕來創(chuàng)建交互項(xiàng)。變量選擇不要一次性放入所有變量。使用逐步回歸法向前/向后可以幫助篩選。也可以基于領(lǐng)域知識或單變量分析如卡方檢驗(yàn)、t檢驗(yàn)先進(jìn)行初步篩選。處理不平衡數(shù)據(jù)如果正負(fù)樣本比例懸殊如1:99模型會(huì)偏向多數(shù)類。SPSS中可以在邏輯回歸的“選項(xiàng)”里調(diào)整“分類臨界值”默認(rèn)0.5或使用“加權(quán)個(gè)案”功能對少數(shù)類樣本賦予更高權(quán)重。更高級的做法是在數(shù)據(jù)準(zhǔn)備階段使用過采樣如SMOTE或欠采樣技術(shù)但這通常需要在其他軟件中完成。5. 結(jié)果呈現(xiàn)與論文寫作將分析轉(zhuǎn)化為說服力數(shù)學(xué)建模競賽中清晰、專業(yè)的結(jié)果呈現(xiàn)和嚴(yán)謹(jǐn)?shù)恼撌雠c模型本身同等重要。5.1 核心結(jié)果的表格化呈現(xiàn)在論文的“模型建立與求解”部分不要簡單截圖SPSS的全部輸出。要提煉關(guān)鍵信息制作成規(guī)范的學(xué)術(shù)表格。邏輯回歸結(jié)果表應(yīng)包含以下列變量、B系數(shù)、標(biāo)準(zhǔn)誤、Wald值、自由度、顯著性P值、Exp(B)優(yōu)勢比、Exp(B)的95%置信區(qū)間。對于分類自變量要注明參考類別。可以在表格下方添加注釋說明模型整體的擬合優(yōu)度指標(biāo)如Nagelkerke R2和HL檢驗(yàn)結(jié)果。判別分析結(jié)果表可以制作兩個(gè)核心表格。一是標(biāo)準(zhǔn)化判別函數(shù)系數(shù)表展示各變量對兩個(gè)或更多判別函數(shù)的貢獻(xiàn)。二是分類結(jié)果混淆矩陣清晰展示訓(xùn)練集和測試集上每個(gè)類別的預(yù)測情況并計(jì)算總體準(zhǔn)確率、Kappa系數(shù)等。模型性能對比表如果你嘗試了多種模型如邏輯回歸、判別分析、決策樹可以制作一個(gè)對比表格列包括模型名稱、訓(xùn)練集準(zhǔn)確率、測試集準(zhǔn)確率、AUC值、靈敏度、特異度、備注如是否滿足假設(shè)從而有力地論證你最終選擇的模型為何是最優(yōu)的。5.2 圖表可視化一圖勝千言ROC曲線圖務(wù)必在論文中插入ROC曲線圖并標(biāo)注AUC值。這是證明你模型區(qū)分能力的強(qiáng)有力證據(jù)。SPSS輸出的圖表可以直接編輯雙擊圖表進(jìn)入圖表編輯器以美化線條、字體然后導(dǎo)出為高清圖片。判別分析的區(qū)域圖/散點(diǎn)圖SPSS輸出的判別分?jǐn)?shù)散點(diǎn)圖或區(qū)域圖非常直觀能展示不同類別樣本在判別空間中的分布情況以及決策邊界。在論文中用此圖可以生動(dòng)說明模型的分類機(jī)理。預(yù)測概率分布直方圖對于邏輯回歸可以繪制訓(xùn)練集和測試集上預(yù)測概率的分布直方圖觀察模型是否對兩類樣本給出了有區(qū)分度的概率值。5.3 建模過程的文字論述要點(diǎn)在描述你的建模過程時(shí)要體現(xiàn)嚴(yán)謹(jǐn)?shù)目茖W(xué)流程數(shù)據(jù)預(yù)處理說明簡要說明如何處理了缺失值、異常值是否進(jìn)行了變量轉(zhuǎn)換或標(biāo)準(zhǔn)化。模型選擇理由基于數(shù)據(jù)特征因變量類型、自變量分布、樣本量和模型前提假設(shè)解釋為何選擇邏輯回歸或判別分析。可以提及你也考慮了其他模型如SVM但基于解釋性或假設(shè)檢驗(yàn)結(jié)果最終選擇了當(dāng)前模型。變量篩選過程說明你是如何確定最終進(jìn)入模型的自變量的是基于逐步回歸、理論驅(qū)動(dòng)還是先驗(yàn)知識模型假設(shè)檢驗(yàn)明確報(bào)告你對模型前提假設(shè)的檢驗(yàn)結(jié)果。例如“我們進(jìn)行了Box‘s M檢驗(yàn)結(jié)果不顯著P0.12滿足線性判別分析中組間協(xié)方差矩陣相等的假設(shè)因此采用線性判別模型是合適的。” 或者“Hosmer-Lemeshow檢驗(yàn)顯示模型擬合良好P0.32。”模型結(jié)果解釋結(jié)合Exp(B)和置信區(qū)間解釋關(guān)鍵自變量的實(shí)際意義。例如“在控制其他變量的情況下持有信用卡的客戶流失的優(yōu)勢比Exp(B)為0.4595% CI: 0.28-0.72這意味著持有信用卡的客戶流失的可能性顯著更低大約是不持有信用卡客戶的0.45倍。”模型評估與驗(yàn)證不僅要報(bào)告訓(xùn)練集上的性能必須報(bào)告在獨(dú)立的測試集上的性能。這是檢驗(yàn)?zāi)P头夯芰Α⒎乐惯^擬合的關(guān)鍵。說明你采用了何種數(shù)據(jù)分割方法如70/30隨機(jī)分割以及測試集上的準(zhǔn)確率、AUC等指標(biāo)。模型局限性客觀指出模型的不足例如“本模型未考慮變量間可能存在的復(fù)雜交互效應(yīng)”或“由于數(shù)據(jù)中流失客戶占比較低模型對流失客戶的識別靈敏度仍有提升空間”。這體現(xiàn)了批判性思維。最后我個(gè)人在多次競賽和實(shí)際項(xiàng)目中的一個(gè)深刻體會(huì)是不要迷信任何一個(gè)單一的模型或指標(biāo)。SPSS提供了便捷的工具但真正的建模智慧在于理解數(shù)據(jù)背后的業(yè)務(wù)邏輯在于嚴(yán)謹(jǐn)?shù)募僭O(shè)檢驗(yàn)流程在于用測試集來“拷問”模型的真實(shí)能力。將邏輯回歸的系數(shù)解釋與判別分析的直觀分類圖結(jié)合到你的問題背景中才能讓你的論文不僅有“數(shù)”更有“理”最終在數(shù)學(xué)建模競賽中脫穎而出。