某零售業者建立顧客行為預測模型,資料集中包含「年消費金額」、「平均單筆交易金額」及「會員年資」等數值型特徵。資料分析顯示,部分金額特徵呈現高度偏態分布,少數樣本的數值顯著高於多數觀測值。為降低極端值對模型學習穩定性的影響,下列哪一種特徵工程方法最適合?
答案 (A)
核心概念
消費金額這類資料常呈現右偏(長尾)。大多數人金額集中在低區間,少數大戶的金額高出好幾個數量級。
對數轉換的作用是把數值取對數,大數被壓縮得多、小數被壓縮得少,整體分布因此往常態靠攏,極端值的影響力大幅降低,同時又保留了數值之間的大小順序。這是處理右偏金額型資料最標準的手法。
拿地震規模比喻:把差距上百倍的數字壓進同一把看得懂的刻度裡,但誰大誰小的順序完全沒變。
本題詳解提到同卷第 4 題。
答題技巧
快速判斷技巧:把分布狀況與處理方法配對: ・右偏長尾 → 對數轉換 ・接近常態但有離群值 → Z-score 偵測(見本卷第 4 題) ・尺度差異大 → 標準化 ・類別型 → One-hot 題目說「高度偏態」,直接選對數轉換。
易錯陷阱:(B) 區間化也能緩解極端值,是本題最強的誘答。 判準在於資訊保留程度。對數轉換保留了所有數值的相對關係,區間化則把區間內的差異全部抹平。 題目說「最適合」,就選副作用最小的那個。