某零售電商平台計劃建置機器學習模型分析會員行為。在資料預處理階段,資料科學團隊發現會員的「年消費總額」與「月到訪次數」數值範圍差異較大,可能影響部分機器學習模型的訓練效果,因此決定採用 Z-Score 標準化(Standardization)進行特徵縮放。已知該平台全體會員的「年消費總額」平均值為 30,000 元,標準差為 5,000 元。若某位 VIP 會員的年消費總額為 40,000 元,下列敘述何者正確?
答案 (B)
核心概念
Z-Score 只做一件事:把數值換算成「離平均值幾個標準差」。
公式:Z-Score =(原始值 - 平均值)÷ 標準差。
代入:(40,000 - 30,000)÷ 5,000 = 2,這位會員的年消費比平均高兩個標準差。
標準化(Standardization)轉換後平均值變 0、標準差變 1,但分布的形狀不會變,數值也沒有上下限。它的用途是把不同單位的特徵拉到同一個尺度,讓「年消費總額」與「月到訪次數」可以一起餵給模型。
答題技巧
快速判斷技巧:先算數字,再對兩個常見誤解:範圍與分布形狀。 ・(原始值 - 平均值)÷ 標準差 → Z-Score ・轉到 0 至 1 → 最小最大正規化(Min-Max Normalization),跟 Z-Score 無關 ・分布形狀 → 轉換前後一樣
易錯陷阱:(C) 是最常見的誤解,很多人以為「標準化」等於「變常態」。 關鍵差異:Z-Score 只平移與縮放,形狀原封不動。 (A) 把 Z-Score 跟 Min-Max 搞混,「0 到 1」是 Min-Max 的特徵。