某醫療院所建置病患再住院風險預測模型,特徵包含「年齡」、「體重」、「血壓數值」及「診斷類別代碼」等,資料科學家考慮是否需對數值特徵進行標準化(Standardization)處理。下列何種模型對特徵尺度最不敏感、最適合在不進行標準化的情況下直接使用上述特徵進行訓練?
答案 (D)
核心概念
模型對特徵尺度敏不敏感,取決於它有沒有用到「距離」或「梯度」的計算。
決策樹的每一次分裂只問一個問題:「這個特徵的值有沒有大於某個門檻」,這是在單一特徵內部做比較,完全不涉及跨特徵的加總或距離。所以不論年齡是 0~100 還是體重是 0~200,對它毫無影響。
答題技巧
快速判斷技巧:把模型分成兩堆。 ・需要標準化 → 線性模型、SVM、KNN、神經網路、K-means,凡是算距離或用梯度的 ・不需要 → 決策樹家族 問哪個不敏感,答案就在樹模型。
易錯陷阱:容易以為「所有模型都該做標準化比較保險」。 實務上樹模型做標準化不會出錯但也沒好處,而考題問的是「最不敏感」,答案唯一。