某電商平台的資料科學團隊欲建置一套 NLP 模型,用於分析顧客在社群媒體上對商品的評論情緒。在將原始貼文資料送入模型訓練前,團隊執行了以下步驟:移除貼文中夾雜的 HTML 標籤與網址、將表情符號轉換或移除、去除「的、了、啊」等對情緒判斷無實質貢獻的停用詞,並統一將文字轉換為小寫格式。請問上述步驟主要屬於機器學習專案流程中的哪一環節?
答案 (C)
核心概念
移除雜訊、統一格式,還沒把文字變成數字,都算資料清理與預處理。
機器學習專案的順序:資料清理與預處理 → 特徵萃取 → 模型訓練 → 超參數調校 → 模型評估。題目列的四件事(去 HTML 標籤與網址、處理表情符號、去停用詞、轉小寫)都是在「整理原料」,文字還是文字。
答題技巧
快速判斷技巧:看步驟的產出還是不是原本的資料型態,是的話就是預處理。 ・文字進、乾淨文字出 → 資料清理與預處理(Data Cleaning and Preprocessing) ・文字進、數值向量出 → 特徵萃取(Feature Extraction) ・調學習率、批次大小 → 超參數調校(Hyperparameter Tuning)
易錯陷阱:(B) 特徵萃取最容易誤選,因為去停用詞看起來像在「挑特徵」。 關鍵差異:特徵萃取一定會產出數值,題目的四個步驟做完還是文字。