某電商平台希望利用 AI 分析消費者行為。團隊取得過去會員交易資料,其中部分資料已標註「是否流失會員」,另一部分資料僅包含會員瀏覽、購買及搜尋紀錄,但未標註任何結果。下列何者最適合描述兩類資料的應用方式?
答案 (A)
核心概念
兩批資料分開看,有標籤的拿來預測,沒標籤的拿來找族群。
已標註「是否流失」的交易資料有標準答案,可以訓練監督式學習(Supervised Learning)模型,預測誰會流失。只有瀏覽、購買、搜尋紀錄的那批沒有答案,適合用非監督式學習(Unsupervised Learning)做分群,找出消費族群的特徵。
兩批資料各有用途,用不著硬把一批改造成另一批。
答題技巧
快速判斷技巧:資料分兩批就分兩批處理,有標籤配監督式,沒標籤配非監督式。 ・已標註「是否流失」 → 監督式學習(Supervised Learning) ・只有行為紀錄 → 非監督式學習(Unsupervised Learning)找族群
易錯陷阱:(B) 把兩種學習方式的位置對調,讀太快會漏掉。 另一個誘答是「未標註資料要先人工分類」,這等於否定了非監督式學習的存在。 警訊詞:「皆只能」「皆屬」這種一竿子打翻的選項,通常是錯的。