某大型連鎖超市建置生鮮商品損耗預測模型,以減少報廢損失。資料庫中共有 120 萬筆銷售紀錄,但僅有約 8 萬筆資料標記為「正常銷售」或「損耗發生」,其餘資料均未標註。在標註資源有限的情況下,團隊希望提升模型預測表現。請問下列哪一種機器學習方式最適合此情境?
答案 (B)
核心概念
8 萬筆有標註、112 萬筆無標註,而且標註資源有限:這組條件正是半監督式學習(Semi-supervised Learning)的教科書情境。
它的做法是用已標註資料先學出分類邊界,再借助大量未標註資料掌握整體的資料分布(例如透過偽標籤或一致性正則化),讓決策邊界落在資料密度較低的地方,藉此提升泛化能力。兩邊的資料都用上,不浪費。