某食品加工廠建立水果瑕疵檢測系統,已蒐集約 10,000 張影像,其中 2,000 張已完成「正常」、「碰傷」及「病斑」標註,其餘 8,000 張尚未完成標註。公司希望在降低人工標註成本的前提下,提升影像分類模型的辨識能力。下列何種作法最適合?
答案 (B)
核心概念
少量有標籤加大量沒標籤,又想省標註成本,就是半監督式學習的場景。
2,000 張有標籤、8,000 張沒有,全部人工標完成本太高。半監督式學習(Semi-supervised Learning)的做法:先用有標籤的資料訓練一個模型,再讓它對未標籤影像做預測,把有把握的預測當作偽標籤(Pseudo-label)加回訓練,模型就能從 8,000 張裡再學到東西。
本題詳解提到同卷第 1 題。
答題技巧
快速判斷技巧:「部分已標註」加「降低標註成本」,答案是半監督式學習(Semi-supervised Learning)。 ・少量標籤加大量未標籤 → 半監督式 ・全部有標籤 → 監督式 ・完全沒標籤、要分組 → 分群
易錯陷阱:(C) 分群拿來當標籤看起來很聰明,好像不用人工就有答案。 關鍵差異:分群只知道「像不像」,不知道「是什麼」,群跟病害類別對不上。 本卷第 1 題考全部有標籤、第 22 題考部分有標籤,兩題合起來就是這個考點的完整版。