在自然語言處理任務中,為了減少訓練語料中偏見對模型的影響,下列哪種資料處理策略屬於常見的「資料去偏(Data Debiasing)」做法?
答案 (C)
核心概念
模型的偏見大多來自訓練資料本身的分布不均。某些群體的樣本特別多,模型自然就偏向他們。
想像班上要選代表,可是報名的人九成來自同一個系。不管你怎麼改投票規則,選出來的還是那個系的人。真正的解法是先讓各系都有人報名。資料去偏就是在報名這一關動手,不是在投票規則上動手。
資料去偏(Data Debiasing)就是在「資料層」動手:重新平衡樣本比例、補齊代表性不足群體的資料、重新標註或過濾有偏內容,讓語料的分布更公平,從源頭降低偏見。
答題技巧
快速判斷技巧:題目問的是「資料」去偏,就找那個真的在動「資料」的選項。 (A) 動輸出、(B) 動模型大小、(D) 動訓練技巧,只有 (C) 在調整語料本身。
易錯陷阱:(B) 反映了一個很普遍的迷思:「模型夠大就會自己變好」。 要記住偏見來自資料,資料有偏,模型再大也只是把偏見學得更好。