某企業將生成式 AI 導入內部知識問答系統,並建立強化學習從人類回饋(Reinforcement Learning from Human Feedback, RLHF)機制,定期依員工對 AI 生成答案的「按讚/按噓」評分作為後續微調模型的依據。系統上線半年後,資料分析部門發現,僅約 8% 員工會主動評分,且多數評分者集中於資訊部門,其他部門員工鮮少提供回饋。技術團隊對此現象應有的正確認知為何?
答案 (D)
核心概念
回饋只來自一小群人,模型會越來越像那群人要的樣子,要擴大回饋來源。
人類回饋強化學習(Reinforcement Learning from Human Feedback, RLHF)用評分訓練獎勵模型,模型往高分方向調。只有 8% 的人評分、又集中在資訊部門,這是選擇性偏差(Selection Bias):獎勵模型學到的是資訊部門的偏好與用語,其他部門的需求被忽略,久了模型就偏掉。正確認知是承認偏差存在,主動去蒐集其他部門的回饋。
答題技巧
快速判斷技巧:「回饋只來自少數、集中在某一群」,答案是選擇性偏差,對策是擴大樣本。 ・評分者集中 → 獎勵模型偏向那群人 ・正確認知 → 承認偏差、擴大回饋來源 ・「不會影響」「能代表其他部門」「不必再蒐集」 → 都在否認偏差
易錯陷阱:(B) 「泛化能力」是很專業的說法,好像獎勵模型天生就能推到別人身上。 關鍵差異:泛化是訓練資料多樣才有的結果,資料本身偏了,泛化出來的也是偏的。