某客服系統開發團隊希望聊天機器人的回覆風格更貼近人類偏好,因此在模型訓練後期導入人類回饋強化學習(Reinforcement Learning from Human Feedback, RLHF)技術。關於 RLHF 核心作法,下列敘述何者最正確?
答案 (A)
核心概念
RLHF 的核心是用人類偏好評比訓練獎勵模型,再拿它去調整語言模型。
人類回饋強化學習(Reinforcement Learning from Human Feedback, RLHF)三步驟:
・讓模型對同一個問題產生多個回覆,請人排序哪個比較好
・用這些偏好資料訓練獎勵模型(Reward Model),學會幫回覆打分
・用獎勵模型當作獎勵訊號,以強化學習調整語言模型
關鍵在「偏好評比」跟「獎勵模型」,少了任何一個都不算 RLHF。
答題技巧
快速判斷技巧:RLHF 題找有「偏好評比」「獎勵模型」的選項。 ・人類排序回覆好壞、訓練獎勵模型 → RLHF ・給正確範例直接學 → 監督式微調(SFT) ・改提示詞不動模型 → 系統提示(System Prompt)
易錯陷阱:(D) SFT 常跟 RLHF 一起出現在同一條訓練流程裡,容易混。 關鍵差異:SFT 給的是「標準答案」,RLHF 給的是「哪個比較好」的相對評比。 警訊詞:「偏好」「評比」「獎勵」三個詞,看到就是 RLHF。