跳到主要內容
115-3 科目一考古題依梯次與科目瀏覽
42

人類回饋強化學習的核心作法

某客服系統開發團隊希望聊天機器人的回覆風格更貼近人類偏好,因此在模型訓練後期導入人類回饋強化學習(Reinforcement Learning from Human Feedback, RLHF)技術。關於 RLHF 核心作法,下列敘述何者最正確?

請選擇一個答案

答案 A

核心概念

RLHF 的核心是用人類偏好評比訓練獎勵模型,再拿它去調整語言模型。 人類回饋強化學習(Reinforcement Learning from Human Feedback, RLHF)三步驟: ・讓模型對同一個問題產生多個回覆,請人排序哪個比較好 ・用這些偏好資料訓練獎勵模型(Reward Model),學會幫回覆打分 ・用獎勵模型當作獎勵訊號,以強化學習調整語言模型 關鍵在「偏好評比」跟「獎勵模型」,少了任何一個都不算 RLHF。

答題技巧

快速判斷技巧:RLHF 題找有「偏好評比」「獎勵模型」的選項。 ・人類排序回覆好壞、訓練獎勵模型 → RLHF ・給正確範例直接學 → 監督式微調(SFT) ・改提示詞不動模型 → 系統提示(System Prompt)

易錯陷阱:(D) SFT 常跟 RLHF 一起出現在同一條訓練流程裡,容易混。 關鍵差異:SFT 給的是「標準答案」,RLHF 給的是「哪個比較好」的相對評比。 警訊詞:「偏好」「評比」「獎勵」三個詞,看到就是 RLHF。