某企業建置長時間對話的客服機器人,發現當對話回合數持續增加、上下文變得很長時,即使對話內容仍未超過模型可支援的上下文長度上限,模型仍常「忘記」或答錯先前提及的內容,回覆準確度明顯下降。下列關於此現象的敘述,何者最正確?
答案 (A)
核心概念
上下文還沒超過上限,模型也可能「看得到卻用不好」,這是長上下文的注意力稀釋問題。
大型語言模型靠注意力機制從上下文裡挑重要資訊。上下文越長,要分配注意力的內容越多,關鍵句子容易被淹沒,尤其是放在中間的內容(研究上叫「迷失在中間」,Lost in the Middle)。所以就算沒超過上限,準確度還是會下降。
答題技巧
快速判斷技巧:「未超過上限仍會忘」,答案是關鍵資訊被淹沒,自動機制都是編的。 ・上下文越長 → 關鍵資訊越難抓到 ・推論時 → 參數不變、沒有自動索引
易錯陷阱:(D) 用「上限」做文章,題幹明講「仍未超過上限」,選它等於否定題目。 關鍵差異:上限是「裝不裝得下」,題目問的是「裝得下但用不好」。 警訊詞:「自動建立索引」「自動切換架構」這類自動魔法,在模型題裡幾乎都是錯的。