在超長上下文任務中使用自動提示工程(Automatic Prompt Engineer, APE)時,可能面臨的最大限制是什麼?
答案 (D)
核心概念
APE 的運作方式是「自動產生候選提示 → 用評分機制評估效果 → 保留最好的再迭代」。
想像你請人幫忙改一篇長文,但他每次只隨機抽一段來評分。抽到寫得好的那段就說整篇很好,抽到爛的就說整篇爛。評分訊號一旦不準,後面再怎麼迭代都是白費力氣。
整套機制能不能work,完全取決於評分訊號準不準。到了超長上下文任務,輸出動輒橫跨大量段落,評估往往只能抽樣局部片段來打分,這個局部分數無法代表整份輸出的品質。於是 APE 就被錯誤的訊號帶著走。這是它在長文本情境最根本的限制。
答題技巧
快速判斷技巧:問某個「自動優化方法」的限制時,先想它靠什麼訊號在優化。 凡是自動化迭代機制,弱點幾乎都在「評估訊號取得不易或不可靠」,答案常常就落在回饋/評估那一項。
易錯陷阱:(B) 的「記憶容量有限」是超長上下文的招牌問題,很容易被反射性選中。 但要看清楚題目問的主體是 APE 這個方法,不是模型本身。主體看錯,答案就跟著錯。