某企業導入大型語言模型處理超長合約文件(數萬字),發現輸入越長,運算時間與資源消耗增加得越快,遠超過文件長度增加的比例。下列何者最能解釋此現象發生的主要原因?
答案 (C)
核心概念
自注意力要讓每個字跟每個字都算一次關係,輸入長度變兩倍,運算量變四倍。
Transformer 的自注意力機制(Self-Attention)會算出一張 n × n 的注意力表格,n 是輸入的 Token 數。表格大小隨 n 的平方成長:1,000 個字是一百萬格,10,000 個字就是一億格。所以文件變長 10 倍,運算跟記憶體會漲 100 倍,這就是「遠超過文件長度增加的比例」的原因。
本題詳解提到同卷第 38 題。
答題技巧
快速判斷技巧:「長度增加、成本增加得更快」,答案固定是自注意力的平方複雜度。 ・輸入長 n 倍 → 注意力運算長 n² 倍 ・參數量、詞彙表 → 推論時都固定,不會變 ・自動切換架構 → 模型沒有這種能力
易錯陷阱:(B) 「動態增加參數」聽起來很有道理,像是模型為了應付長文的自我調整。 關鍵差異:推論階段的模型是靜態的,變的只有輸入。 警訊詞:「自動暫停」「自動增加」「自動切換」,本卷第 38 題跟第 43 題都用同一招誘答。