某軟體公司計劃開發一款手機 App,需要在沒有網路的環境下,也能在手機本機端(邊緣裝置)執行微型大語言模型來提供即時語音翻譯服務。考量到行動裝置的記憶體(RAM)容量限制以及電池續航力,工程師建議在部署前先對模型進行模型量化(Quantization)處理。請問關於此作法所帶來的預期效益與影響,下列敘述何者最正確?
答案 (D)
核心概念
量化是把參數的精度降低,模型變小、跑得快,代價是輸出品質可能略降。
模型量化(Quantization)把原本用 32 位元浮點數存的參數改成 8 位元甚至 4 位元整數。同樣的參數數量,檔案體積跟記憶體佔用直接壓到四分之一以下,整數運算也比浮點快。精度降了,模型輸出會有些微變化,通常可接受,但不可能「完全不影響」。
答題技巧
快速判斷技巧:量化題記一句:變小變快,品質略降,參數數量不變。 ・體積、記憶體、速度 → 變好 ・輸出品質 → 可能輕微下降 ・參數數量 → 不變
易錯陷阱:(B) 前半段都對,只錯在「完全不影響」四個字。 關鍵差異:有得必有失,任何壓縮技術都有品質代價,只是大小問題。 警訊詞:「完全不影響」「自動增加」在技術題裡幾乎都是錯的。