在訓練神經網路時,為了提升模型收斂速度與穩定性,避免梯度消失或梯度爆炸,下列哪一種做法最常被使用?
答案 (B)
核心概念
梯度消失的元凶之一是傳統啟動函數(激活函數)。
想像一句話要傳過十個人。每個人都只傳一半的音量,傳到第十個幾乎聽不見了,這就是梯度消失。ReLU 的作用是讓每個人原音重現地傳下去,第十個人聽到的跟第一個一樣清楚。
Sigmoid 與 Tanh 的導數最大值分別只有 0.25 與 1,且在飽和區趨近於 0。層數一多,反向傳播時這些小於 1 的導數連乘下去,梯度就消失了。ReLU 在正區間的導數恆為 1,連乘也不會衰減,因此能讓梯度順利傳遞到深層;其變體(Leaky ReLU、ELU、GELU)進一步改善負區間神經元死亡的問題。
Sigmoid 的斜率最大只有 0.25,一層一層乘下去,訊號就被乘沒了。
本題詳解提到同卷第 43 題。
答題技巧
快速判斷技巧:先認症狀,再從對應清單挑解法。 ・梯度消失/爆炸 → ReLU 系列啟動函數、批次正規化、殘差連接、梯度裁剪 ・過度擬合 → 丟棄法(Dropout)、資料增強、正則化 題目寫出哪個症狀,就只從那一排找答案。
易錯陷阱:(D) 標準化最有干擾性,因為它確實能加速收斂。 但標準化治的是「輸入特徵尺度不一」,梯度消失是「深層網路導數連乘衰減」,病因不同。 題目把「梯度消失或梯度爆炸」寫出來,就是在指定病因。