某證券公司開發 AI 輔助分析系統,需要分析長篇的法人說明會逐字稿。系統須有效建立逐字稿前後段落之間的長距離語意關聯,並在處理長篇文本時,能直接關聯相距較遠的文字內容,而無須依序傳遞前文資訊,以提升分析效率與準確性。下列哪一種模型架構最適合?
答案 (C)
核心概念
要「直接關聯相距很遠的文字」又「不用依序傳遞」,就是 Transformer 的自注意力。
循環神經網路家族(RNN、LSTM)都是一個字一個字往後傳,前面的資訊要經過很多步才到後面,距離越遠越容易淡掉。Transformer 用自注意力機制(Self-Attention)讓每個字直接看到整篇的所有字,不管距離多遠都是一步就到,也能平行運算。題幹的「直接關聯」「無須依序傳遞」,講的就是這個差別。
本題詳解提到同卷第 21 題。