跳到主要內容
115-3 科目二考古題依梯次與科目瀏覽
23

罕見詞的子詞切分處理

生成式 AI 在處理文字前,會先進行斷詞(Tokenization),將文字拆解成多個 Token。當模型遇到訓練資料中從未看過的罕見專有名詞時,現代 AI 技術最普遍的處理方式為何?

請選擇一個答案

答案 A

核心概念

沒看過的字不會被丟掉,會被拆成幾個看過的小片段來處理。 拿查字典比喻:遇到「超導量子干涉儀」這種沒背過的詞,你不會當它不存在,會拆成「超導」「量子」「干涉」「儀」幾個懂的部分去理解。 現代的斷詞(Tokenization)用子詞(Subword)切分,像 BPE 這類方法,把罕見專有名詞拆成多個已知的小 Token,模型再依這些片段處理與生成。詞彙表是訓練時固定的,推論時不會改。

答題技巧

快速判斷技巧:斷詞題看到「罕見詞」,答案是「拆成已知的小片段」。 ・沒看過的詞 → 拆成子詞(Subword) ・忽略、中斷、手動加 Token → 都是編的

易錯陷阱:(D) 「更新詞彙表」聽起來很合理,像是系統會自己學新字。 關鍵差異:詞彙表跟權重一樣是訓練的產物,推論階段是固定的。