生成式 AI 在處理文字前,會先進行斷詞(Tokenization),將文字拆解成多個 Token。當模型遇到訓練資料中從未看過的罕見專有名詞時,現代 AI 技術最普遍的處理方式為何?
答案 (A)
核心概念
沒看過的字不會被丟掉,會被拆成幾個看過的小片段來處理。
拿查字典比喻:遇到「超導量子干涉儀」這種沒背過的詞,你不會當它不存在,會拆成「超導」「量子」「干涉」「儀」幾個懂的部分去理解。
現代的斷詞(Tokenization)用子詞(Subword)切分,像 BPE 這類方法,把罕見專有名詞拆成多個已知的小 Token,模型再依這些片段處理與生成。詞彙表是訓練時固定的,推論時不會改。
答題技巧
快速判斷技巧:斷詞題看到「罕見詞」,答案是「拆成已知的小片段」。 ・沒看過的詞 → 拆成子詞(Subword) ・忽略、中斷、手動加 Token → 都是編的
易錯陷阱:(D) 「更新詞彙表」聽起來很合理,像是系統會自己學新字。 關鍵差異:詞彙表跟權重一樣是訓練的產物,推論階段是固定的。