跳到主要內容
1.4 鑑別式 AI 與生成式 AI 的基本原理
115-2 科目 34

CLIP 與 DINO 皆屬於自監督學習(Self-supervised Learning)模型,但其訓練資料來源有所不同。下列何者最能正確敘述兩者在訓練資料型態上的差異?

請選擇一個答案

答案 C

核心概念

兩者雖然都不依賴人工逐張標註類別,但訓練訊號的來源不同。 CLIP 是拿圖片跟它的說明文字一起看,學會「這張圖跟這句話是一對」。DINO 完全不看文字,只把同一張圖裁成不同角度,逼自己認出「這兩塊還是同一個東西」。 CLIP 採用對比式的圖文預訓練:從網路蒐集大量「圖片與其說明文字」的配對,訓練模型把相符的圖文拉近、不符的推遠,因此它學到的是跨模態的語意對齊能力。DINO 則是純視覺的自監督方法:只用未標註的影像,透過學生與教師網路對同一張圖的不同裁切視角保持一致的表示來學習,完全沒有用到文字。
答題技巧

快速判斷技巧:從名字與用途聯想。CLIP 的用途是「用文字搜圖、零樣本影像分類」。 所以它一定學過文字;DINO 的產出是純視覺特徵表示,不涉及文字。 用途反推資料來源最快。

易錯陷阱:(D) 是主詞對調陷阱,這在比較型題目中出現率極高。 作答時先確定其中一個(例如 CLIP 一定有文字),另一個自動確定,比兩個都想快得多。