企業在公開去識別化的消費資料集前,為避免他人透過郵遞區號、性別等間接識別資訊交叉比對後重新識別特定個人身分,同時保留資料的分析價值,最適合採用下列哪一種隱私保護技術?
答案 (C)
核心概念
防止間接資訊交叉比對認出人,用 k-匿名化讓每組組合至少有 k 人相同。
想像把「郵遞區號 100、女性、35 歲」這種組合變粗一點:郵遞區號只留前兩碼、年齡改成 30 到 39 歲,直到資料集裡至少有 k 個人的組合完全一樣,任何人都指不出哪一筆是你。
k-匿名化(k-Anonymity)就是這個做法:把準識別欄位(Quasi-identifier)概化或遮蔽,讓每個組合至少有 k 筆紀錄。資料還在,只是變粗,分析價值大致保留。
答題技巧
快速判斷技巧:「公開資料集」加「交叉比對再識別」,答案是 k-匿名化(k-Anonymity)。 ・公開整份資料,防組合認人 → k-匿名化 ・只開放統計查詢,防多次查詢推論 → 差分隱私(Differential Privacy) ・直接識別欄位要不可逆 → 密碼雜湊(Hashing)
易錯陷阱:(A) 差分隱私跟 k-匿名化常一起考,最容易混。 關鍵差異:差分隱私動的是「查詢結果」,k-匿名化動的是「資料本身」。 題目說「公開資料集」,就是要動資料本身。