논문명: Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset

저자: Yingzi Ma, Jiongxiao Wang, Fei Wang, Siyuan Ma, Jiazhao Li, Jinsheng Pan, Xiujun Li, Furong Huang, Lichao Sun, Bo Li, Yejin Choi, Muhao Chen, Chaowei Xiao

게재지: ICLR 2025

URL: https://proceedings.iclr.cc/paper_files/paper/2025/hash/dafb7f4ced9ac559e077fc611d6e96e5-Abstract-Conference.html

서론


Vision-Language Model(VLM)은 얼굴 이미지와 이름, 주소, 건강 기록 같은 텍스트 정보를 연결해 학습할 수 있습니다. 사용자가 자신의 정보 삭제를 요청했을 때 모델 전체를 처음부터 다시 학습하면 가장 확실하지만, 대규모 VLM에서는 매 요청마다 재학습하는 것은 현실적으로 매우 어렵습니다. Machine Unlearning은 이렇게 전체 재학습 없이 선택한 데이터의 영향을 제거하는 것을 목표로 합니다.

기존 multimodal unlearning 연구는 image-text matching이나 특정 visual concept의 제거에 집중했습니다. 그러나 개인정보 삭제에서 중요한 것은 얼굴의 형태를 인식하지 못하게 만드는 것이 아니라, 시각적 얼굴 정보와 텍스트 개인정보 사이에 학습된 연관 관계를 끊는 것입니다.

예를 들어 모델은 사진 속 인물의 표정이나 안경, 머리색은 계속 설명할 수 있어야 합니다. 반면 그 얼굴과 함께 학습된 이름, 주소, 의료 기록은 더 이상 답하거나 복원할 수 없어야 함을 본 논문에서는 강조하고 있습니다.

Fictitious Facial Identity Dataset Construction


실제 인물의 개인정보를 사용하면 benchmark 자체가 새로운 privacy risk를 만들 수 있습니다. 또한 pretrained model이 해당 인물을 이미 얼마나 알고 있었는지 통제하기 어렵습니다. FIUBench는 이러한 문제를 피하기 위해 합성 얼굴과 무작위로 만든 가상의 profile을 사용합니다.

먼저 SFHQ의 가상 얼굴 데이터셋을 CLIP feature로 변환하고 UMAP과 K-means 알고리즘을 통해 400개 cluster를 만듭니다. 각 cluster에서 한 장씩 선택하여 비슷한 외형의 얼굴이 반복되는 것을 줄입니다.

각 얼굴에는 이름, 직업, 주소, 전화번호, 건강 기록, 범죄 기록 등을 포함한 가상의 profile을 무작위로 연결합니다. 이후 GPT-4o가 profile마다 20개의 question-answer pair를 생성합니다.

\[400\ \text{identities} \times 20\ \text{QA pairs} = 8000\ \text{VQA pairs}\]

얼굴과 profile은 임의로 연결되므로 정답은 pretrained model의 기존 지식이 아닙니다. 논문은 fine-tuning 전 모델의 privacy keyword overlap이 3.4%에 불과하다는 점도 확인합니다. 이후 모델이 정답을 말할 수 있게 되었다면, 그 지식은 benchmark의 학습 과정에서 새롭게 형성된 것으로 볼 수 있습니다. 논문에서는 생성한 가상 profile과 그 얼굴 데이터셋이 pretrained model의 기존 지식에 포함되어 있는지 확인하고자 하였고, fine-tuning 전 모델의 privacy keyword overlap이 3.4%에 불과하다는 점을 통해 해당 가상 데이터셋이 pretrained model에서 사전 학습되지 않았음을 알 수 있습니다.

Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
가상의 얼굴-개인정보 지식을 학습시킨 뒤 선택적으로 삭제하고 평가하는 FIUBench pipeline

Two-Stage Pipeline


실제 pre-training data에서는 특정 개인정보가 몇 번 등장했는지 알기 어렵기 때문에 FIUBench는 먼저 삭제 대상 지식을 학습시키고, 그다음 일부 인물의 지식을 제거하는 two-stage pipeline을 적용합니다.

Stage I: Learning

모델은 얼굴 이미지와 privacy question을 입력받아 profile의 정답을 auto-regressive하게 생성하도록 fine-tuning되어 얼굴-텍스트 정보 지식을 모델이 학습하도록 합니다.

Stage II: Unlearning

학습 데이터는 identity 단위로 forget set과 retain set으로 나뉩니다. 기본 5-95 split에서는 20명의 모든 QA pair를 forget set으로 사용하고, 나머지 380명의 정보는 보존합니다. 한 인물의 질문이 두 set에 동시에 들어가지 않기 때문에 같은 개인정보가 retain data를 통해 다시 제공되는 것을 막습니다.

이상적인 unlearned model은 forget set의 데이터를 한 번도 보지 않고 retain set만 학습한 Retain Model과 비슷하게 행동해야 합니다.

Unlearning Methods


FIUBench는 LLM unlearning에서 사용된 네 가지 언러닝 방법을 VLM에 적용합니다.

Gradient Ascent(GA)는 forget answer의 loss를 증가시켜 원래 정답의 probability를 낮춥니다. 빠르게 정답을 훼손할 수 있지만, update가 강해지면 일반적인 생성 능력도 함께 손상될 수 있다는 단점이 존재합니다.

Gradient Difference(GD)는 forget set에 대한 loss를 증가시키고 retain set에 대한 정상 loss를 최소화합니다. GA보다 보존을 고려하지만 forget과 retrain의 gradient가 충돌할 수 있습니다.

KL Minimization(KL)은 forget set에 GA를 적용하면서 retain set의 output distribution이 원래 모델과 크게 달라지지 않도록 제한합니다. 기존 행동을 보존하는 대신 삭제 강도가 약해질 수 있습니다.

Preference Optimization(PO)은 private answer를 I cannot answer that.과 같은 refusal response로 교체하여 모델이 해당 질문을 거절하도록 학습합니다. 출력에서 개인정보가 출력되는 것을 막도록 강제할 수 있지만, 원래 정답에 대한 내부 likelihood까지 제거한다고 보장하지는 않습니다.

Evaluation


FIUBench는 평가 지표를 Model Utility, Forget Quality, Robust Evaluation와 같이 3가지 지표를 사용합니다.

Model Utility는 retain knowledge와 일반적인 VLM 능력이 유지되는지 확인합니다. Retain set의 답변은 ROUGE-L, semantic correctness, Truth Ratio로 평가하고, 일반 이미지 이해 능력은 MME와 POPE 지표를 통해 평가합니다.

Forget Quality는 unlearned model과 Retain Model이 forget set에서 비슷하게 행동하는지 평가합니다. 생성 답변에 private keyword가 다시 나타나는지는 Exact Match로 확인하고, 두 모델의 Truth Ratio 분포는 KS-Test로 비교합니다. 높은 KS p-value는 unlearned model의 분포가 해당 정보를 처음부터 학습하지 않은 Retain Model과 통계적으로 구분되기 어렵다는 뜻으로 해석 가능합니다.

Robust Evaluation은 VLM이 동일한 의미를 지닌 질문을 다양한 형태로 처리할 수 있다는 점을 고려하여, 멤버십 추론 공격과 정교하게 설계된 적대적 개인정보 공격(Adversarial Privacy Attacks)을 활용한 견고한 평가 지표를 제공하고자 합니다.

  • Membership Inference Attack(MIA)은 정답 token 중 모델이 가장 낮은 확률을 부여한 K% token의 likelihood를 사용합니다. Forget answer가 여전히 training member처럼 높은 likelihood를 받는다면 학습 흔적이 남아 있을 가능성이 있다고 해석할 수 있습니다.
  • Adversarial Privacy Extraction(APE)은 forget question을 여러 형태로 paraphrase한 뒤 private keyword가 다시 추출되는지 확인합니다. 원래 질문 문장에만 거절하도록 학습된 모델을 구분하기 위한 평가 지표입니다.

실험 결과


Stage I fine-tuning 이후 모델은 가상의 얼굴과 profile을 연결해 답할 수 있게 됩니다.

Stage II의 핵심 결과는 네 방법 모두 forgetting과 utility를 동시에 만족하지 못했다는 것입니다.

  • GA는 forget answer의 probability를 빠르게 낮추지만 model utility도 크게 손상시킵니다.
  • GD는 retain loss를 함께 사용해 GA보다 균형이 낫지만 성능 저하를 피하지 못합니다.
  • KL은 기존 distribution을 보존하는 대신 충분한 언러닝을 달성하기 어렵습니다.
  • PO는 Exact Match와 APE를 낮추지만 MIA에서는 언러닝이 효과적으로 이루어지지 못하였습니다.
Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
Baseline unlearning method의 Forget Quality와 Model Utility 비교

Gradient 기반 방법은 unlearning step을 늘릴수록 forget metric이 개선되지만 retain 성능도 계속 하락합니다. 이는 모델을 충분히 손상시키면 낮은 정답률을 얻을 수 있다는 뜻으로 해석할 수 있습니다.

Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
언러닝 step에 따른 baseline 언러닝 알고리즘의 성능 차이

PO의 결과는 직접 출력과 내부 지식의 차이를 보여줍니다. 모델이 privacy question에 거절을 출력하더라도 정답 sequence에 높은 likelihood를 부여한다면, 질문을 이해한 뒤 답을 숨기고 있을 뿐 지식 자체가 제거되었다고 보기 어렵습니다.

한계


FIUBench는 정보의 출처와 노출량을 통제하기 위해 Stage I fine-tuning으로 가상의 지식을 주입합니다. 이 설계는 unlearning 전후를 명확하게 비교할 수 있다는 장점이 있지만, web-scale pre-training에서 여러 문맥으로 반복 학습된 실제 개인정보와는 차이가 존재합니다.

Retain Model은 전체 재학습에 가까운 이상적인 reference를 제공하지만, 두 모델의 output distribution이 비슷하다는 사실만으로 parameter 수준에서 정보가 완전히 삭제되었다고 증명할 수는 없습니다. MIA 역시 특정 score와 공격자 가정에 의존하므로, 낮은 공격 성공률을 완전한 삭제 certificate로 해석해서는 안 됨을 설명하고 있습니다.

또한 합성 얼굴과 정형화된 VQA는 통제에는 유리하지만 실제 privacy request의 다양성을 충분히 반영하지 못한다는 한계점이 존재합니다. 실제 서비스에서는 문서, 대화 기록, 여러 이미지와 반복적으로 연결된 개인정보가 삭제 대상이 될 수 있습니다.

결론


FIUBench는 VLM unlearning을 얼굴의 시각적 특징을 제거하는 문제가 아니라, 얼굴과 연결된 텍스트 개인정보를 선택적으로 제거하는 문제로 정의합니다. 이를 위해 400개의 합성 얼굴과 8000개의 private VQA pair를 만들고, 지식을 먼저 학습한 뒤 identity 단위로 일부를 삭제하는 two-stage pipeline을 제안합니다.

논문의 가장 중요한 기여는 새로운 unlearning algorithm을 제시하는 것이 아닌 새로운 평가 기준에 있습니다. 개인정보가 출력되지 않는지만 확인하지 않고, 처음부터 해당 정보를 학습하지 않은 model과의 분포 비교, Membership Inference Attack, paraphrased question을 이용한 privacy extraction까지 함께 평가합니다.

실험 결과 기존 방법은 강한 forgetting과 model utility를 동시에 확보하지 못했습니다. 특히 refusal을 학습한 모델에서 직접적인 개인정보 출력은 줄었지만 likelihood 기반 공격에는 학습 흔적이 남았습니다. 따라서 VLM unlearning은 답변을 숨기는 behavior alignment와 학습된 cross-modal association을 제거하는 knowledge removal을 구분해서 평가해야 함을 본 논문에서 제시하고 있습니다.