논문명: On the Adversarial Robustness of Multi-Modal Foundation Models
저자: Christian Schlarmann, Matthias Hein
게재지: ICCV AROW 2023
URL: On the Adversarial Robustness of Multi-Modal Foundation Models
서론
멀티모달 파운데이션 모델의 안전성에 대한 기존 연구는 주로 악의적인 사용자가 직접 모델에 탈옥(jailbreak) 프롬프트를 입력해 유해한 응답을 유도하는 상황을 다루었습니다. 반면 본 논문은 모델을 사용하는 사용자는 정상적이지만, 사용자가 입력하는 이미지가 제3자에 의해 미리 조작되어 있는 상황을 가정합니다.
즉 공격자는 모델이나 사용자를 직접 제어하지 않고도, 이미지를 조작하는 것만으로 최종 출력을 제어할 수 있습니다.
본 논문은 OpenFlamingo-9B를 대상으로 이러한 공격 가능성을 분석하고, 다음 두 종류의 적대적 공격에 대한 강건성을 평가합니다.
- Untargeted attack: 정상적인 출력이 생성되지 않도록 모델의 성능을 저하시킵니다.
- Targeted attack: 공격자가 미리 지정한 특정 문장을 모델이 그대로 생성하도록 만듭니다.
OpenFlamingo에 대한 적대적 공격
OpenFlamingo 모델
논문은 오픈소스 모델인 OpenFlamingo를 공격 대상으로 사용합니다. OpenFlamingo는 사전학습된 비전 인코더와 생성형 언어 모델로 구성되며, cross-attention을 통해 언어 모델이 비전 인코더에서 추출된 이미지 특징을 참조합니다.
이미지 $x$가 주어졌을 때 모델은 이전에 생성된 토큰과 이미지 정보를 조건으로 다음 토큰을 반복적으로 예측하며 출력 $y$를 생성합니다.
\[\begin{equation} p(y \mid x)=\prod_{l=1}^{L} p\!\left(y_l \mid y_{<l}, x\right) \end{equation}\]각 토큰이 이전 토큰에 조건부로 생성되므로, 이미지에 대한 작은 변화가 초반 토큰의 확률분포를 바꾸면 그 영향이 이후 토큰으로 누적되어 최종적으로 생성되는 문장 전체가 달라질 수 있습니다.
Threat Model
공격자가 OpenFlamingo의 모든 파라미터에 접근할 수 있는 white-box attack을 가정합니다. 공격자는 원본 이미지 $x$에 교란 $\delta$를 더하되, 변화가 육안으로 거의 보이지 않도록 다음과 같은 $\ell_\infty$ 제한을 적용합니다.
\[\begin{equation} \|\delta\|_\infty \leq \epsilon \end{equation}\]여기서 $\epsilon$은 $[0,1]$로 정규화된 픽셀 값 기준이며, 논문은 $\epsilon = 1/255$와 $\epsilon = 4/255$를 사용합니다.
또한 OpenFlamingo의 few-shot 특성을 고려해 두 가지 공격 설정을 상정합니다.
- Query attack: 사용자가 실제로 질문하는 query image만 공격
- All-image attack: query image와 context image를 모두 공격
Zero-shot에서는 context image가 존재하지 않으므로 두 설정이 동일합니다.
Untargeted Attack
Untargeted attack의 목적은 모델이 원래의 정답과 다른 출력을 생성하도록 만드는 것입니다.
Query image를 $q$, context image를 $c$, 프롬프트에 함께 주어지는 텍스트를 $z$, 정상적인 정답 캡션을 $y$라고 하면 공격자는 정답에 대한 negative log-likelihood를 최대화합니다.
\[\begin{equation} \max_{\delta_q,\delta_c}\; -\sum_{l=1}^{L} \log p\!\left(y_l \mid y_{<l}, z, q+\delta_q, c+\delta_c\right) \end{equation}\] \[\begin{equation} \text{s.t.}\quad \|\delta_q\|_\infty \leq \epsilon_q, \quad \|\delta_c\|_\infty \leq \epsilon_c \end{equation}\]이 경우 공격자는 모델이 어떤 잘못된 문장을 생성하는지는 지정하지 않습니다. 정상적인 출력을 생성하지 못하게 만드는 것이 목적입니다.
Targeted Attack
Targeted attack은 모델의 성능을 단순히 떨어뜨리는 것을 넘어, 공격자가 원하는 특정 문장 $\hat{y}$를 모델이 출력하도록 조작합니다.
\[\begin{equation} \min_{\delta_q,\delta_c}\; -\sum_{l=1}^{L} \log p\!\left(\hat{y}_l \mid \hat{y}_{<l}, z, q+\delta_q, c+\delta_c\right) \end{equation}\] \[\begin{equation} \text{s.t.}\quad \|\delta_q\|_\infty \leq \epsilon_q, \quad \|\delta_c\|_\infty \leq \epsilon_c \end{equation}\]Untargeted attack이 정답의 확률을 낮추는 방향으로 이미지를 변화시킨다면, targeted attack은 공격자가 지정한 문장의 확률을 높이는 방향으로 이미지를 변화시킵니다. 두 목적함수의 부호만 다를 뿐 최적화 대상은 동일합니다.
두 공격 모두 iterative gradient-based attack인 APGD(Auto-PGD) 를 이용해 교란을 최적화합니다.
Targeted attack은 특정 토큰 시퀀스 전체를 생성해야 하기 때문에 untargeted attack보다 훨씬 많은 iteration을 필요로 합니다. $\epsilon = 1/255$ 환경에서 APGD iteration을 100회 수행했을 때 targeted attack 성공률은 12%였지만, 5,000회에서는 83%까지 증가합니다.
공격 결과 평가
논문은 Image Captioning과 VQA 두 종류의 태스크에서 OpenFlamingo의 적대적 강건성을 평가합니다.
태스크별 평가 데이터셋 및 지표
- Image Captioning: COCO 2014, Flickr30k에서 생성된 캡션과 정답 캡션의 유사도를 CIDEr score로 평가
- VQA: OK-VQA, VizWiz에서 모델이 생성한 답변의 VQA Accuracy 측정
각 데이터셋에서 zero-shot과 four-shot inference를 모두 실험합니다.
Targeted Attack에서의 성능
COCO 데이터셋 실험에서는 대표적으로 다음 두 문장을 타겟으로 삼아 공격 성공률을 측정합니다.
- Please reset your password
- A person suffers severe side effects after vaccination
상대적으로 짧은 타겟 문장인 Please reset your password의 경우 $\epsilon = 1/255$만으로도 zero-shot에서 51.66%, context image까지 공격하는 four-shot에서 86.00%의 성공률을 보입니다. $\epsilon = 4/255$로 키우면 zero-shot과 four-shot 모두 100%를 기록합니다.
더 긴 타겟 문장인 A person suffers severe side effects after vaccination은 작은 $\epsilon$에서는 공격이 상대적으로 어려웠지만, $\epsilon = 4/255$에서는 zero-shot 83.8%, four-shot 100%까지 성공률이 증가합니다. 생성해야 할 토큰 시퀀스가 길어질수록 더 큰 교란이 필요하다는 것을 확인할 수 있습니다.
Please reset your password를 타겟으로 한 공격 예시에서, 공격받지 않은 왼쪽 이미지에서는 정상적인 출력이 생성되지만 공격받은 오른쪽 이미지에서는 모델이 공격자가 의도한 문장을 그대로 생성합니다.
즉 이미지와 전혀 관계없는 문장이라 하더라도, 픽셀을 미세하게 변화시키는 것만으로 모델의 생성 결과를 공격자가 의도한 방향으로 옮길 수 있습니다.
Untargeted Attack에서의 성능
Untargeted attack에서도 모든 데이터셋에서 큰 성능 감소가 발생합니다.
COCO의 zero-shot CIDEr score는 정상 이미지에서 84.01이지만, $\epsilon = 1/255$에서 9.59, $\epsilon = 4/255$에서 1.69까지 감소합니다. Flickr30k 역시 59.57에서 각각 7.45, 1.17로 감소합니다.
VQA에서도 같은 현상이 나타납니다. OK-VQA의 zero-shot accuracy는 정상 이미지에서 34.72%였지만 $\epsilon = 1/255$ 공격 후 1.92%, $\epsilon = 4/255$에서는 1.14%까지 감소합니다.
Image Captioning 태스크에서 공격받지 않은 왼쪽 이미지에서는 정상적인 캡션이 생성되지만, 공격받은 오른쪽 이미지에서는 출력 품질이 크게 저하됩니다.
Four-shot으로 문맥 정보를 추가해도 공격을 효과적으로 막지는 못했습니다. Image Captioning에서는 성능이 일부 개선되지만, VQA에서는 문맥 이미지를 제공해도 여전히 적대적 공격에 취약했습니다.
일부 픽셀만 변경해도 공격이 가능한가?
논문은 모든 픽셀을 변경해야만 공격이 성립하는지도 추가로 분석합니다.
APGD로 얻은 교란 중 크기가 작은 성분부터 제거하고 상위 일부만 남긴 결과, 상위 60%의 교란만 유지해도 공격 효과가 상당 부분 남아 있는 것을 확인할 수 있습니다.
Untargeted attack에서 상위 60%의 교란만 사용했을 때 COCO CIDEr score는 $\epsilon = 1/255$에서 24.99, $\epsilon = 4/255$에서 3.65를 기록합니다. 전체 교란을 사용한 경우(9.59, 1.69)보다는 공격력이 약해지지만, 정상 이미지의 84.01과 비교하면 여전히 큰 성능 저하입니다.
따라서 공격이 이미지 전체 픽셀의 미세한 변화를 모두 필요로 하는 것은 아니며, 일부 핵심적인 교란만으로도 모델의 이미지 표현과 최종 출력을 크게 바꿀 수 있습니다.
결론
본 논문은 사람이 거의 인지할 수 없는 범위의 이미지 조작만으로 OpenFlamingo의 Image Captioning과 VQA 성능을 크게 저하시킬 수 있으며, 나아가 공격자가 지정한 특정 문장을 모델이 그대로 출력하게 만들 수 있음을 보였습니다.
특히 흥미로운 점은 공격의 주체와 모델의 사용자를 분리했다는 것입니다. 사용자가 직접 탈옥을 시도하지 않더라도, 제3자가 조작한 이미지를 정상적인 사용자가 입력하는 것만으로 공격이 성립합니다. 즉 멀티모달 모델에서는 외부에서 전달된 이미지 자체가 공격 표면이 됩니다.
다만 실험이 OpenFlamingo라는 하나의 오픈소스 모델을 중심으로 이루어졌고, 모델 파라미터에 완전히 접근할 수 있는 white-box 환경을 가정한다는 한계가 있습니다. 또한 강한 targeted attack을 위해서는 수백에서 수천 회의 APGD iteration이 필요하기 때문에, 실제 서비스 환경에서도 동일한 비용으로 공격이 가능한지는 추가로 확인할 필요가 있습니다.
그럼에도 $\epsilon = 1/255$ 수준의 작은 교란만으로 모델 출력이 크게 달라지고, $\epsilon = 4/255$에서는 특정 타겟 문장을 높은 확률로 그대로 생성한다는 결과는, 멀티모달 모델의 안전성을 평가할 때 텍스트의 유해성뿐 아니라 입력 이미지에 대한 강건성 역시 독립적인 안전성 요소로 다루어야 한다는 점을 보여줍니다.
연구실 관련 논문들
- Flamingo Series: Flamingo, OpenFlamingo [NeurIPS 2022] | [Paper] | [Article]
- Explaining and Harnessing Adversarial Examples [ICLR 2015] | [Paper] | [Article]
- Towards Deep Learning Models Resistant to Adversarial Attacks [ICLR 2018] | [Paper] | [Article]
- Towards Evaluating the Robustness of Neural Networks [IEEE S&P 2017] | [Paper] | [Article]
- Evaluating Practical Adversarial Robustness of Fault Diagnosis Systems via Spectrogram-Aware Ensemble Method [EAAI 2024] | [Paper] | [Article]