논문명: Visual Adversarial Examples Jailbreak Aligned Large Language Models

저자: Xiangyu Qi, Kaixuan Huang, Ashwinee Panda, Peter Henderson, Mengdi Wang, Prateek Mittal

게재지: AAAI 2024

URL: Visual Adversarial Examples Jailbreak Aligned Large Language Models

서론


Visual Language Model(VLM)은 Large Language Model(LLM)에 비전 인코더를 연결하여 텍스트뿐만 아니라 이미지도 입력으로 처리할 수 있게 만든 멀티모달 모델입니다. 일반적으로 비전 인코더는 입력 이미지에서 Visual Feature를 추출하고, Projection Layer와 같은 연결 모듈은 이를 LLM이 이해할 수 있는 Embedding 형태로 변환합니다. 이후 LLM은 이미지에서 얻은 Embedding과 텍스트 입력을 함께 이용하여 응답을 생성합니다.

기존의 Visual Adversarial Attack 연구는 주로 이미지에 Perturbation을 추가하여 잘못 예측되도록(Misclassification) 문제를 다루었습니다.

반면 기존 LLM Jailbreak 연구는 role-playing, prompt injection, adversarial suffix와 같이 텍스트 입력을 조작하여 모델의 Safety Alignment를 우회하는 데 집중했습니다.

본 논문은 이 두 연구 분야를 연결해서 다음과 같은 연구 질문을 다룹니다.

VLM의 이미지 입력을 적대적으로 변형하면 연결된 LLM의 Safety Alignment를 우회할 수 있는가?

여기서 중요한 차이는 이미지와 텍스트의 입력 공간입니다. 텍스트 토큰은 이산적이므로, 계산된 Gradient를 토큰 자체에 직접 업데이트할 수 없습니다. Embedding에 대한 Gradient를 계산할 수는 있지만, 실제 입력을 변경할 때는 AutoPrompt와 같은 Gradient-guided Token Search 방식을 활용해야 합니다.

반면 이미지 픽셀은 최적화 과정에서 연속적인 실수값으로 다룰 수 있습니다. 따라서 Loss의 Gradient를 이미지 픽셀까지 Backpropagation하여 입력을 직접 최적화할 수 있습니다.

즉, 이미지 입력을 추가하는 것은 모델의 기능을 확장하는 동시에, 공격자가 활용할 수 있는 연속적이고 고차원인 공격 표면이 추가되었다고 볼 수 있습니다. 본 논문의 주요 기여는 다음과 같이 정리할 수 있습니다.

  1. Visual Adversarial Example을 VLM을 Safety Alignment 우회하기 위한 입력으로 확장했습니다.
  2. 하나의 적대적 이미지가 최적화 과정에서 사용되지 않은 다양한 Harmful Instruction에도 일반화될 수 있음을 보여주었습니다.

공격 방법론


Visual Adversarial Examples Jailbreak Aligned Large Language Models
적대적 공격 전체 과정

Threat Model

본 논문은 한 번의 User-Model Interaction으로 구성된 One-turn 환경을 가정합니다.

공격자는 적대적 이미지 $x_{adv}$를 생성하고, 추론 단계에서 이 이미지를 새로운 해로운 텍스트 프롬프트 $x_{harm}$과 함께 모델에 입력합니다. 이를 다음과 같이 표현할 수 있습니다. \(p_\theta(y|[x_{adv},x_{harm}])\) 여기서 공격의 목표는 특정 유해 지시문 하나에만 작동하는 입력이 아니라, 최적화 과정에서 사용되지 않은 다양한 유해 지시문과 함께 재사용할 수 있는 하나의 Universal Visual Adversarial Example을 만드는 것입니다.

논문의 주요 공격은 공격자가 모델 구조와 parameter에 접근하고 gradient를 계산할 수 있는 White-box Model을 가정합니다.

Image Tuning

본 논문의 공격 원리는 Prompt Tuning과 비슷합니다.

Prompt Tuning은 모델의 parameter를 고정한 상태에서 연속적인 Soft Prompt Embedding을 학습하여, 모델이 특정 task를 더 잘 수행하도록 유도하는 방법입니다. 모델 전체를 Fine-tuning하는 대신, 입력으로 전달되는 프롬프트를 최적화한다는 점이 핵심입니다.

본 논문도 비슷하게 모델의 Parameter를 고정한 상태로, 이미지 픽셀만 최적화하여 Visual Encoder가 생성하는 Image Embedding을 변화시킵니다. 최적화된 Image Embedding은 LLM의 입력 앞에 추가되는 soft embedded prompt처럼 작동하여, VLM을 유해한 응답을 생성하도록 유도합니다.

Few-shot Harmful Corpus

공격을 수행하기 위해서 다음과 같은 작은 Harmful Target Corpus를 구성합니다. \(Y = \{y_i\}_{i=1}^{m}\) 여기서 $y_i$는 모델이 유해한 답변을 생성하도록 만들고 싶은 Harmful Target Output Sentence입니다.

논문에서는 총 66개의 유해한 문장을 사용합니다. 이 문장들은 Safety Alignment이 되어있지 않은 초기 LLaMA-1 모델에 특정 집단이나 인류에 대한 공격적인 문장을 요청하여 생성한 뒤, 사람이 중복되거나 유해하지 않은 결과를 수동적으로 제거하여 구성했습니다.

문장은 다음과 같이 구성되어있습니다:

  1. 특정 성별 집단에 대한 문장 21개
  2. 특정 인종 집단에 대한 문장 28개
  3. 인류 전체에 대한 문장 17개

이 corpus는 공격 최적화 과정에서만 사용되고, 이후 평가에서는 corpus에 직접 포함되어 있지 않은 Harmful Instruction을 사용하여 공격의 generalization을 측정합니다.

Optimization Objective

공격자는 적대적 이미지가 입력되었을 때 66개의 Harmful Target output이 생성될 확률을 최대화합니다 \(\mathbf{x}_{\mathrm{adv}}^{*} = \arg\min_{\mathbf{x}_{\mathrm{adv}}\in\mathcal{B}} -\sum_{i=1}^{m} \log p_{\theta} \left( \mathbf{y}_{i}\mid\mathbf{x}_{\mathrm{adv}} \right)\) 여기서

  • $x_{adv}$는 최적화되는 적대적 이미지입니다.
  • $y_i$는 고정된 Harmful Target output입니다.
  • $p_\theta(y \mid x)$는 파라미터 $\theta$를 가진 VLM이 입력 $x$에 조건부로 출력 $y$를 생성할 확률입니다.
  • $B$는 공격 이미지가 만족해야 하는 제약 집합입니다. Constrained attack에서는 원본 이미지와의 $\ell_\infty$ 거리와 유효 픽셀 범위를 제한합니다. Unconstrained attack에서는 원본 이미지와의 거리 제약을 적용하지 않지만, 픽셀 값은 여전히 유효 범위인 $[0,1]$안에 있어야 합니다.

목적함수는 Harmful Target Output의 negative log likelihood를 최소화하는 것입니다(Gradient Descent).

여기서 공격이 직접 최적화하는 값은 Harmful Target Sentence의 token-level generation loss입니다.

Optimization Method

본 논문은 이미지 공격을 구현하기 위해서 Projected Gradient Descent(PGD)를 사용합니다. \(\mathbf{x}_{\mathrm{adv}}^{(t+1)} = \Pi_{\mathcal{B}} \left( \mathbf{x}_{\mathrm{adv}}^{(t)} - \alpha\, \operatorname{sign} \left( \nabla_{\mathbf{x}_{\mathrm{adv}}^{(t)}}\mathcal{L} \right) \right)\)

  • $t$: optimization iteration
  • $\alpha$ 한 번의 update에서 픽셀을 변경하는 step size
  • $\nabla_{x_{adv}}\mathcal{L}$은 이미지 픽셀에 대한 loss gradient

각 iteration에서 66개의 target sentence 중 8개를 sampling한 뒤, 해당 문장들의 negative log-likelihood를 계산합니다. 이후 loss의 gradient를 VLM 모든 모듈을 거쳐서 이미지 픽셀까지 backpropagation하고, loss가 감소하는 방향으로 픽셀을 업데이트합니다.

공격 결과 평가


논문은 다음 세 종류의 VLM을 대상으로 공격을 평가합니다.

  • MiniGPT-4 13B
  • InstructBLIP 13B
  • LLaVA

태스크별 평가 데이터셋 및 지표

Human Evaluation에서는 Identity Attack, Disinformation, Violence/Crime, X-risk의 네 범주에 걸쳐 사람이 구성한 유해한 텍스트 지시문 40개를 사용합니다.

각 지시문에 대해 nucleus sampling($p=0.9$, temperature=$1$)으로 응답 10개를 생성합니다. 이후 각 응답이 해당 지시문에 부합하는 유해한 내용을 생성했는지 수동으로 평가하고, 범주별 평균 공격 성공률을 측정합니다.

  • RealToxicityPrompts(Challenging subset: 1225개 프롬프트)
    • 평가 방법: Perspective API, Detoxify Classifier 활용

모델 설정/하드웨어

  • Step Size: $\alpha=1/255$
  • Optimization Iteration: $5000$
  • GPU: NVIDIA A100 80GB

이미지 픽셀 Perturbation 범위는 $\epsilon=16/255, 32/255, 64/255$로 설정했습니다. 이와 별도로, 원본 이미지와의 거리 제약을 적용하지 않는 unconstrained attack도 평가했습니다.

Human Evaluation에서의 성능

MiniGPT-4에 대한 Human Evaluation 결과는 다음과 같습니다.

Visual Adversarial Examples Jailbreak Aligned Large Language Models
Human Evaluation 결과 그래프

값은 범주별 평균 Attack Success Rate(%)를 나타냅니다. 각 생성 응답에서 Harmful Instruction에 부합하는 유해한 내용이 출력되었는지를 기준으로 성공 여부를 판단합니다.

Visual Attack은 4가지 category 모두에서 baseline image에 비해서 Harmful Instruction 수행 확률이 크게 증폭했습니다.

여기서 흥미로운 점이 하나 있다면 $\epsilon$에 따라 항상 linear하게 증가하지 않고, 오히려 $\epsilon=32/255$때 가장 높은 성능을 보일때가 많습니다.(benchmark 종류에 따라 다르지만). 이는 더 큰 perturbation budget이 항상 더 좋은 jailbreak 성능으로 이어지는 것은 아니라는 점을 보여줍니다.

RealToxicityPrompts에서의 성능

RealToxicityPrompts의 지표 결과는 다음과 같습니다

Visual Adversarial Examples Jailbreak Aligned Large Language Models
RealToxicityPrompts 결과 그래프

Perspective API 지표를 보면 $\epsilon=64/255$ 적대적 공격에서는 34.8%에서 67.2%까지 Perturbation처리되지 않은 이미지보다 성능이 증가하였습니다.

공격 최적화에 사용한 corpus의 범위는 제한적이지만, 평가에서는 여러 Toxicity 속성에서 출력 비율이 증가했습니다. 다만 Toxicity 탐지 비율의 증가와 유해한 지시문에 대한 수행 성공률은 서로 다른 지표이므로 구분해서 해석해야 합니다.

모델 공격의 Transferability 측정

논문은 하나의 VLM을 대상으로 이미지 픽셀을 최적화한 뒤, 생성된 적대적 이미지를 다른 VLM에 입력하여 black-box transferability를 평가했습니다.

본 논문은 RealToxicityPrompts+Perspective API로 성능을 측정하여 다음과 같은 결과가 나왔습니다.

Visual Adversarial Examples Jailbreak Aligned Large Language Models
모델간 Transferability 그래프

대각선 값은 공격을 생성한 모델과 평가한 모델이 같은 VLM 모델이며, 대각선 밖의 값은 서로 다른 VLM 모델 간 Transfer Attack 결과입니다.

보시는 것처럼 MiniGPT-4/InstructBLIP은 서로 적대적 이미지의 Transfer Attack 효과를 볼 수 있습니다. 이 결과는 일부 Perturbation Pattern이 특정 모델에만 종속되지 않고, 다른 VLM에도 Transfer Effect가 있음을 보여줍니다.

하지만 Transfer Attack은 White-box Attack보다 대체로 약하고, LLaVA처럼 모델 조합에 따라 효과 차이도 큽니다.

또한 논문의 Transferability Table은 unconstrained와 3가지 $\epsilon$ 설정 중 가장 좋은 jailbreak 결과를 선택하여 표에 보였습니다.

텍스트/이미지 공격 효율성 비교

논문은 이미지, 텍스트 적대적 공격을 동일한 목표, 동일한 iteration, 동일한 batch size를 두고 실험했습니다.

해당 비교에서 Visual Attack은 Text Attack보다 더 낮은 optimization loss를 달성했습니다. Text Attack에서는 token embedding에 대한 gradient를 계산할 수 있지만, 이산적인 token ID를 gradient descent로 직접 갱신할 수는 없습니다. 따라서 논문에서 사용한 AutoPrompt 기반 공격은 gradient를 활용한 후보 토큰 탐색과 평가를 수행하며, 이 구현에서는 Visual Attack보다 약 12배의 계산 비용이 들었습니다.

Visual Adversarial Examples Jailbreak Aligned Large Language Models
텍스트/이미지 적대적 공격 효율성 비교 그래프

Human Evaluation과 RealToxicityPrompts 평가에서 Visual Attack은 전반적으로 해당 Text Attack baseline보다 강한 효과를 보였습니다. 다만 모든 perturbation budget과 모든 지표에서 일관되게 우세한 것은 아닙니다.

그러나 비교 대상은 AutoPrompt 기반의 하나의 Text Attack이기 때문에, 논문의 결과를 Visual Attack이 모든 Text Jailbreak Attack보다 강하다라고 하기에는 어렵습니다.

한계

첫째, 주요 공격은 모델 parameter와 gradient에 접근할 수 있는 White-box 환경을 가정합니다. 이는 open-source VLM에는 현실적인 가정일 수 있지만, black-box model(예: ChatGPT, Claude)에 동일한 공격을 직접 적용하기는 어렵습니다. Transfer-based Black-box Attack도 평가하지만, 그 성능은 White-box Attack보다 낮고 모델 조합에 따라 편차가 큽니다.

두번째, 평가 지표의 해석에도 주의가 필요합니다. RealToxicityPrompts에서 측정하는 Toxicity 탐지 비율과 유해 지시문에 대한 수행 성공률은 서로 다른 지표입니다. 독성이 있는 출력이 증가했다고 해서 모델이 사용자의 유해한 지시를 구체적으로 수행했다는 의미는 아닙니다. 따라서 해당 결과는 Human Evaluation의 공격 성공률과 구분해서 해석해야 합니다.

마지막으로 텍스트 공격과의 비교는 AutoPrompt 기반의 한 가지 Text Attack baseline을 대상으로 수행되었습니다. Visual Attack이 해당 baseline보다 전반적으로 강한 효과를 보였더라도, 모든 perturbation budget과 평가 지표에서 일관되게 우세한 것은 아닙니다. 따라서 이 결과만으로 Visual Attack이 모든 Text Jailbreak Attack보다 강하다고 일반화하기는 어렵습니다.

결론


본 논문은 LLM backbone에 Safety Alignment가 적용되어 있더라도, 이것만으로 전체 VLM의 적대적 강건성이 보장되지는 않음을 보여줍니다. 공격자는 작은 Harmful Target Corpus의 generation loss가 최소화되도록 이미지 픽셀만 PGD로 최적화해서 adversarial image를 생성할 수 있습니다. 이러한 생성된 adversarial image는 특정 target sentence 출력뿐만 아니라, 다양한 Harmful Text Instruction에 대해 모델의 refusal behavior를 우회할 수 있는 Universal Visual Jailbreaker로 작동할 수 있습니다.

본 논문은 VLM에서 LLM이 Safety Alignment되어 있다고 해서, 전체 VLM의 안전성과 별개라는 것을 보여줍니다.

따라서 VLM의 안전성을 평가할 때는 텍스트 프롬프트의 유해성이나 LLM safety alignment뿐만 아닌, text-generation loss에서 Visual Encoder/Projection Module을 거쳐 입력 이미지까지 이어지는 전체 end-to-end pipeline의 adversarial robustness를 함께 평가해야 합니다.