논문명: Jailbreak in pieces: Compositional Adversarial Attacks on Multi-Modal Language Models

저자: Erfan Shayegani, Yue Dong & Nael Abu-Ghazaleh

게재지: ICLR 2024

URL: Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models

Jailbreak in Pieces

서론

기존 Visual Adversarial Attack 연구에서는 이미지 픽셀을 조작하여 연결된 LLM의 유해한 응답을 유도했습니다. 이러한 방법은 공격자가 모델의 parameter와 gradient에 접근할 수 있는 White-box 환경을 가정하기 때문에 모델 내부에 접근할 수 없는 환경(Black-box model)에서는 같은 방법을 직접 적용하기 어려웠습니다.

반면 본 논문은 LLM의 출력 확률을 직접 최적화하지 않고, Vision Encoder가 생성하는 Embedding을 공격 대상으로 사용합니다. 유해한 요청을 텍스트와 이미지로 나누고, 두 입력이 결합되었을 때 모델이 유해한 응답을 생성하도록 유도하는 것입니다.

따라서 본 논문은 다음과 같은 연구 질문을 다룹니다.

유해한 요청을 텍스트와 이미지로 나누어 입력하면 Safety Alignment를 우회할 수 있는가? 그리고 LLM에 직접 접근하지 않고도, 이미지에 포함된 유해한 의미를 숨길 수 있는가?

그리고 논문의 주요 기여는 다음과 같이 정리할 수 있습니다.

  1. 텍스트 지시문과 이미지의 의미가 결합하는 Compositional Jailbreak 공격 방법론을 소개합니다.
  2. LLM에 접근하지 않고, Vision Encoder의 Embedding을 이용해 유해한 의미를 적대적 이미지에 숨기는 방법을 소개했습니다.

공격 방법론

Jailbreak in Pieces

본 논문은 공격자가 CLIP과 같은 Vision Encoder에 접근하고, 이미지 입력에 대한 gradient를 계산할 수 있다고 가정합니다. 반면 LLM의 parameter, Linear Layer에는 접근할 필요가 없습니다. 따라서 LLM에 대해서는 Black-box이지만, 전체 VLM에 대한 완전한 Black-box Attack은 아닙니다.


Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models
이미지+텍스트 결합 프롬프트 예시

공격자는 적대적 이미지와 텍스트 프롬프트를 결합해서 모델에 보냅니다. 여기서 텍스트 프롬프트은 수행할 작업을 설명하지만, 그 작업의 대상은 이미지에서 가져오도록 구성한 지시문입니다.

Compositional Attack

본 논문의 공격은 유해한 요청 전체를 텍스트로 전달하는 대신, 수행할 작업과 그 작업의 대상을 서로 다른 입력에 나누어 전달합니다.


Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models
Compositionality 예시 설명 그림

텍스트는 모델이 무엇을 해야 하는지 설명하고, 이미지는 그 지시문이 가리키는 대상이나 상황을 설명합니다. 모델은 두 입력을 같이 해석하면서 텍스트에 직접 명시되지 않은 내용을 이미지에서 가져오게 됩니다.

이러한 구성에서는 하나의 적대적 이미지를 여러 텍스트 지시문과 같이 사용할 수 있습니다. 반대로 하나의 텍스트 지시문에 서로 다른 적대적 이미지를 연결할 수도 있습니다. 논문에서 말하는 Compositionality는 이처럼 이미지와 텍스트를 조합해서 재사용/결합할 수 있다는 의미입니다.

Malicious Trigger 구성


Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models
Malicious Trigger 4가지 시각 예시

공격자는 먼저 적대적 이미지가 어떤 의미를 가지도록 만들 것인지 정해야 합니다. 논문에서는 이 목표를 Malicious Trigger라고 하며, 다음 4가지 방식으로 Target Embedding을 구성합니다.

Trigger 종류 Target Embedding 구성 방법
Textual Trigger 유해한 텍스트를 CLIP의 Text Encoder에 입력합니다.
OCR Textual Trigger 유해한 텍스트가 적힌 이미지를 Vision Encoder에 입력합니다.
Visual Trigger 유해한 대상이나 장면을 나타내는 이미지를 Vision Encoder에 입력합니다.
Combined Trigger 텍스트와 시각적 대상이 함께 포함된 이미지를 Vision Encoder에 입력합니다.

여기서 4가지 방법은 최적화의 목표가 되는 Embedding을 구성하는 방식의 차이입니다. Textual Trigger도 최종적으로는 적대적 이미지를 생성하는 데 사용됩니다.

또한 유해한 이미지나 문구를 그대로 입력하면 사람이나 이미지 필터가 내용을 확인할 수 있습니다. 본 논문은 이를 피하기 위해 원래 Trigger와 비슷한 Embedding을 가지면서도, 겉으로는 해당 내용을 드러내지 않는 이미지를 생성합니다.

Optimization Objective

공격자는 적대적 이미지의 Embedding이 Malicious Trigger의 Embedding에 가까워지도록 이미지 픽셀을 최적화합니다. 이를 다음과 같이 표현할 수 있습니다. \(\hat{x}_{\mathrm{adv}} = \underset{x_{\mathrm{adv}}\in\mathcal{B}}{\arg\min} \mathcal{L}_{2} \left( H_{\mathrm{harm}}, \mathcal{I}_{\phi}(x_{\mathrm{adv}}) \right)\)

여기서 $x_{\mathrm{adv}}$는 최적화되는 이미지이고, $H_{\mathrm{harm}}$은 고정된 Target Embedding입니다. $\mathcal{I}{\phi}$는 Vision Encoder, $\mathcal{L}{2}$는 두 Embedding 사이의 $L_2$ 거리이며, $\mathcal{B}$는 이미지 입력에 적용되는 제약입니다.

공격은 직접 줄이는 값은 적대적 이미지와 Target 사이의 Embedding Distance입니다. 이 차이 때문에 최적화 과정에서 LLM의 응답을 거쳐 gradient를 계산할 필요가 없습니다.

Optimization Method


Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models
적대적 이미지 최적화 흐름

먼저 Target Trigger를 Encoder에 입력하여 $H_{\mathrm{harm}}$을 계산한 뒤 고정합니다. 이후 초기 이미지의 Embedding을 계산하고, 두 Embedding 사이의 $L_2$ loss가 감소하도록 이미지 픽셀을 반복해서 업데이트합니다. 이 과정에서는 Vision Encoder를 거쳐 이미지 픽셀까지 Backpropagation을 수행합니다.

실험 결과

논문은 LLaVA와 LLaMA-Adapter V2를 대상으로 공격을 평가합니다. 공격에 사용하는 CLIP Encoder는 각각 ViT-L/14-336과 ViT-B/32이며, Adam의 learning rate는 $0.1$로 설정했습니다.

평가 데이터셋 및 지표

논문은 Sexual, Hateful, Violence, Self-Harm, Harassment와 관련 총 8가지 시나리오를 사용합니다. 각 시나리오에서는 4가지 Trigger 전략을 이용해 적대적 이미지 8개를 생성하고, Generic Prompt 2개와 함께 평가합니다.

Human Evaluation에서는 세 명의 평가자가 입력 이미지나 최적화에 사용된 Trigger를 보지 않고, 모델의 출력과 해당 시나리오를 바탕으로 유해성을 판단합니다.

성공 여부는 모델이 유해한 요청을 실제로 수행했는지를 기준으로 평가합니다. 단순히 대상을 설명하거나 위험성을 안내하는 응답은 성공으로 보지 않으며, 경고문이 포함되어 있더라도 요청한 유해한 내용을 제공하면 성공으로 판단합니다

Human Evaluation에서의 성능

각 Trigger에 대한 평균 Attack Success Rate는 다음과 같습니다.


Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models
Human Evaluation 성능 표

Textual Trigger는 두 모델에서 거의 성공하지 못한 반면, 이미지에서 얻은 Target Embedding을 사용한 공격은 높은 성공률을 보였습니다. Combined Trigger가 평균적으로 가장 높지만, 모든 시나리오에서 다른 Trigger보다 항상 좋은 것은 아닙니다.

여기서 중요한 점은 이미지에 텍스트가 포함되어 있는지가 아니라, 어느 modality의 Encoder를 통해 Target Embedding을 얻었는지에 따라 결과가 크게 달라졌다는 것입니다.

Automatic Evaluation에서의 성능

논문은 LLaMA-Adapter V2의 출력에 대해 Perspective API와 Toxicity Classifier를 이용한 자동 평가도 진행했습니다. Textual Trigger에서는 독성 점수가 낮았지만, Visual Trigger와 Combined Trigger에서는 더 높은 독성 점수가 나타났습니다.


Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models
Toxicity 결과 비교표

이 결과는 Human Evaluation과 비슷한 경향을 보여줍니다. 다만 Toxicity 점수와 유해 지시문에 대한 수행 성공률은 서로 다른 지표입니다. 따라서 독성이 높은 문장이 생성되었다는 사실만으로, 모델이 요청된 작업을 정확히 수행했다고 해석해서는 안 됩니다.

결론

본 논문은 VLM의 Safety Alignment를 평가할 때 텍스트와 이미지를 각각 보는 것만으로는 충분하지 않으며, 두 입력이 결합되어 만들어지는 의미까지 고려해야 한다는 점을 보여줍니다. 유해한 요청의 대상을 이미지에 나누어 전달하면, 텍스트만으로는 드러나지 않는 공격이 성립할 수 있습니다.

공격자는 모델 parameter를 변경하지 않고, Vision Encoder의 Embedding Distance가 줄어들도록 이미지 픽셀만 최적화합니다. 이렇게 생성된 이미지는 여러 Generic Textual Instruction과 함께 재사용되어 Compositional Jailbreak의 구성 요소로 작동할 수 있습니다.

따라서 멀티모달 모델의 안전성을 확보하려면 텍스트 중심의 Safety Alignment뿐만 아니라, 이미지에서 전달되는 정보와 텍스트 지시문이 함께 해석되는 과정에 대한 Cross-modal Safety Alignment도 고려해야 합니다.