논문명: Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

저자: Jinze Bai, Shuai Bai, Shusheng Yang, Shijie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, Jingren Zhou

게재지: arXiv

URL: https://arxiv.org/abs/2308.12966


논문명: Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution

저자: Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Yang Fan, Kai Dang, Mengfei Du, Xuancheng Ren, Rui Men, Dayiheng Liu, Chang Zhou, Jingren Zhou, Junyang Lin

게재지: arXiv

URL: https://arxiv.org/abs/2409.12191


논문명: Qwen2.5-VL Technical Report

저자: Qwen Team, Alibaba Group

게재지: arXiv

URL: https://arxiv.org/abs/2502.13923


논문명: Qwen3.5-Omni Technical Report

저자: Qwen Team

게재지: arXiv

URL: https://arxiv.org/abs/2604.15804

Qwen-VL


서론

기존 Large Vision-Language Model(LVLM)은 사전 학습된 언어 모델(LLM)에 Vision Encoder를 연결함으로써 이미지에 대한 설명이나 질문 응답을 생성할 수 있었습니다. 그러나 당시 대부분의 오픈소스 모델들은 이미지의 전체적인 의미를 파악하는 데 집중했으며, 이미지 안의 작은 글자를 읽거나 사용자가 지칭한 물체의 위치를 찾는 세밀한 시각 인식에서 한계를 보였습니다.

Qwen-VL은 Qwen-7B에 시각 입력을 연결하여 다음과 같은 시각·언어 능력을 하나의 모델에서 수행하는 것을 목표로 합니다.

  • 일반적인 이미지 캡셔닝과 Visual Question Answering(VQA)
  • 이미지 내부의 문자와 문서를 읽는 Text-oriented VQA
  • 특정 객체를 좌표로 찾거나 좌표가 가리키는 객체를 설명하는 Visual Grounding
  • 여러 이미지가 텍스트와 섞인 입력을 이해하는 Multi-image comprehension

모델 구조

Qwen Series
Qwen-VL Architecture

Qwen-VL은 Visual Encoder, Position-aware VL Adapter, QwenLM의 세 모듈로 구성됩니다.

  • Visual Encoder: OpenCLIP의 ViT-bigG로 초기화된 1.9B 규모의 Vision Transformer입니다. 이미지를 14×14의 패치 단위로 나누어 visual feature sequence를 생성합니다.
  • Position-aware VL Adapter: 0.08B 규모의 단일 Cross-Attention Layer로 구성되어 있습니다. 학습 가능한 256개의 Query가 Visual Encoder의 전체 특징을 참조해, 길이가 긴 이미지 특징을 256개의 visual token으로 압축합니다.
  • QwenLM: Qwen-7B로 초기화된 7.7B 규모의 언어 모델입니다. Visual token과 Text token을 하나의 시퀀스로 받아 다음 토큰을 생성합니다.

VL Adapter는 단순한 projection layer가 아닙니다. 448×448 이미지는 ViT를 거치면 1,024개의 patch feature가 되는데, 이를 그대로 LLM에 입력하면 연산량이 크게 증가합니다. Adapter는 256개의 Query를 이용해 이 시퀀스를 고정된 256개 토큰으로 압축함으로써 LLM의 입력 길이와 연산 비용을 줄입니다.

Position-aware VL Adapter

Adapter의 Cross-Attention layer에서 사용되는 Query는 256개의 Learnable Query Embedding이며, Key와 Value는 ViT가 생성한 visual feature입니다. 각 Query가 이미지 전체의 patch feature를 참조하므로 출력 길이는 항상 256으로 고정됩니다.

다만 압축 과정에서는 각 특징이 이미지의 어느 위치에서 나온 것인지 희석될 수 있습니다. 이를 방지하기 위해 Qwen-VL은 Query와 Key에 2D absolute positional encoding을 더합니다.

\[\begin{equation} \tilde{Q} = Q + P_{\mathrm{query}}, \qquad \tilde{K} = K + P_{\mathrm{image}}, \label{eq:qwen_vl_position_encoding} \end{equation}\]

위치 정보는 Attention score를 계산하는 Query와 Key에만 적용되며 Value에는 더해지지 않습니다. 따라서 Adapter는 어떤 시각 정보가 중요한지를 선택하는 동시에 해당 정보가 이미지의 어느 위치에서 왔는지도 고려할 수 있게 됩니다.

Input-Output Interface

이미지는 Visual Encoder와 Adapter를 거쳐 256개의 visual token으로 변환됩니다. 모델은 이 토큰의 앞뒤에 <img></img>라는 special token을 추가하여 텍스트 토큰과 이미지 토큰을 구분하고, 전체 시퀀스를 QwenLM에 입력합니다.

Qwen-VL은 Grounding 역시 별도의 Detection Head가 아니라 언어 생성 문제로 다룹니다. Bounding Box의 좌표를 $[0,1000)$ 범위로 정규화하고 특수 토큰 사이에 텍스트 형태로 배치합니다. 이 방식으로 모델은 특정 표현에 해당하는 위치를 좌표로 생성하거나, 주어진 좌표가 가리키는 객체를 문장으로 설명할 수 있습니다.

3단계 학습

Qwen Series
Qwen-VL의 3단계 학습 과정

Qwen-VL은 다음과 같은 총 3번의 학습 과정을 거칩니다.

1. Pre-training

첫 단계에서는 224×224의 저해상도 이미지-텍스트 쌍을 사용합니다. QwenLM은 Frozen 상태로 유지하고 Visual Encoder와 VL Adapter를 학습하여, 이미지 특징을 이미 학습된 언어 공간에 먼저 정렬합니다. 학습 데이터셋으로는 5B개의 원본 이미지-텍스트 쌍을 정제한 약 1.4B개의 데이터가 사용됩니다.

2. Multi-task Pre-training

두 번째 단계에서는 입력 해상도를 448×448로 높이고, 모델 전체를 학습합니다. Captioning, VQA, Grounding, OCR, Pure-text Autoregression 등 7개 태스크를 함께 사용하여 작은 글자와 객체 위치처럼 더 세밀한 정보를 학습합니다.

3. Supervised Fine-tuning

마지막 단계에서는 Vision Encoder를 고정하고 VL Adapter와 QwenLM을 Instruction Data로 미세조정하여 Qwen-VL-Chat을 만듭니다. Caption과 Dialogue를 비롯해 Grounding과 Multi-image 대화 데이터를 함께 사용함으로써, 모델이 단순히 이미지를 설명하는 것을 넘어 사용자의 요청 형식에 맞게 응답할 수 있도록 합니다.

실험 결과

Qwen-VL은 Image Captioning과 VQA뿐 아니라 TextVQA, DocVQA, ChartQA, OCR-VQA와 같은 문자 중심 태스크, RefCOCO 계열의 Grounding 태스크에서 비슷한 규모의 Generalist Model보다 높은 성능을 보입니다. 특히 Flickr30K zero-shot captioning과 VQAv2·OKVQA·GQA에서 당시 공개 Generalist Model을 크게 앞섰으며, Qwen-VL-Chat은 TouchStone, SEED-Bench, MME를 통해 실제 대화형 instruction following 능력도 확인합니다.

Qwen Series
Image Captioning과 VQA에서 Qwen-VL 계열의 성능 비교

Learnable Query 개수

Adapter의 Query가 너무 적으면 압축 과정에서 시각 정보가 손실되고, 너무 많으면 LLM의 입력 길이와 학습 난이도가 증가합니다. 본 논문에서는 64, 144, 256, 400개 Query를 비교하고, 정보 보존과 수렴 속도 및 연산량을 고려하여 256개를 선택하였습니다. 본 실험은 visual token 수가 단순한 하이퍼파라미터가 아니라, 시각 정보의 압축률을 결정하는 병목 지점임을 나타냅니다.

Qwen2-VL


서론

Qwen-VL은 고해상도 이미지와 세밀한 시각 정보에 집중했지만, 모든 이미지를 고정된 448×448 크기로 변환한다는 제약이 남아 있습니다. 원본 비율과 해상도가 다른 이미지를 하나의 크기로 맞추면 작은 이미지는 불필요하게 확대되고, 큰 이미지나 긴 문서는 세부 정보가 손실될 수 있습니다.

영상 처리 영역에서도 한계가 존재합니다. 영상은 시간에 따라 변하는 이미지의 연속이지만, 기존 모델은 영상을 별개의 모달리티로 다루거나 1차원 위치 정보만 사용했습니다. 하지만 이러한 방식으로는 영상 속 시간 변화와 프레임 내부의 2차원 위치를 동시에 표현하기 어렵습니다.

Qwen2-VL은 기존의 Vision Encoder–Connector–LLM 구조를 유지하면서 다음 세 가지 변화에 초점을 맞춥니다.

  • 이미지마다 서로 다른 수의 visual token을 만드는 Naive Dynamic Resolution
  • 텍스트·이미지·영상의 위치를 통합하는 Multimodal Rotary Position Embedding(MRoPE)
  • 이미지와 영상을 같은 Vision Transformer로 처리하는 Unified Image and Video Understanding

모델 구조

Qwen Series
Qwen2-VL Architecture

Qwen2-VL은 모든 크기에서 약 675M 규모의 Vision Transformer를 공통으로 사용하며, Qwen2 계열 LLM의 크기에 따라 2B, 7B, 72B 모델로 나뉩니다. 이미지는 native resolution과 aspect ratio를 유지한 채 ViT에 입력되고, visual feature는 2×2 Patch Merger를 통과합니다. Patch Merger는 인접한 네 토큰을 하나로 합치면서 LLM의 hidden dimension으로 투영합니다.

예를 들어 224×224 이미지를 patch size 14로 나누면 16×16=256개의 patch token이 만들어집니다. 2×2 병합 후에는 64개의 visual token이 남고, 앞뒤의 <vision_start><vision_end>(Special Token)를 포함해 총 66개 토큰이 LLM에 입력됩니다.

Naive Dynamic Resolution

Dynamic Resolution에서는 모든 이미지를 동일한 크기로 제한하지 않습니다. 이미지의 원래 크기와 비율에 따라 patch 수가 달라지고, 결과적으로 LLM에 입력되는 visual token 수도 달라지도록 합니다. 세부 정보가 많은 큰 이미지는 더 많은 토큰을 사용하고, 단순하거나 작은 이미지는 더 적은 토큰으로 처리할 수 있습니다.

그러나 기존 ViT의 고정 Absolute Position Embedding은 미리 정해진 크기의 patch grid를 전제로 하므로, 해상도마다 grid 크기가 달라지는 입력을 그대로 처리하기 어렵다는 한계가 존재합니다. 본 논문에서는 이를 해결하기 위해 고정 Absolute Position Embedding을 제거하고 2D-RoPE를 적용합니다. 2D-RoPE는 각 patch의 높이와 너비 좌표를 Attention의 Query와 Key에 반영하기 때문에 입력 grid의 크기가 달라져도 상대적인 공간 구조를 표현할 수 있습니다.

Multimodal Rotary Position Embedding(MRoPE)

Qwen Series
Temporal, Height, Width로 분리된 MRoPE

기존 LLM의 1D-RoPE는 토큰의 순서만 표현합니다. Qwen2-VL은 Query와 Key의 feature dimension을 Temporal, Height, Width의 세 부분으로 나누고, 각 부분에 서로 다른 position ID를 적용합니다.

  • Text: 세 축에 같은 position ID를 사용하므로 일반적인 1D-RoPE와 동일하게 동작합니다.
  • Image: Temporal ID는 동일하게 유지하고, patch 위치에 따라 Height와 Width ID를 변경합니다.
  • Video: 프레임에 따라 Temporal ID가 증가하며, 각 프레임 안에서는 Height와 Width ID가 patch 위치에 따라 달라집니다.

MRoPE는 이미지와 영상의 공간·시간 정보를 명시적으로 분리할 뿐 아니라 position ID의 증가 폭도 줄입니다. 논문에서는 학습 시 영상 길이를 16K token으로 제한했음에도 추론 시 최대 80K token 구간에서 안정적인 성능을 보이며, 긴 영상에 대한 length extrapolation 가능성을 확인합니다.

Unified Image and Video Understanding

Qwen2-VL의 Vision Transformer는 3D Convolution을 사용해 이미지와 영상을 같은 입력 형식으로 처리합니다. 영상은 시간축 깊이가 2인 tube 단위로 patchify하고, 정지 이미지는 같은 이미지를 두 프레임으로 복제하여 동일한 연산을 적용합니다.

영상은 초당 2프레임으로 샘플링하며, 긴 영상의 연산량을 제어하기 위해 영상당 visual token 수를 최대 16,384개로 제한합니다. 이 설계를 통해 이미지와 영상을 별개의 Encoder로 분리하지 않고 하나의 Vision Transformer와 위치 표현 체계에서 처리합니다.

3단계 학습

Qwen2-VL 역시 Qwen-VL의 3단계 학습 방식을 유지합니다.

1. Vision Pre-training

첫 번째 단계에서는 Qwen2 LLM을 고정하고 ViT를 중심으로 학습하여 기본적인 이미지-텍스트 관계, OCR, 이미지 분류 능력을 학습합니다.

2. Multimodal Pre-training

두 번째 단계에서는 전체 모델을 학습하며 VQA, interleaved image-text, 영상 대화와 순수 텍스트 데이터를 함께 사용합니다. 두 pre-training 단계에서 사용한 토큰은 총 1.4T 규모이며, loss는 visual token이 아닌 text token 위치에서만 계산합니다.

3. Instruction Fine-tuning

마지막 단계에서는 ViT를 고정하고 LLM을 중심으로 Image QA, 문서 파싱, 다중 이미지 비교, 영상 이해와 Agent Interaction을 학습합니다.

Qwen2-VL은 모든 태스크를 텍스트 생성 형식으로 통합합니다. Grounding은 정규화된 좌표를 생성하고, Visual Agent는 화면을 관찰한 뒤 허용된 Action을 텍스트로 선택합니다.

실험 결과

Qwen2-VL은 General VQA, 문서·차트 이해, Multilingual OCR, 수학 추론, 영상 이해와 Visual Agent를 폭넓게 평가합니다. 72B 모델은 DocVQA, InfoVQA, TextVQA, OCRBench, MathVista 등 다수의 벤치마크에서 당시 공개 Generalist Model 중 높은 성능을 기록하고, 여러 항목에서 GPT-4o와 Claude 3.5 Sonnet에 견줄 만한 결과를 보입니다.

Qwen Series
Qwen2-VL 모델 크기별 주요 멀티모달 벤치마크 성능

Dynamic Resolution Ablation

고정된 수의 image token을 사용하는 설정과 Dynamic Resolution을 비교한 결과, 모든 벤치마크에서 가장 좋은 하나의 고정 해상도는 존재하지 않았습니다. Dynamic Resolution은 평균적으로 더 적은 토큰을 사용하면서도 상위권 성능을 유지했습니다. 해상도가 높을수록 항상 좋은 것도 아니었으며, 지나친 확대는 작은 이미지가 학습 분포에서 벗어나 OCR 성능을 낮출 수 있었습니다.

MRoPE Ablation

1D-RoPE와 MRoPE를 비교한 결과 MRoPE는 여러 이미지 태스크에서 전반적으로 경쟁력 있는 성능을 유지하면서, PerceptionTest, NextQA, STAR와 같은 영상 벤치마크에서 더 뚜렷한 개선을 보였습니다.

Model Scaling

2B, 7B, 72B 모델과 학습 데이터 규모를 비교하면 모델과 데이터가 커질수록 문서 이해, 수학 추론, 일반 VQA, 영상 이해 전반의 성능이 일관되게 개선됩니다. 본 논문에서는 LVLM에서도 LLM과 마찬가지로 모델 및 데이터의 scaling이 유효하다는 점을 실험적으로 확인하였습니다.

Qwen2.5-VL


서론

Qwen2-VL은 다양한 해상도의 이미지를 처리할 수 있었지만, 정작 모델이 출력하는 좌표는 이미지의 실제 크기를 반영하지 못했습니다. 영상 역시 고정된 프레임 속도로 샘플링되었고 시간 위치 ID가 프레임 순번을 따라 증가했기 때문에, 절대적인 시간을 고려하지 못했습니다.

Qwen2.5-VL은 공간 정보를 실제 픽셀 좌표로, 시간 정보를 실제 경과 시간에 맞춘 위치 ID로 표현해, 별도의 정규화 없이 공간 스케일과 시간 흐름을 그대로 인식하게 만듭니다.

이번 섹션에서는 Qwen2.5-VL이 공간과 시간을 어떻게 절대 표현(absolute representation)으로 바꿨는지, 이에 따르는 연산량을 감당하기 위해 vision encoder를 어떻게 재설계했는지, 그리고 4.1조 토큰 규모의 학습이 어떤 결과로 이어졌는지 살펴보겠습니다.

Qwen Series
Qwen2.5-VL Framework

절대 표현(absolute representation)

공간 표현

Qwen2-VL은 grounding box의 좌표를 출력할 때 $[0, 1000)$ 범위로 정규화해 표현했습니다. 이 방식은 모든 이미지를 동일한 좌표계에서 표현해, 객체의 실제 크기와 위치가 좌표에 남지 않습니다.

Qwen2.5-VL은 입력 이미지의 실제 너비와 높이에 대응하는 픽셀 좌표를 그대로 출력합니다. 학습 데이터 또한 같은 원칙으로 구성했는데, grounding 좌표를 실제 이미지 크기 기준으로 구성해, 모델이 객체의 실제 스케일과 공간 관계를 그대로 학습하도록 했습니다. 그 결과 bounding box뿐 아니라 box로 표현하기 어려운 세부 위치를 가리키는 point 형태의 grounding까지 지원하고, XML, JSON 등 구조적 형식의 출력도 안정적으로 생성할 수 있습니다.

시간 표현

MRoPE는 위치 임베딩을 시간, 높이, 너비 세 성분으로 나눕니다. 텍스트는 세 성분이 같은 ID를 써서 1D RoPE와 동일하게 동작하고, 이미지는 시간 ID가 고정된 채 공간 ID만 달라지며, 영상은 프레임마다 시간 ID가 증가합니다.

Qwen2-VL에서는 시간 ID가 입력 프레임 수에 묶여 있어 절대적인 시간 간격을 표현할 수 없었습니다.

Qwen2.5-VL은 시간 성분의 위치 ID를 프레임 순서가 아닌 실제 타임스탬프에 맞춰 부여합니다. 같은 시각의 프레임은 어떤 FPS로 뽑아도 같은 ID를 받게 되고, ID 간격이 실제 시간을 반영해 모델은 절대적인 시간을 학습할 수 있습니다.

Dynamic FPS Sampling은 학습 시 영상마다 FPS를 동적으로 바꿔가며 샘플링해, 모델이 인식하는 시간 간격이 특정 FPS에 의존하지 않도록 만듭니다.

이 방식은 이미 존재하는 위치 ID의 간격에 정보를 실어 추가 연산 없이 위치 ID 간격만으로 시간 정보를 전달합니다.

Vision Encoder의 연산량 최적화

Window Attention

ViT 레이어 중 (7, 15, 23, 31)번 레이어만 full attention을 수행하고, 나머지 28개의 레이어는 최대 112x112 픽셀 window 안에서만 attention 연산합니다. window보다 작은 영역은 padding 없이 그대로 처리해 원본 해상도를 왜곡하지 않습니다. Window attention 구성에서 연산량은 패치 수의 제곱이 아닌 선형으로 증가하며, 4개의 full attention이 전체적인 문맥을 학습해 정보 손실을 막습니다.

ViT 구조 역시 재구성해 RMSNorm, SwiGLU, 2D-RoPE를 사용한 구조로 개선했으며, 기존 가중치 대신 DataComp와 자체 데이터로 처음부터 학습했습니다.

Vision-Language Merger

ViT 출력은 인접한 2x2 영역의 패치를 이어붙여 2-layer MLP에 통과시키는 Merger를 거친 후 LLM에 들어갑니다. Merger를 통과한 시각 피처는 텍스트 임베딩과 같은 공간으로 투영되고, 패치를 이어붙여 계산함으로써 패치 수가 1/4로 줄어드는 효과를 얻습니다. 즉 Vision encoder에서는 window attention으로, LLM에서는 Merger로 연산량을 줄입니다.

학습 과정

사전학습 데이터의 규모가 기존 Qwen2-VL의 1.2조 토큰에서, 4.1조 개의 토큰으로 늘었습니다. 종류 역시 확장되어 표, 차트, 수식, 화학식, 악보 등을 HTML 형식으로 통합해 파싱하는 document omni-parsing, 초 단위로 영상을 출력하는 video grounding, 컴퓨터와 모바일을 조작하는 agent 데이터를 사용합니다.

사전학습은 세 단계로 진행됩니다:

  • Visual Pre-Training : LLM은 고정시킨 채, 1.5조 개의 토큰으로 ViT만 학습해 언어 모델과 정렬합니다.
  • Multimodal Pre-Training : 전체 파라미터를 interleaved data, VQA, video, agent 등 2조 개의 토큰으로 학습합니다.
  • Long-Context Pre-Training : 시퀀스 길이가 약 4배 늘어난 장문 문서와 장시간 영상을 학습합니다.

사후학습은 SFT와 DPO의 두 단계로 진행되며, 두 단계 모두 ViT는 고정합니다. 수학 및 코드 등 다단계의 추론이 필요한 과제에는 rejection sampling으로 정답과 일치하는 CoT만 남겼습니다.

실험 결과

Qwen Series
Qwen2.5-VL experiment

플래그십인 72B 모델은 MMMU, Math Vista 등 일반 벤치마크에서 GPT-4o, Claude 3.5 Sonnet 등과 대등합니다.

반면 문서, OCR에서는 기존 SOTA 모델을 능가합니다. CC-OCR에서는 GPT-4o와 Gemini 1.5 Pro를 크게 앞서고, OCRBench_v2에서 역시 뛰어난 성능을 보입니다.

영상 grounding에서는 Charades-STA mIoU에서 GPT-4o를 크게 앞섭니다. 다만 이 수치는 데이터 확장과 LLM 백본이 함께 반영되어, 논문에서 제안한 절대시간 정렬의 기여만으로 달성한 결과는 아닙니다. Agent에서의 변화가 가장 두드러지는데, ScreenSpot Pro에서 Qwen2-VL-72B의 성능을 극적으로 끌어올립니다.

Qwen3.5-Omni


서론

Qwen3.5-Omni는 텍스트, 이미지, 영상, 오디오의 네 가지 모달리티를 하나의 모델에서 이해하고, 텍스트뿐만 아니라 음성으로도 응답할 수 있도록 확장되었습니다. Qwen3-Omni의 Thinker와 Talker 구조 위에 Qwen3.5의 Hybrid-Attention MoE Transformer를 사용하고, 256K context와 ARIA를 도입해 장시간 audio-video 입력 처리 및 실시간 음성 생성을 가능하게 했습니다. 아래에서는 Qwen3.5-Omni가 서로 다른 모달리티를 어떻게 통합해 이해하고, 실시간 음성을 생성하는지 살펴보겠습니다.

Qwen Series
Qwen3.5-Omni Framework

Interleaved input sequence

각각의 모달리티를 개별 인코더로 처리한 뒤, 하나의 시퀀스로 결합합니다.

  • 텍스트: Qwen3.5 tokenizer
  • 이미지, 영상: Qwen3.5의 SigLIP2 Vision Encoder를 사용하며, 음성과 정렬하기 위해 동적 프레임으로 샘플링합니다.
  • 음성: 16kHz로 다시 샘플링한 뒤 mel-spectrogram으로 변환하고, Audio Transformer (AuT)로 인코딩합니다. 출력 토큰 한 개가 원 신호의 약 160ms에 해당합니다.

영상 input에서는 시각 토큰과 음성 토큰을 시간 순서에 따라 interleaving하고, 각 시간 패치 앞에 초 단위의 타임스탬프를 문자열로 삽입해 영상과 음성의 시간 관계를 표현합니다.

Qwen Series
interleaved sequence

이때 위치 ID는 160ms 단위의 일정한 해상도로 유지하고, 절대 시간은 텍스트의 타임스탬프로 명시합니다. 이는 위치 ID를 절대 시간에 그대로 사용하면 긴 영상 입력에서 ID가 지나치게 커지고 sparse해져 long-range 시간 모델링이 약해지고, 다양한 FPS에 걸친 대규모의 균등 샘플링 데이터가 필요해 구축 비용이 커지기 때문입니다.

실시간 음성 스트리밍

  • Thinker: 통합된 시퀀스를 받아 이해하고 추론한 뒤, 텍스트 응답을 autoregressive하게 생성합니다.
  • Talker: Thinker의 출력과 멀티모달 문맥, 사용자의 입력을 받아, RVQ codec 토큰을 실시간으로 autoregressive하게 생성합니다.
Qwen Series
Thinker-Talker 구조

텍스트 토큰과 codec 토큰은 같은 속도로 생성되지 않습니다. 예를 들어 하나의 텍스트 토큰이 짧은 음절일 수도 있고, 여러 음절로 발음되는 단어일 수도 있기 때문에 텍스트와 음성을 기계적으로 일대일로 interleaving하면 단어 누락, 발음 오류 등의 문제가 발생할 수 있습니다.

ARIA (Adaptive Rate Interleave Alignment)는 Talker의 codec 토큰 생성 과정에서 텍스트 단위와 음성 단위의 대응 속도를 동적으로 조절한 후 하나의 스트림으로 통합합니다.

구체적으로는, 학습 시 텍스트와 codec 토큰 사이의 비율인 global ratio를 계산해, codec 토큰 생성 시 누적된 텍스트 토큰 수 $N_{text}$와 codec 토큰 수 $N_{speech}$의 비율이 global ratio를 넘지 않도록 합니다. \(\begin{equation} N_{speech}\over{N_{text}} \le \texttt{global ratio} \end{equation}\) 결과적으로 Thinker의 텍스트 의미를 유지하면서도 더 안정적이고 자연스러운 스트리밍 음성을 생성할 수 있습니다.

Talker에서 실시간으로 생성된 RVQ codec 토큰은 MTP에서 codebook에 기반해 나머지 codec 토큰을 생성하고, Code2Wav에서 프레임 단위로 파형을 합성해 최종 음성을 출력합니다.

실험 결과

실시간 음성 처리가 가능해진 Qwen3.5-Omni는 다양한 설정에서 음성 생성 성능을 측정합니다. 이때 Thinker와 Talker의 차이에 따라 Qwen3.5-Omni-Flash와 Qwen3.5-Omni-Plus의 두 가지 모델에서 성능을 측정합니다.

이번 아티클에서는 모델의 음성 생성 성능을 위주로 살펴보겠습니다.

  • zero-shot voice cloning: 학습한 적 없는 목소리와 텍스트를 받았을 때, 주어진 목소리로 텍스트를 정확하고 오류 없이 읽는지 확인합니다.
  • multilingual speech generation: 29개의 언어에 대해 zero-shot voice cloning의 확장 가능성을 측정합니다.
  • cross-lingual speech generation: 학습한 적 없는 목소리와 다른 언어의 텍스트를 받았을 때, 주어진 목소리로 텍스트를 정확하고 오류 없이 읽는지 평가합니다.
  • custom-voice speech generation: Talker의 system prompt에서 학습한 목소리 중 하나로 fine-tuning 후, 29가지 언어의 텍스트를 해당 목소리로 정확하고 오류 없이 읽는지 평가합니다.

각 태스크는 다음의 두 가지 지표로 측정합니다.

  • WER (Word Error Rate): 모델이 생성한 음성을 ASR 모델로 텍스트로 변환해 누락되거나 왜곡된 단어가 없는지 측정합니다. ASR 모델로는 GPT-4o-transcribe가 사용되었습니다.
  • SIM: 모델이 생성한 음성과 타겟 음성 간 유사도를 코사인 유사도로 측정합니다.
Qwen Series
multilingual speech generation task

SEED-TTS 벤치마크에서 높은 zero-shot speech generation 성능을 보인 Qwen3.5-Omni는 위의 표와 같이 다양한 상용 모델과의 비교에서 29가지 언어에 대해서도 상대적으로 높은 성능을 보입니다. 또한 주어진 목소리와 다른 언어 발음 시에도 화자의 목소리를 안정적으로 유지하며 음성 생성 능력에 있어 기존 벤치마크 및 상용 모델 대비 뛰어난 성능을 보입니다.

결론


Qwen 멀티모달 시리즈의 변화는 “모델이 세계를 어떤 좌표계로 볼 것인가”라는 질문을 따라 이어집니다. Qwen-VL과 Qwen2-VL이 고정된 해상도의 제약에서 벗어나 임의의 해상도 입력을 다루는 문제를 다뤘다면, Qwen2.5-VL은 공간과 시간을 절대적으로 표현하려 했으며 Qwen3.5-Omni는 여기에 음성을 더해 네 가지의 모달리티를 하나의 시퀀스로 통합하고, 이해를 넘어 실시간 음성 생성과 상호작용할 수 있도록 범위를 넓혔습니다.