멀티모달 인공지능은 이미지·영상·음성을 언어와 함께 이해하고 생성하는 쪽으로 나아가고 있습니다. 본 연구실의 멀티모달 세미나 시리즈에서는 이 흐름을 대표하는 다섯 계열의 모델을 차례로 다뤘습니다. 이 글은 각 세미나를 하나로 엮어, 비전-언어 모델(Vision-Language Model, VLM)이 어떤 문제를 풀며 발전해 왔는지를 전체 흐름으로 짚어 보는 글입니다.
크게 다음 흐름으로 이어집니다.
- 이해와 생성의 통합 (BLIP)
- Frozen 모듈로 비용 효율 확보 (BLIP-2, InstructBLIP, MiniGPT-4)
- few-shot in-context learning (Flamingo)
- 시각 instruction tuning으로 범용 어시스턴트화 (LLaVA, MiniGPT-4)
- 가변 해상도와 절대 좌표, 옴니모달로 확장 (Qwen 계열)
세미나 시리즈
- BLIP 시리즈 (유재윤, 윤채원 연구원)
- Flamingo 시리즈 (송예훈, 지서윤 연구원)
- LLaVA 시리즈 (김재성, 윤정현 연구원)
- MiniGPT-4 (김재성, 윤정현 연구원)
- Qwen 시리즈 (유재윤, 윤채원 연구원)
BLIP
BLIP은 이미지-텍스트 이해(retrieval, VQA)와 생성(captioning)을 하나의 프레임워크로 통합합니다. 핵심은 인코더와 디코더를 유연하게 조합하는 MED(Multimodal mixture of Encoder-Decoder)와, 웹에서 수집한 노이지한 캡션을 스스로 정제하는 CapFilt입니다. 이어 BLIP-2는 Frozen Image Encoder와 Frozen LLM 사이에 경량 Q-Former만 학습해 적은 파라미터로 zero-shot SOTA를 달성했고, InstructBLIP은 instruction을 Q-Former에 함께 입력해 사용자의 요청에 맞는 시각 정보를 뽑아내도록 확장했습니다.
자세한 구조와 실험은 BLIP 시리즈 글에서 다룹니다.
Flamingo
Flamingo는 대규모 Frozen 비전 인코더와 Frozen 언어 모델(Chinchilla 70B)을 Perceiver Resampler와 GATED XATTN-DENSE 층으로 연결합니다. 이미지·영상·텍스트가 교차된 입력을 받아, task별 fine-tuning 없이 몇 개의 예시(few-shot)만으로 새로운 문제를 풀어내는 in-context learning 능력을 보였습니다. 이후 공개된 OpenFlamingo는 이 구조를 공개 데이터·백본만으로 재현하여, 어떤 설계 요소가 in-context 능력을 좌우하는지를 드러냈습니다.
자세한 구조와 실험은 Flamingo 시리즈 글에서 다룹니다.
LLaVA와 MiniGPT-4
LLaVA는 CLIP 비전 인코더와 LLM(Vicuna)을 단 하나의 선형 사영층으로 잇고, GPT-4로 생성한 멀티모달 instruction-following 데이터로 학습해 범용 시각 어시스턴트의 가능성을 열었습니다. LLaVA-1.5는 사영층을 MLP로 바꾸고 학술 VQA 데이터와 입력 해상도를 확장해, 적은 데이터로도 다수 벤치마크에서 SOTA급 성능을 달성했습니다. 비슷한 시기 MiniGPT-4는 BLIP-2의 Frozen 비전 모듈에 강력한 LLM만 얹고 자체 생성한 고품질 데이터로 미세조정하여, 손그림 기반 웹사이트 코딩·밈 해석 같은 능력을 적은 학습으로 재현했습니다.
자세한 내용은 LLaVA 시리즈와 MiniGPT-4 글에서 다룹니다.
Qwen
Qwen 계열은 “모델이 세계를 어떤 좌표계로 볼 것인가”라는 질문을 따라 발전합니다. Qwen-VL은 vision encoder와 LLM을 하나로 잇고, Qwen2-VL은 이미지마다 토큰 수가 달라지는 Naive Dynamic Resolution과 시간 축을 반영한 MRoPE를 도입했습니다. Qwen2.5-VL은 좌표와 시간을 정규화된 값이 아닌 절대값으로 표현해 공간·시간 인식을 실제 스케일에 맞췄고, Qwen3.5-Omni는 텍스트·이미지·영상·오디오를 하나의 시퀀스로 통합한 Thinker-Talker 구조 위에서 실시간 음성 응답까지 확장했습니다.
자세한 구조와 실험은 Qwen 시리즈 글에서 다룹니다.
모델 비교
주요 구성 요소와 학습 방식을 정리하면 다음과 같습니다. 성능은 각 모델의 대표 지표만 발췌했으며, 전체 수치는 개별 세미나 글에서 확인하실 수 있습니다.
| 모델 | Vision Encoder | Text Encoder | LLM Backbone | 학습 (데이터) | 대표 성능 |
|---|---|---|---|---|---|
| BLIP-1 | ViT-B/16·L/16 (ImageNet) | MED (BERT) | – | MED 사전학습(ITC·ITM·LM) + CapFilt · 14M/129M | COCO CIDEr 136.7 · Flickr30K IR@1 86.7 |
| BLIP-2 | ViT-L/14·g/14 (frozen) | Q-Former (188M) | OPT / FlanT5 (frozen) | 2-stage 표현학습·생성학습 · 129M | Zero-shot VQAv2 65.0 · NoCaps CIDEr 121.6 |
| InstructBLIP | ViT-g/14 (frozen) | Instruction-aware Q-Former | FlanT5 / Vicuna (frozen) | Vision-language instruction tuning · 26 datasets (13 held-in/out) | Held-out zero-shot 강세 · ScienceQA-IMG 90.7 (ft) |
| Flamingo (80B) | NFNet-F6 (contrastive) | – | Chinchilla 70B | Resampler + GATED XATTN-DENSE만 학습 · M3W 등 | 32-shot VQAv2 67.6 · COCO CIDEr 113.8 |
| LLaVA-1.0 | CLIP ViT-L/14 | – | Vicuna-13B | 2-stage 사영층·visual instruction tuning · GPT-4 158K | ScienceQA 92.5% (+GPT-4) · LLaVA-Bench 85.1% |
| LLaVA-1.5 | CLIP ViT-L/14-336px | – | Vicuna-7B/13B | 2-stage + 학술 VQA · 665K | VQAv2 80.0 · MMBench 67.7 |
| MiniGPT-4 | EVA-CLIP ViT-g/14 | Q-Former (BLIP-2) | Vicuna-13B | 2-stage 사영층 사전학습·자체 3.5K 미세조정 | Advanced 65/100 · COCO caption 66.2% |
| Qwen-VL | OpenCLIP ViT-bigG | – | QwenLM-7B | 3-stage 사전·멀티태스크·SFT · 1.4B | VQAv2 79.5 · Flickr30K CIDEr 85.8 |
| Qwen2-VL | DFN-init ViT | – | Qwen2 1.5B/7.6B/72B | 3-stage · ~1.4T tokens · Dynamic Resolution + MRoPE | DocVQA 94.5 · MathVista 58.2 |
| Qwen2.5-VL | Native dynamic-res ViT (from scratch) | – | Qwen2.5 3B/7B/72B | 4.1T 사전학습(3-stage) + SFT/DPO · 절대 좌표·시간 | DocVQA 96.4 · MMMU 70.2 (72B) |
| Qwen3.5-Omni | SigLIP2 + AuT (audio) | – | Thinker-Talker MoE (Qwen3.5) | Encoder align·General·Long-context · ~4T | MMMU 80.1 · VoiceBench 93.1 |
결론
다섯 계열을 이어 보면 흐름이 뚜렷합니다. 학습해야 하는 파라미터는 점점 줄어드는 대신, 다룰 수 있는 모달리티와 태스크의 범위는 계속 넓어졌습니다. BLIP이 이해와 생성을 통합하고, Frozen 모듈(BLIP-2, MiniGPT-4)과 few-shot(Flamingo)이 비용을 낮췄으며, instruction tuning(LLaVA)이 모델을 범용 어시스턴트로 바꿨고, Qwen 계열이 해상도·좌표·시간·음성까지 하나의 시퀀스로 담아냈습니다.
각 모델의 구조와 실험을 더 깊이 보고 싶다면, 위 세미나 시리즈의 링크를 따라가 보세요.