챕터별 상세
AI 비전의 진화와 Vision Transformer의 등장
과거 비전 기술은 Convolutional Neural Networks(CNN)에 의존했으나, Google의 Vision Transformer(ViT) 논문 발표 이후 큰 변화를 맞이했다. ViT는 이미지를 16x16 크기의 패치로 나누어 토큰처럼 처리함으로써 Transformer 아키텍처를 비전에 성공적으로 이식했다. 이 방식은 로컬 이웃에만 집중하던 CNN과 달리 이미지 전체의 관계를 학습할 수 있게 하여 모델의 확장성을 비약적으로 높였다. 결과적으로 비전 분야에서도 자연어 처리의 BERT와 같은 전이 학습의 시대가 열렸다.
LLaVA와 비전의 GPT 모먼트
LLaVA는 이미지와 텍스트 프롬프트를 동시에 입력받아 텍스트 응답을 생성하는 구조를 통해 비전의 GPT 모먼트를 만들어냈다. 기존의 폐쇄적인 모델들과 달리 LLaVA는 시각적 지시어 튜닝(Visual Instruction Tuning)을 도입하여 커뮤니티에 멀티모달 어시스턴트 구축을 위한 간단한 레시피를 제공했다. 이는 복잡한 전체 스택을 처음부터 학습시키지 않고도 강력한 멀티모달 성능을 낼 수 있음을 증명했다. 특히 오픈소스 생태계에서 멀티모달 연구가 가속화되는 기폭제가 되었다.
VLM의 핵심 구조: CLIP과 프로젝션 레이어
LLaVA와 같은 비전 언어 모델(VLM)은 내부적으로 CLIP과 같은 강력한 비전 인코더와 대규모 언어 모델(LLM)을 결합한 형태이다. 두 모델 사이에는 시각적 특징을 언어 모델의 임베딩 공간으로 변환해주는 작은 프로젝션 레이어가 존재한다. 이 레이어는 시각 정보를 텍스트 형태의 논리적 추론이 가능한 공간으로 매핑하는 가교 역할을 수행한다. 이러한 구조 덕분에 모델은 처음부터 비전을 새로 배울 필요 없이 기존 LLM의 추론 능력을 그대로 활용하면서 이미지를 이해할 수 있다.
인터리빙 기술과 멀티 이미지 추론
인터리빙(Interleaving)은 한 문맥 안에서 이미지와 텍스트 시퀀스를 자유롭게 교차 배치하는 기술이다. 이전 모델들이 한 번에 하나의 이미지만 처리하던 한계를 넘어, 여러 장의 이미지를 비교하거나 시각적 흐름을 따라가며 추론하는 것을 가능하게 한다. 예를 들어 '이 이미지들을 보고 웹사이트 코드를 작성해줘'와 같은 복잡한 요청을 처리할 때 필수적인 기능이다. 이는 모델이 시각적 정보를 텍스트 맥락 속에 더 깊게 고정(grounding)시키는 데 기여한다.
현재의 비전 기술 트렌드와 포화 상태
현재 비전 기술은 아키텍처 측면에서 어느 정도 포화 상태에 도달하여 새로운 구조적 혁신보다는 기존 모델의 개선에 집중하고 있다. Alibaba의 Qwen-VL과 같은 모델들이 강력한 성능을 보여주고 있으며, Mixture of Experts(MoE)를 적용해 효율성을 높이는 추세이다. 이제 연구의 초점은 아키텍처 변경보다는 인간의 의도에 맞게 모델을 정렬하는 RLHF 기술이나 문서 이해, 비디오 이해와 같은 특정 도메인 성능 향상으로 옮겨갔다. 벤치마크 성능을 높이기 위한 미세 조정과 데이터 품질 관리가 핵심 과제가 되었다.
Segment Anything (SAM)의 역할
Meta의 Segment Anything Model(SAM)은 비전 분야에서 프롬프트 기반의 세그멘테이션 기능을 파운데이션 모델 수준으로 끌어올렸다. SAM은 점이나 박스 형태의 프롬프트를 받아 이미지 내의 객체를 정교하게 분리해내며, 이는 데이터 주석 도구나 시각적 편집 워크플로우를 혁신했다. 비록 LLaVA처럼 긴 텍스트 지시를 따르는 VLM은 아니지만, 비전 시스템의 하위 작업에서 재사용 가능한 강력한 기반 기술로 자리 잡았다. 최신 버전인 SAM 2는 비디오 세그멘테이션까지 영역을 넓히며 실무 활용도를 높였다.
용어 해설
- 비전 트랜스포머(Vision Transformer)
- — 이미지를 고정된 크기의 패치로 분할하여 Transformer 아키텍처에 입력하는 모델이다. 기존 CNN과 달리 이미지 전체의 전역적 관계를 학습할 수 있어 확장성이 뛰어나며, 비전 분야의 BERT 모먼트를 가져온 핵심 기술이다.
- 라바(LLaVA)
- — 시각적 지시어 튜닝을 통해 구축된 대규모 멀티모달 모델이다. CLIP 비전 인코더와 언어 모델을 연결하여 이미지와 텍스트 입력을 동시에 처리하고 텍스트로 응답하며, 비전 분야의 GPT 모먼트를 상징한다.
- 인터리빙(Interleaving)
- — 하나의 프롬프트 내에서 이미지와 텍스트 시퀀스를 교차하여 배치하는 기술이다. 모델이 여러 이미지를 비교하거나 시각적 흐름을 따라가며 추론할 수 있게 하여 복잡한 멀티모달 대화를 가능하게 한다.
- 투영 레이어(Projection Layer)
- — 비전 인코더에서 추출한 시각적 특징 벡터를 언어 모델의 임베딩 공간으로 변환하는 연결 계층이다. 서로 다른 모달리티의 데이터를 동일한 차원으로 맞춰 모델이 통합적으로 이해할 수 있도록 돕는 가교 역할을 한다.
- SAM(Segment Anything Model)
- — Meta에서 공개한 프롬프트 기반의 이미지 세그멘테이션 파운데이션 모델이다. 점, 박스, 텍스트 등 다양한 프롬프트를 입력받아 이미지 내 객체를 정교하게 분리해내며 시각적 편집 및 주석 도구로 널리 활용된다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 06.수집 2026. 04. 06.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



