본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

CohereLabs/North-Micro-Vision-Instruct

이미지와 텍스트를 함께 처리하는 다국어 시각-언어 생성2.4BLM backbone 128K tokens, 검증된 multimodal context 최대 8K tokens 컨텍스트Apache 2.0

원본 해상도 이미지와 다국어·다중 이미지 입력을 처리하는 2.4B Apache 2.0 멀티모달 instruct 모델

학습 방식 · North Micro LLM 2B와 SigLIP 2 SO400M에서 출발해 custom-trained한 400M native-resolution vision encoder를 projector와 결합한 instruct 멀티모달 모델입니다. README에는 전체 학습 절차나 SFT·DPO 같은 구체적 기법은 명시되지 않았습니다.

TL;DR

North Micro Vision Instruct는 별도 LoRA나 양자화 모델이 아닌 2.4B 파라미터 open-weight instruct 멀티모달 모델로, custom-trained 400M native-resolution vision encoder와 2B North Micro LLM을 결합합니다. 이미지의 원본 비율과 세부 정보를 유지한 뒤 projector와 DeepStack 방식으로 시각 특징을 LLM에 주입해 VQA, OCR, 차트·문서 이해, grounding, 다국어·다중 이미지 입력을 처리합니다. ChartQA 0.808, DocVQA 0.921, RefCOCO avg 0.732를 기록했지만 MMMU DEV VAL 0.329와 MMLU-Pro test 0.307로 복잡한 추론·수학 작업에는 약하며, 멀티모달 context는 8K tokens까지만 검증됐습니다. Apache 2.0 라이선스와 Transformers·NVIDIA AutoModel·Axolotl 경로를 활용할 수 있어 소형 멀티모달 애플리케이션의 프로토타이핑과 fine-tuning에 맞습니다.

핵심 포인트

  • Native-resolution 입력으로 이미지의 가로세로 비율을 유지하며 세부 시각 정보를 처리합니다. 400M 파라미터 vision encoder가 원본 해상도 이미지를 인코딩하고 projector가 이를 언어 모델의 embedding 공간으로 변환합니다. 이미지 크기가 커질수록 메모리 사용량과 지연 시간이 증가합니다.
  • North Micro Vision Instruct는 2.4B 파라미터 규모의 compact instruct 모델입니다. 2B North Micro LLM과 custom-trained 400M vision encoder를 결합해 VQA, captioning, OCR, chart, document, grounding 작업을 처리합니다. 다국어 입력과 여러 이미지가 섞인 프롬프트를 지원합니다.
  • DeepStack 방식으로 여러 vision encoder 층의 patch embedding을 초기 LLM 층에 주입합니다. 언어 모델은 sliding-window attention과 global attention을 조합하고, vision encoder는 2D RoPE와 학습형 1D positional embedding으로 공간 구조를 보존합니다. 이 구조가 문서·차트·공간 위치처럼 시각 정보의 세부 보존이 필요한 작업에 맞춰져 있습니다.
  • Apache 2.0 가중치와 Transformers 기반 실행 환경을 제공해 프로토타이핑과 task-specific fine-tuning에 적합합니다. Transformers 5.16.0과 accelerate, Pillow가 필요하며 Flash Attention 2는 지원되는 CUDA 환경에서 선택적으로 사용할 수 있습니다. NVIDIA AutoModel recipe와 Axolotl 기반 fine-tuning 경로도 제공됩니다.

제한사항

  • 이 모델은 대형 범용 chat assistant의 대체재가 아니라 customization을 위한 compact foundation입니다. reasoning model이 아니므로 수학과 code generation 능력이 제한됩니다. tool calling과 agentic workflow도 지원하지 않습니다.
  • Multimodal training에서 검증한 context 범위는 최대 8K tokens입니다. LM backbone 자체는 128K tokens를 지원하지만 8K를 넘는 멀티모달 입력은 extrapolation에 의존하며 benchmark되지 않았습니다. 긴 이미지·텍스트 조합을 운영 환경에 적용할 때는 별도 검증이 필요합니다.
  • Native-resolution 처리는 이미지 원본의 세부 정보를 유지하지만 이미지 크기에 따라 메모리 사용량과 지연 시간이 증가합니다. System prompt는 학습에 사용되지 않아 권장되지 않으며 chat template이 system role을 받더라도 성능을 보장하지 않습니다. vLLM public support는 아직 제공 예정 상태입니다.

벤치마크

벤치마크지표비교
MMBench DEV EN V11score0.687README VLMEvalKit 비교표 기준으로 Qwen3-VL-2B-Instruct 0.744, Qwen3.5-2B-Instruct 0.760보다 낮고 SmolVLM2.2B 0.674보다 높음
MMStarscore0.518README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.614보다 낮고 LFM2.5-VL-1.6B 0.508보다 높음
RealWorldQAscore0.622README VLMEvalKit 비교표 기준으로 Qwen3-VL-2B-Instruct 0.646보다 낮고 Ministral-3-3B-Instruct 0.583보다 높음
GQA TestDev Balancedscore0.574README VLMEvalKit 비교표 기준으로 Phi-3.5-vision-instruct 0.650보다 낮고 Qwen3-VL-2B-Instruct 0.572보다 높음
MTL MMBench DEVscore0.636README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.674와 Qwen3.5-2B-Instruct 0.669보다 낮음
MMMBscore0.728README VLMEvalKit 비교표 기준으로 Gemma-4-E2B-it 0.743과 Qwen3.5-2B-Instruct 0.745보다 낮고 LFM2.5-VL-1.6B 0.717보다 높음
BLINKscore0.527README VLMEvalKit 비교표 기준으로 Phi-3.5-vision-instruct 0.561과 Qwen3.5-2B-Instruct 0.563보다 낮고 Ministral-3-3B-Instruct 0.471보다 높음
ChartQA Testscore0.808README VLMEvalKit 비교표 기준으로 Phi-3.5-vision-instruct 0.821보다 낮고 Ministral-3-3B-Instruct 0.791과 Qwen3.5-2B-Instruct 0.775보다 높음
DocVQA VALscore0.921README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.926보다 낮고 Ministral-3-3B-Instruct 0.896보다 높음
InfoVQA VALscore0.652README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.731보다 낮고 LFM2.5-VL-1.6B 0.627보다 높음
OCRBenchscore0.792README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.861과 LFM2.5-VL-1.6B 0.802보다 낮고 Phi-3.5-vision-instruct 0.642보다 높음
AI2D TESTscore0.775README VLMEvalKit 비교표 기준으로 Phi-3.5-vision-instruct 0.790보다 낮고 Qwen3.5-2B-Instruct 0.752보다 높음
CharXiv DQscore0.600README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.766, Gemma-4-E2B-it 0.751, Qwen3.5-2B-Instruct 0.761보다 낮음
MMMU DEV VALscore0.329README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.508과 Gemma-4-E2B-it 0.477보다 낮음
RefCOCO avgscore0.732README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.785보다 낮고 Ministral-3-3B-Instruct 0.317보다 높음
CountBenchscore0.725README VLMEvalKit 비교표 기준으로 LFM2.5-VL-1.6B 0.910, Qwen3-VL-2B-Instruct 0.848, Qwen3.5-2B-Instruct 0.805보다 낮음
HallusionBenchscore0.615README VLMEvalKit 비교표 기준으로 Qwen3-VL-2B-Instruct 0.673과 Qwen3.5-2B-Instruct 0.655보다 낮고 LFM2.5-VL-1.6B 0.601보다 높음
MMLU testscore0.504README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.660, Gemma-4-E2B-it 0.692, Qwen3-VL-2B-Instruct 0.630보다 낮음
MMLU-Pro testscore0.307README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.475, Gemma-4-E2B-it 0.441, Qwen3-VL-2B-Instruct 0.428보다 낮음
IFEvalscore0.749README VLMEvalKit 비교표 기준으로 Gemma-4-E2B-it 0.869와 LFM2.5-VL-1.6B 0.776보다 낮고 Qwen3-VL-2B-Instruct 0.734보다 높음

이미지 분석

North Micro Vision의 native-resolution 입력부터 400M vision encoder, multimodal projector, 2B North Micro LLM, decoder까지 이어지는 처리 구조를 나타낸 도식입니다.
도식은 서로 다른 해상도의 세 이미지가 native-resolution vision encoder로 들어간 뒤 projector를 거쳐 텍스트 토큰과 여러 이미지의 visual token으로 North Micro LLM에 결합되는 흐름을 나타냅니다. Decoder에는 SWA layer와 full attention layer가 배치되어 있으며 전체 28개 layer 구조가 표시됩니다. 입력 텍스트와 이미지에서 문서, 자연 이미지, 일반 텍스트가 섞인 출력으로 이어지는 멀티모달 처리 경로를 한눈에 확인할 수 있습니다.

94

Likes

356

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.