CohereLabs/North-Micro-Vision-Instruct
원본 해상도 이미지와 다국어·다중 이미지 입력을 처리하는 2.4B Apache 2.0 멀티모달 instruct 모델
학습 방식 · North Micro LLM 2B와 SigLIP 2 SO400M에서 출발해 custom-trained한 400M native-resolution vision encoder를 projector와 결합한 instruct 멀티모달 모델입니다. README에는 전체 학습 절차나 SFT·DPO 같은 구체적 기법은 명시되지 않았습니다.
TL;DR
North Micro Vision Instruct는 별도 LoRA나 양자화 모델이 아닌 2.4B 파라미터 open-weight instruct 멀티모달 모델로, custom-trained 400M native-resolution vision encoder와 2B North Micro LLM을 결합합니다. 이미지의 원본 비율과 세부 정보를 유지한 뒤 projector와 DeepStack 방식으로 시각 특징을 LLM에 주입해 VQA, OCR, 차트·문서 이해, grounding, 다국어·다중 이미지 입력을 처리합니다. ChartQA 0.808, DocVQA 0.921, RefCOCO avg 0.732를 기록했지만 MMMU DEV VAL 0.329와 MMLU-Pro test 0.307로 복잡한 추론·수학 작업에는 약하며, 멀티모달 context는 8K tokens까지만 검증됐습니다. Apache 2.0 라이선스와 Transformers·NVIDIA AutoModel·Axolotl 경로를 활용할 수 있어 소형 멀티모달 애플리케이션의 프로토타이핑과 fine-tuning에 맞습니다.
핵심 포인트
- Native-resolution 입력으로 이미지의 가로세로 비율을 유지하며 세부 시각 정보를 처리합니다. 400M 파라미터 vision encoder가 원본 해상도 이미지를 인코딩하고 projector가 이를 언어 모델의 embedding 공간으로 변환합니다. 이미지 크기가 커질수록 메모리 사용량과 지연 시간이 증가합니다.
- North Micro Vision Instruct는 2.4B 파라미터 규모의 compact instruct 모델입니다. 2B North Micro LLM과 custom-trained 400M vision encoder를 결합해 VQA, captioning, OCR, chart, document, grounding 작업을 처리합니다. 다국어 입력과 여러 이미지가 섞인 프롬프트를 지원합니다.
- DeepStack 방식으로 여러 vision encoder 층의 patch embedding을 초기 LLM 층에 주입합니다. 언어 모델은 sliding-window attention과 global attention을 조합하고, vision encoder는 2D RoPE와 학습형 1D positional embedding으로 공간 구조를 보존합니다. 이 구조가 문서·차트·공간 위치처럼 시각 정보의 세부 보존이 필요한 작업에 맞춰져 있습니다.
- Apache 2.0 가중치와 Transformers 기반 실행 환경을 제공해 프로토타이핑과 task-specific fine-tuning에 적합합니다. Transformers 5.16.0과 accelerate, Pillow가 필요하며 Flash Attention 2는 지원되는 CUDA 환경에서 선택적으로 사용할 수 있습니다. NVIDIA AutoModel recipe와 Axolotl 기반 fine-tuning 경로도 제공됩니다.
제한사항
- 이 모델은 대형 범용 chat assistant의 대체재가 아니라 customization을 위한 compact foundation입니다. reasoning model이 아니므로 수학과 code generation 능력이 제한됩니다. tool calling과 agentic workflow도 지원하지 않습니다.
- Multimodal training에서 검증한 context 범위는 최대 8K tokens입니다. LM backbone 자체는 128K tokens를 지원하지만 8K를 넘는 멀티모달 입력은 extrapolation에 의존하며 benchmark되지 않았습니다. 긴 이미지·텍스트 조합을 운영 환경에 적용할 때는 별도 검증이 필요합니다.
- Native-resolution 처리는 이미지 원본의 세부 정보를 유지하지만 이미지 크기에 따라 메모리 사용량과 지연 시간이 증가합니다. System prompt는 학습에 사용되지 않아 권장되지 않으며 chat template이 system role을 받더라도 성능을 보장하지 않습니다. vLLM public support는 아직 제공 예정 상태입니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMBench DEV EN V11 | score | 0.687 | README VLMEvalKit 비교표 기준으로 Qwen3-VL-2B-Instruct 0.744, Qwen3.5-2B-Instruct 0.760보다 낮고 SmolVLM2.2B 0.674보다 높음 |
| MMStar | score | 0.518 | README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.614보다 낮고 LFM2.5-VL-1.6B 0.508보다 높음 |
| RealWorldQA | score | 0.622 | README VLMEvalKit 비교표 기준으로 Qwen3-VL-2B-Instruct 0.646보다 낮고 Ministral-3-3B-Instruct 0.583보다 높음 |
| GQA TestDev Balanced | score | 0.574 | README VLMEvalKit 비교표 기준으로 Phi-3.5-vision-instruct 0.650보다 낮고 Qwen3-VL-2B-Instruct 0.572보다 높음 |
| MTL MMBench DEV | score | 0.636 | README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.674와 Qwen3.5-2B-Instruct 0.669보다 낮음 |
| MMMB | score | 0.728 | README VLMEvalKit 비교표 기준으로 Gemma-4-E2B-it 0.743과 Qwen3.5-2B-Instruct 0.745보다 낮고 LFM2.5-VL-1.6B 0.717보다 높음 |
| BLINK | score | 0.527 | README VLMEvalKit 비교표 기준으로 Phi-3.5-vision-instruct 0.561과 Qwen3.5-2B-Instruct 0.563보다 낮고 Ministral-3-3B-Instruct 0.471보다 높음 |
| ChartQA Test | score | 0.808 | README VLMEvalKit 비교표 기준으로 Phi-3.5-vision-instruct 0.821보다 낮고 Ministral-3-3B-Instruct 0.791과 Qwen3.5-2B-Instruct 0.775보다 높음 |
| DocVQA VAL | score | 0.921 | README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.926보다 낮고 Ministral-3-3B-Instruct 0.896보다 높음 |
| InfoVQA VAL | score | 0.652 | README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.731보다 낮고 LFM2.5-VL-1.6B 0.627보다 높음 |
| OCRBench | score | 0.792 | README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.861과 LFM2.5-VL-1.6B 0.802보다 낮고 Phi-3.5-vision-instruct 0.642보다 높음 |
| AI2D TEST | score | 0.775 | README VLMEvalKit 비교표 기준으로 Phi-3.5-vision-instruct 0.790보다 낮고 Qwen3.5-2B-Instruct 0.752보다 높음 |
| CharXiv DQ | score | 0.600 | README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.766, Gemma-4-E2B-it 0.751, Qwen3.5-2B-Instruct 0.761보다 낮음 |
| MMMU DEV VAL | score | 0.329 | README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.508과 Gemma-4-E2B-it 0.477보다 낮음 |
| RefCOCO avg | score | 0.732 | README VLMEvalKit 비교표 기준으로 Qwen3.5-2B-Instruct 0.785보다 낮고 Ministral-3-3B-Instruct 0.317보다 높음 |
| CountBench | score | 0.725 | README VLMEvalKit 비교표 기준으로 LFM2.5-VL-1.6B 0.910, Qwen3-VL-2B-Instruct 0.848, Qwen3.5-2B-Instruct 0.805보다 낮음 |
| HallusionBench | score | 0.615 | README VLMEvalKit 비교표 기준으로 Qwen3-VL-2B-Instruct 0.673과 Qwen3.5-2B-Instruct 0.655보다 낮고 LFM2.5-VL-1.6B 0.601보다 높음 |
| MMLU test | score | 0.504 | README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.660, Gemma-4-E2B-it 0.692, Qwen3-VL-2B-Instruct 0.630보다 낮음 |
| MMLU-Pro test | score | 0.307 | README VLMEvalKit 비교표 기준으로 Ministral-3-3B-Instruct 0.475, Gemma-4-E2B-it 0.441, Qwen3-VL-2B-Instruct 0.428보다 낮음 |
| IFEval | score | 0.749 | README VLMEvalKit 비교표 기준으로 Gemma-4-E2B-it 0.869와 LFM2.5-VL-1.6B 0.776보다 낮고 Qwen3-VL-2B-Instruct 0.734보다 높음 |
이미지 분석

94
Likes
356
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.