용어 해설
- 중간 융합(Mid-fusion)
- — 비전 인코더와 언어 모델을 별도로 유지하면서 중간 단계에서 특징을 결합하는 방식이다. 비전 인코더가 이미지를 먼저 처리한 후 필요한 시각적 토큰만 언어 모델에 주입함으로써 연산 효율성을 유지하면서도 두 모달리티 간의 강력한 정렬을 가능하게 한다.
- 사고의 사슬(Chain-of-Thought)
- — 모델이 최종 답을 내기 전에 중간 추론 단계를 거치도록 유도하는 기법이다. 복잡한 논리적 문제나 수학 문제 해결 시 단계별 사고 과정을 텍스트로 생성하게 함으로써 결과의 정확도와 논리적 일관성을 크게 향상시킨다.
- 동적 해상도(Dynamic Resolution)
- — 이미지의 크기나 비율에 맞춰 인코딩 해상도를 가변적으로 조절하는 기술이다. 고정된 크기로 이미지를 강제 변환할 때 발생하는 왜곡을 방지하고, 고해상도 이미지의 세부 정보를 보존하여 작은 텍스트나 아이콘 인식을 돕는다.
- 좌표 정규화(Coordinate Normalization)
- — 이미지 내 객체의 위치를 절대 픽셀 값이 아닌 0과 1 사이의 상대적 비율로 변환하는 과정이다. 다양한 해상도의 이미지에서 모델이 일관된 위치 정보를 이해하도록 도와 GUI 조작이나 객체 탐지 성능을 높인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.