용어 해설
- 멀티모달 대형 언어 모델(MLLM)
- — 텍스트뿐만 아니라 이미지, 오디오, 비디오 등 다양한 형태의 데이터를 동시에 이해하고 처리할 수 있는 인공지능 모델이다. 제조 현장의 복잡한 시각 정보와 텍스트 지침을 통합하여 추론하고 의사결정을 내리는 데 핵심적인 역할을 한다.
- 시각적 접지(Visual Grounding)
- — 이미지 내의 특정 객체나 영역을 텍스트 설명과 연결하는 기술이다. 예를 들어 'M14 육각 너트'라는 텍스트가 이미지의 어느 좌표에 해당하는지 정확히 찾아내는 능력을 의미하며, 정밀한 부품 식별이 필요한 제조 분야에서 필수적이다.
- 포인트 클라우드(Point Cloud)
- — 3D 공간상에 흩어져 있는 수많은 점들의 집합으로 객체의 형상을 표현하는 데이터 형식이다. 2D 이미지보다 입체적인 구조 정보를 더 정확하게 담고 있어, 제조 부품의 미세한 결함이나 정밀한 기하학적 형상을 분석하는 데 사용된다.
- 지도 미세 조정(Supervised Fine-Tuning)
- — 사전 학습된 모델을 특정 도메인의 정답 데이터셋으로 추가 학습시켜 성능을 최적화하는 기법이다. 본 논문에서는 일반적인 MLLM을 제조 현장 데이터로 학습시켜 전문 지식과 추론 능력을 강화하는 데 활용했다.
코드 예제
x, y, z
1896, 750, 31970
3732, -3451, 320513D 포인트 클라우드 데이터를 MLLM이 읽을 수 있도록 정수 좌표 테이블 형태로 직렬화한 예시
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.