TL;DR
학술 원고 작업을 위해 멀티모달 AI 평가 경험자를 모집하고 있으며 프로젝트는 이미지-텍스트 정합성을 중심으로 CLIPScore, SBERT similarity, BLEU, ROUGE 같은 의미적·언어적 지표를 병행해 평가하는 설계를 채택하고 있다. 연구 설계와 도메인 전문성은 이미 확보되어 있어 새로 참여하는 이는 평가 스크립트 구현과 자동화, 지표 간 비교와 해석에 주로 기여하게 된다. 의미 있는 기여에 대해서는 공동저자 자격이 제공되며 관심자는 DM으로 연락하라고 안내되어 있다.
섹션별 상세
용어 해설
- CLIPScore
- — CLIPScore는 CLIP의 이미지와 텍스트 임베딩 간 유사도를 기반으로 이미지·캡션 정합성을 수치화하는 평가 지표이다. 입력 이미지를 이미지 인코더에, 생성된 캡션을 텍스트 인코더에 통과시켜 각각 임베딩을 얻고 이들 임베딩의 코사인 유사도를 계산한다. 이미지-텍스트 의미적 정합성을 빠르게 비교할 때 널리 사용되며, 픽셀·어휘 대비 의미적 일치 여부를 평가하는 데 장점이 있다.
- SBERT
- — SBERT는 문장 수준 의미 비교를 위해 BERT 구조를 변형해 문장 임베딩을 생성하는 모델 계열이다. 문장이나 캡션을 입력으로 받아 고정 차원 벡터를 출력하고, 출력 벡터들 간의 코사인 유사도로 의미적 유사도를 평가한다. 캡션과 레퍼런스 문장 간 의미적 근접성을 정량화할 때 실무에서 자주 활용된다.
- BLEU
- — BLEU는 생성 텍스트와 참조 텍스트의 n-그램 겹침 비율을 계산하는 전통적 기계번역 품질 지표이다. 일반적으로 1~4그램 일치율을 가중 평균하고 brevity penalty를 적용해 점수를 산출한다. 어휘적 일치에 민감해 의미적 동등성을 온전히 반영하지 못하는 한계가 존재한다.
- ROUGE
- — ROUGE는 생성 텍스트와 참조 텍스트 간 n-그램, 롱스트링 매칭 등을 기반으로 요약 품질을 평가하는 지표군이다. 주로 ROUGE-N, ROUGE-L 같이 서로 다른 정합성 척도를 제공하며 n-그램 일치와 서열적 겹침을 측정한다. 요약이나 캡션의 단어·구문 수준 복원을 확인하는 데 유용하지만 의미적 유사성은 보완이 필요하다.
- Vision-Language Model
- — Vision-Language 모델은 이미지와 텍스트 입력을 모두 처리해 멀티모달 표현을 학습하는 모델 계열이다. 이미지 인코더와 텍스트 인코더를 결합하거나 단일 모듈에서 멀티모달 토큰을 처리한 뒤 합성된 임베딩을 생성해 다양한 태스크에서 사용한다. 이미지 캡션 생성과 평가에서 이미지와 텍스트 사이의 의미적 정합성을 측정하고 분석하는 핵심 구성요소로 활용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
