챕터별 상세
00:33
기존 리뷰 분석 방법론의 한계
통계 기반 방법론(LDA 등)은 전처리 과정에 성능이 크게 좌우되며 단어의 사전적 형태에만 의존해 문맥 파악이 어렵다. BERT와 같은 딥러닝 기반 모델은 문맥 이해도는 높으나 동일 단어가 긍정/부정으로 혼용될 때 이를 명확히 구분하지 못하는 경우가 발생한다. 또한 대부분의 연구가 미리 정의된 과업에만 집중되어 분석자의 실시간 관심사를 반영하지 못하는 정적인 결과만 제공한다.
02:40
RECUR 프레임워크의 구조와 기여점
RECUR는 고객 리뷰 특화 언어 모델, 리뷰 클러스터링, 리뷰 검색의 세 가지 모듈로 구성된다. 한국어 사전 학습 모델에 NpM 기법을 적용하여 리뷰 데이터의 세밀한 문맥 이해가 가능하도록 설계했다. 분석자가 입력한 쿼리에 맞는 리뷰를 실시간으로 검색하고 워드 그래프나 트렌드 그래프로 시각화하여 제공한다. 로우 텍스트(Raw Text)만으로 작동하여 언어나 도메인에 구애받지 않는 높은 범용성을 확보했다.
11:06
핵심 기술: 비모수 마스크 언어 모델링 (NpM)
NpM은 학습된 인코더와 참조 코퍼스를 결합하여 특정 단어의 문맥 내 의미 차이를 구분한다. 학습 시 코퍼스에 공통으로 등장하는 스팬(Span)을 마스킹하고 대조 학습(Contrastive Learning)을 통해 같은 의미의 스팬끼리 정답에 가깝게 배치한다. 인코더가 입력 문장을 벡터로 변환하면 리트리버가 참조 코퍼스에서 가장 유사한 문장을 찾아 마스크 자리에 삽입하는 방식으로 작동한다. 이 과정은 모델이 단어의 사전적 의미를 넘어 실제 쓰임새를 학습하게 만든다.
17:16
리뷰 클러스터링 및 시각화 모듈
고객 리뷰를 임베딩 벡터로 변환한 뒤 K-means 알고리즘을 적용하여 의미론적으로 군집화한다. 각 클러스터 내에서 중심점과 코사인 유사도가 높은 상위 K개의 대표 리뷰를 선정하여 분석가에게 제공한다. 워드 그래프는 키워드 간의 연결 구조를 보여주며, 트렌드 그래프는 시간 경과에 따른 클러스터별 리뷰 수 변화를 기록한다. 실제 사례에서 특정 분기에 발생한 세탁기 품질 이슈가 트렌드 그래프상에서 급격한 리뷰 증가로 나타남을 확인했다.
20:16
리뷰 검색 및 메타데이터 분석
사용자가 특정 토픽을 입력하면 민 풀링(Mean Pooling) 방식으로 쿼리 임베딩을 생성하고 기존 리뷰 벡터들과 비교한다. 코사인 유사도가 높은 상위 리뷰들을 긍정과 부정 집합으로 나누어 검색 결과로 반환한다. 검색된 리뷰들 간의 관계를 시각화한 리뷰 그래프와 제품명, 리뷰 출처 등 메타데이터 기반의 분포 차트를 함께 제공한다. 이를 통해 분석자는 특정 기능에 대한 고객의 긍부정 반응과 주요 유입 경로를 동시에 파악할 수 있다.
22:46
실험 결과 및 성능 분석
KLUE-RoBERTa를 베이스라인으로 하여 MLM, SimCSE, DiffCSE 모델과 RECUR(NpM)의 성능을 비교했다. 클러스터링 품질 지표인 실루엣 계수 등에서 NpM 기반 모델이 모든 제품군과 감성 데이터에서 가장 높은 성능을 기록했다. 특히 짧은 리뷰 데이터에서 복잡한 노이즈를 추가하는 DiffCSE보다 기본적인 NpM 방식이 더 안정적인 결과를 보였다. 질적 평가에서도 NpM은 쿼리의 의미와 가장 일치하는 리뷰를 정확하게 찾아내는 능력을 입증했다.
용어 해설
- 비모수 마스크 언어 모델링(NpM)
- — 파라미터에 모든 지식을 저장하는 대신 외부 참조 코퍼스에서 정보를 검색하여 마스킹된 토큰을 예측하는 기법이다. 특정 단어가 문맥에 따라 다른 의미를 가질 때 이를 더 정교하게 구분할 수 있게 하며, 도메인 특화 데이터 분석에 효과적이다.
- 대조 학습(Contrastive Learning)
- — 데이터 간의 유사성과 차이점을 모델이 스스로 학습하도록 하는 방식이다. 같은 의미를 가진 데이터 쌍은 가깝게, 서로 다른 의미의 데이터 쌍은 멀게 배치하여 고성능의 임베딩 벡터를 생성하는 데 기여한다.
- 실루엣 계수(Silhouette Index)
- — 클러스터링 품질을 측정하는 지표로, 데이터가 자신이 속한 군집과 얼마나 가깝고 다른 군집과는 얼마나 먼지를 나타낸다. 1에 가까울수록 군집화가 잘 된 것이며, 모델의 분류 성능을 정량적으로 평가하는 데 사용된다.
- 워드 그래프(Word Graph)
- — 문서 내 단어들 간의 동시 출현 빈도를 기반으로 단어 사이의 관계를 시각화한 네트워크 그래프이다. 핵심 키워드 간의 연결 구조를 파악하여 리뷰 데이터의 주요 주제를 직관적으로 이해하도록 돕는다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 31.수집 2026. 03. 31.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.