TL;DR
대규모 대화 트랜스크립트를 대상으로 LLM 주도 특징 발견을 시도했다. 트랜스크립트를 사용자 발화, 생각, 응답으로 분리하고 각 조각의 특징을 자동 생성한 뒤 임베딩하고 클러스터링한 다음 클러스터를 요약한다. EDW와의 유사성·차이점을 비교하며, 실험적으로 100k 트랜스크립트에서 20k 특징을 생성하고, 많은 클러스터가 Gemini의 흥미로운 행동을 포착하지만 생각/응답의 예측은 로지스틱 회귀로도 완전히 설명되진 않는다는 점을 보인다. 이 방법은 모델 내부에 접근하지 않고도 행동 양상을 분석할 수 있게 해주지만, 모델 인퍼런스 내부를 제어하는 데에는 한계가 있다.
섹션별 상세
- 클러스터 중 예측 가능한 것은 주로 명확한 신호(예: API 참조에서의 HTTP 상태 코드)로 나타난다 — Cluster Prediction
- 모델 Thoughts에서 토큰 수 인지, 현실/역할극 구분, 무한 루프에 빠지는 경향 등 고수준 특징이 다수 포착된다 — Results / examples of most interesting clusters
이미지 분석

트랜스크립트를 사용자 발화/생각/응답으로 분리하고, 임베딩-클러스터링-레이블링으로 특징을 도출하는 파이프라인의 흐름을 시각적으로 제시한다.
LLM-Driven Feature Discovery 흐름을 보여주는 다이어그램

고정된 x축(Test F1)에서 Thought와 Response의 개별 카테고리별 빈도를 시각화해, 어떤 클러스터가 예측에 유의미한지 시사한다.
Thought/Response의 예측 성능 분포를 나타내는 차트
용어 해설
- 임베딩 공간(embedding space)
- — 트랜스크립트 조각을 임베딩 벡터로 표현하는 고유한 공간으로, 클러스터링과 주제 추출의 기초가 된다.
- 자동 평가자(autorater)
- — LLM이 자동으로 텍스트 조각의 특징을 제안하도록 하는 도구.
- 예언자/술어(Predicates)
- — 자연어로 기술된 특징 간의 일반화 가능한 주제를 도출하기 위한 자연어 속성 표현.
- EDW(Explaining Datasets in Words)(EDW)
- — 자연어로 해석 가능한 특징 공간 기반의 데이터 설명 기법으로, 본 연구와의 유사성을 언급한다.
기술
- LLM
- semantic embedding
- k-means clustering
- logistic regression
활용 사례
- model behavior analysis
- feature-based transcript labeling
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.