본문으로 건너뛰기

아무런 지시가 없을 때 LLM은 무엇을 생각하는가? 제약 없는 생성 연구

Together AI는 최소한의 프롬프트만 주어졌을 때 LLM이 보이는 고유한 주제 선호도와 퇴행 패턴을 분석하여 모델별 지식 편향과 안전성 위험을 확인했다.

섹션별 상세

01
모델 가족별로 고유한 지식 우선순위(Knowledge Priors)가 존재한다. GPT-OSS는 프로그래밍(27.1%)과 수학(24.6%)에 압도적으로 치중되어 있으며 Llama는 문학적 서술, DeepSeek은 종교적 콘텐츠, Qwen은 객관식 시험 문제 생성에 특화된 경향을 보인다.
제약 없는 LLM 생성 결과의 임베딩 시각화 차트
Chart각 점은 생성된 샘플을 나타내며 색상은 사후 추론된 의미론적 카테고리를 의미한다. 모델 가족별로 서로 다른 영역에 데이터가 밀집되어 있어 고유한 주제적 선호도가 있음을 시각적으로 증명한다.
모델 가족별 상위 주제 분포 바 차트
ChartGPT-OSS는 프로그래밍과 수학에 집중되어 있고 Llama는 문학, DeepSeek은 종교, Qwen은 수학과 프로그래밍 순으로 높은 비중을 차지함을 수치로 보여준다.
02
기술적 내용의 깊이에서도 모델 간 차이가 뚜렷하다. GPT-OSS는 생성된 프로그래밍 및 수학 텍스트의 68.2%가 고급 또는 전문가 수준(예: 동적 계획법, DFS/BFS)인 반면 Llama와 Qwen은 기초 및 중급 수준의 내용에 머무는 경우가 많다.
프로그래밍 및 수학 텍스트의 난이도 수준 분포
ChartGPT-OSS는 전문가(Expert) 및 고급(Advanced) 수준의 콘텐츠 비중이 압도적으로 높은 반면 Llama와 Qwen은 기초 수준의 비중이 상대적으로 높음을 나타낸다.
03
채팅 템플릿과 시스템 프롬프트가 제거된 상태에서 모델은 고유한 퇴행(Degeneration) 패턴을 보인다. GPT-OSS는 코드 블록 구분자를 반복하고 Qwen은 이모지와 중국어 텍스트를 생성하며 Llama는 실제 개인의 Facebook 및 Instagram URL을 노출하는 등 심각한 개인정보 유출 위험을 드러냈다.
모델별 퇴행적 텍스트 생성 사례
ScreenshotLlama가 실제 개인 소셜 미디어 계정 URL을 생성하는 사례와 Qwen이 이모지 및 중국어를 남발하는 사례를 통해 모델별 고유한 오류 패턴을 보여준다.
04
이러한 행동 양식은 프롬프트, 임베딩 모델, 라벨러의 변화에도 불구하고 일관되게 유지되는 시스템적 지문과 같다. 이는 표준 벤치마크가 놓치기 쉬운 모델의 기본값(Defaults)을 이해하고 모델 감사 및 행동 모니터링에 활용될 수 있는 중요한 지표이다.

용어 해설

제약 없는 생성(Unconstrained Generation)
특정 작업 지시나 주제 제한 없이 최소한의 입력값만으로 모델이 텍스트를 생성하게 하는 방식이다. 모델이 학습 과정에서 내재화한 고유한 확률 분포와 지식 우선순위를 파악하는 데 사용된다.
지식 우선순위(Knowledge Prior)
모델이 특정 주제에 대해 가지고 있는 사전 지식의 분포를 의미한다. 학습 데이터의 구성에 따라 모델이 더 익숙하게 느끼고 자주 생성하는 주제가 결정된다.
신경망 텍스트 퇴행(Neural Text Degeneration)
언어 모델이 의미 없는 문구를 반복하거나 논리적이지 않은 텍스트를 생성하는 현상이다. 주로 제약이 적은 생성 환경에서 발생하며 모델의 취약점을 드러낸다.
채팅 템플릿(Chat Template)
사용자와 AI 간의 대화를 구조화하기 위해 사용되는 포맷이다. 시스템 프롬프트나 역할 정의를 포함하여 모델이 특정 페르소나를 유지하도록 강제하는 역할을 한다.

기술

  • GPT-OSS
  • Llama
  • DeepSeek
  • Qwen
  • Claude 4.5 Opus

활용 사례

  • 모델 행동 모니터링
  • 개인정보 유출 취약점 진단
  • 도메인 특화 모델 평가
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 06.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.