이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
Krea 2는 일관성보다 창작 탐색을 위한 다양성과 속도를 우선하는 디퓨전 모델이다. 아키텍처가 고정된 후 모델 성능을 결정하는 핵심은 데이터 큐레이션이며, 중복 제거, VLM 증류 분류기, 희소 오토인코더 등을 활용해 10억 장 규모의 데이터를 정제한다. LLM 학습 파이프라인을 차용하여 저해상도에서 고해상도로 점진적 학습을 수행하며, 최근에는 프롬프트 확장기와 디퓨전 모델을 결합한 DALL-E 2 스타일의 구조로 회귀하고 있다.
챕터별 상세
Krea 2 오픈소스 공개
Krea 2 미디엄 모델의 오픈소스 공개와 창작자를 위한 스타일 다양성 확보 전략을 다룬다. 모델의 설계 목적은 창작 스튜디오가 원하는 스타일을 빠르게 탐색할 수 있도록 돕는 것이다.
생산 모델의 일관성 vs 다양성
ChatGPT 등 대형 생산 모델은 일관성을 위해 평균적인 결과물을 생성하지만, Krea 2는 창작 탐색을 위해 스타일의 다양성과 빠른 생성 속도를 최적화했다. 일관성 위주의 모델은 창작 과정에서 필요한 실험적 탐색을 저해하는 요소가 된다.
디퓨전 모델 학습과 잠재 공간의 효율성
픽셀 단위가 아닌 잠재 공간(Latent Space)에서 학습하여 효율성을 높이는 디퓨전 모델의 원리를 설명한다. 오토인코더를 통해 공간을 압축함으로써 모델 학습의 연산 비용을 획기적으로 줄였다.
잠재 공간(Latent Space)은 고차원 데이터를 저차원으로 압축하여 모델이 학습하기 쉬운 형태로 만든 공간을 의미한다.
데이터의 중요성
아키텍처가 확정된 후 모델 성능을 결정하는 핵심은 데이터 큐레이션이다. 모델의 분포를 형성하는 엔진으로서 데이터의 질이 결과물의 품질을 좌우한다.
나쁜 데이터와 AI 생성 이미지 배제
중복 데이터, 편향된 샘플, 저해상도 고복잡도 이미지를 필터링하며, AI 생성 이미지는 스타일이 고착화되어 타 모델의 편향을 상속할 위험이 있으므로 학습에서 배제한다. 데이터 큐레이션은 모델의 독창성을 유지하는 필수 과정이다.
캡셔닝 파이프라인
OCR로 텍스트를 추출하고 VLM으로 상세 캡션을 생성한 뒤 프롬프트를 재작성하여 데이터 품질을 높인다. 예를 들어 액자에 걸린 그림 사진에서 액자와 흰 벽을 캡션에 포함하지 않으면 모델이 모든 그림을 액자에 걸린 형태로 생성하는 문제가 발생한다.
데이터 중복 제거와 분류기
해시와 임베딩 기반으로 중복을 제거하고, 대형 VLM에서 증류한 경량 분류기로 10억 장 규모의 데이터를 필터링한다. 대규모 데이터셋에서 효율적인 정제를 위해 다단계 필터링 기법을 적용했다.
희소 오토인코더를 활용한 태깅
희소 오토인코더(SAE)를 비지도 태깅 시스템으로 활용하여 워터마크와 경계 아티팩트를 제거한다. 특정 특징이 활성화되는 것을 감지하여 원치 않는 데이터를 자동으로 걸러낸다.
위키피디아 기반 지식 커버리지
위키피디아 개념의 PageRank를 활용하여 모델의 지식 커버리지를 검증한다. 상위 90% 개념을 포함하도록 텍스트 및 임베딩 검색을 통해 데이터셋의 지식 범위를 확보했다.
LLM에서 차용한 학습 파이프라인
저해상도에서 고해상도로 점진적 학습, SFT, 선호도 최적화, RL, 프롬프트 확장 등 LLM 학습 기법을 디퓨전 모델에 적용했다. 데이터 정제와 학습 파이프라인의 조화가 모델 성능의 핵심이다.
빠른 반복을 위한 핵심 요소
인프라 구축, 데이터의 영속성, 단순성과 확장성, 빠른 피드백 루프가 모델 개발 속도를 결정한다. 코드보다 데이터의 가치가 더 영속적이라는 점을 강조한다.
DALL-E 2로의 회귀
프롬프트 확장기(디코더)와 디퓨전(인코더) 구조로 돌아가는 스택의 역전 현상을 언급한다. 이는 DALL-E 2와 유사한 구조로, 프롬프트 확장기가 사용자 의도를 해석하여 디퓨전 모델의 생성 품질을 높인다.
용어 해설
- 디퓨전 모델(Diffusion Model)
- — 데이터에 노이즈를 점진적으로 추가한 뒤 이를 역으로 제거하는 과정을 학습하여 이미지를 생성하는 모델이다. 픽셀 공간보다 잠재 공간에서 학습하는 것이 효율적이며, 최근 생성 AI의 핵심 아키텍처로 사용된다.
- 잠재 공간(Latent Space)
- — 고차원 데이터를 저차원의 압축된 형태로 표현한 공간이다. 디퓨전 모델은 픽셀 단위의 연산 대신 이 잠재 공간에서 노이즈 제거를 수행하여 계산 효율성을 극대화한다.
- 희소 오토인코더(Sparse Autoencoder)
- — 입력 데이터의 특징을 희소한(sparse) 형태로 압축하여 재구성하는 신경망이다. 모델의 내부 활성화 패턴을 해석하거나 워터마크, 아티팩트와 같은 특정 데이터 특징을 비지도 방식으로 태깅하는 데 활용된다.
- 시각 언어 모델(VLM)
- — 이미지와 텍스트를 동시에 이해하고 처리하는 모델이다. 이미지에 대한 상세 캡션을 생성하거나 이미지의 품질을 평가하는 분류기로 활용되어 데이터 큐레이션 파이프라인의 핵심 역할을 수행한다.
언급된 리소스
GitHubKrea 2 GitHub
GitHubSangwu Lee GitHub
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 08. 18.수집 2026. 08. 18.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.