챕터별 상세
팀 소개 및 솔루션 개요
우크라이나 출신의 Taras Semenchenko와 Andrii Ivanenko 팀이 7위 솔루션을 발표했다. 솔루션은 Mean Prompt 학습, 학습 데이터셋 생성, LLM 통합의 세 가지 핵심 요소로 구성됐다. 전체 학습 과정은 RTX 4090 환경에서 약 8~10시간이 소요됐다.
Mean Prompt 학습 - Beam Search 기법
약 8,000개의 예시 프롬프트가 포함된 데이터셋을 바탕으로 모든 예시와 유사한 Mean Prompt를 생성했다. Beam Search 방식을 적용하여 매 반복마다 프롬프트 끝에 단어를 하나씩 추가하며 데이터셋 내 다른 프롬프트들과의 유사도를 높였다. 초기값인 'rewrite this text'에서 시작하여 성능을 개선하는 최적의 단어 조합을 탐색했다.
단어 삽입 및 프롬프트 트리밍 최적화
프롬프트의 끝에 단어를 추가하는 것 외에도 모든 가능한 위치에 단어를 삽입하는 Word Inserting 방식을 사용했다. 점수가 개선되는 경우에만 단어를 삽입하는 Greedy 알고리즘을 적용했다. 또한 프롬프트가 128토큰을 초과하지 않도록 점수 하락을 최소화하면서 불필요한 단어를 제거하는 Prompt Trimming 과정을 병행했다.
최종 학습 알고리즘 워크플로
Beam Search로 약 100개의 단어를 생성한 후 삽입 및 삭제 연산을 순차적으로 수행했다. 각 에포크(Epoch)가 끝날 때마다 122토큰 이하로 길이를 맞추는 추가 트리밍을 실시했다. 이 과정은 목표하는 프롬프트 점수에 도달할 때까지 3~4회 반복되는 최적화 루프 구조를 가졌다.
데이터셋 생성 및 리샘플링 전략
공개된 프롬프트들을 수집하여 거대한 데이터셋을 구축한 후 리더보드(LB) 점수와 상관관계가 높은 로컬 데이터셋을 선별했다. 로컬 점수와 리더보드 점수 간의 코사인 유사도를 측정하는 평가 메트릭을 정의했다. 매 반복마다 무작위로 10개의 프롬프트를 샘플링하여 평가 메트릭이 개선되는 경우에만 새로운 데이터셋에 포함시키는 리샘플링 과정을 거쳤다.
추론 - Mean Prompt와 LLM의 결합
추론 단계에서는 Mistral 7B 모델을 파인튜닝 없이 그대로 사용했다. 모델은 원본 텍스트와 수정된 텍스트를 입력받아 'improve this text by'로 시작하는 프롬프트를 생성했다. 학습된 Mean Prompt와 LLM이 생성한 구체적인 지시사항을 결합하되 전체 길이가 128토큰을 넘지 않도록 엄격히 관리했다.
text
Mean prompt: 'Rewrite this text ...'
LLM prediction: 'making it a sea shanty'
Combined: 'Rewrite this text ... making it a sea shanty'학습된 Mean Prompt와 LLM의 추론 결과를 결합하여 최종 프롬프트를 구성하는 방식의 예시
주요 발견 및 결론
T5-sentence 모델의 입력에 단어를 추가하는 것만으로도 필요한 문장 임베딩을 구성할 수 있음을 확인했다. Mean Prompt와 LLM 예측의 결합이 단독 사용보다 유사도 점수를 향상시켰다. 특히 프롬프트 길이가 128토큰을 넘을 경우 리더보드 점수가 매우 낮아진다는 물리적 제약 조건을 발견했다.
용어 해설
- 평균 프롬프트(Mean Prompt)
- — 여러 데이터 샘플에 대해 공통적으로 높은 성능을 내는 범용적인 프롬프트이다. 특정 데이터셋 전체의 특성을 반영하도록 학습되며, 개별 데이터에 특화된 프롬프트와 결합하여 기본 성능을 보장하는 역할을 한다.
- 빔 서치(Beam Search)
- — 텍스트 생성 시 각 단계에서 가장 확률이 높은 K개의 후보(빔)를 유지하며 최적의 문장을 찾는 탐색 알고리즘이다. 모든 경우의 수를 탐색하는 것보다 효율적이며, 단순한 Greedy 탐색보다 더 나은 전체 최적해를 찾을 가능성이 높다.
- 코사인 유사도(Cosine Similarity)
- — 두 벡터 사이의 각도를 이용하여 유사도를 측정하는 지표이다. 텍스트 임베딩 벡터 간의 유사성을 비교할 때 주로 사용되며, 벡터의 크기보다 방향성에 집중하여 문맥적 유사성을 판단하는 데 효과적이다.
- 미스트랄 7B(Mistral 7B)
- — Mistral AI에서 공개한 70억 개의 파라미터를 가진 효율적인 대규모 언어 모델이다. 상대적으로 작은 크기에도 불구하고 높은 추론 성능을 보이며, 다양한 파인튜닝 및 경진대회 솔루션의 베이스 모델로 널리 사용된다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 26.수집 2026. 02. 26.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.