본문으로 건너뛰기
SambaNova Blog조회 1

Many-Shot 프롬프팅: 대규모 인-컨텍스트 러닝 실전 가이드

수백~수천 개의 예시를 활용하는 Many-Shot ICL의 성능 특성과 최적의 예시 선택 전략을 실험을 통해 분석한 가이드입니다.

섹션별 상세

01
기존 Few-shot을 넘어 수천 개의 예시를 주입하는 Many-Shot ICL은 구조화된 작업에서 파인튜닝 수준의 성능을 제공합니다. Banking77 데이터셋 실험 결과, 예시 개수가 늘어남에 따라 정확도가 68%에서 최대 82.3%까지 지속적으로 상승하는 선형적 개선 효과가 확인됐습니다. 이는 긴 컨텍스트를 지원하는 최신 아키텍처가 모델 파라미터 업데이트 없이도 복잡한 패턴을 학습할 수 있게 함을 의미합니다.
Zero-shot, One-shot, Few-shot 학습과 전통적인 Fine-tuning의 차이점을 설명하는 다이어그램입니다.
DiagramICL은 모델 파라미터 업데이트 없이 프롬프트 내 예시만으로 학습하는 반면, Fine-tuning은 그래디언트 업데이트를 통해 모델을 직접 학습시킴을 보여줍니다. Many-shot ICL이 Fine-tuning의 유연한 대안이 될 수 있는 개념적 배경을 제공합니다.
샷 수 증가에 따른 컨텍스트 길이(토큰 수)의 변화를 보여주는 그래프입니다.
ChartGPQA Diamond와 Banking77 데이터셋에서 예시 수가 늘어남에 따라 필요한 토큰 수가 선형적으로 증가하여 최대 128k에 도달함을 보여줍니다. 이는 Many-shot ICL을 위해 긴 컨텍스트 지원 아키텍처가 필수적임을 시각화합니다.
02
단순히 많은 예시를 넣는 것보다 입력 쿼리와 유사한 예시를 동적으로 선택하는 전략이 초기 성능 향상에 결정적입니다. 실험에서 클래스당 1개의 유사도 기반 예시를 선택했을 때 90.2%의 최고 정확도를 기록했으며, 이는 무작위 선택보다 훨씬 높은 효율을 보였습니다. 다만 예시 수가 50개를 넘어가면 유사도 기반 방식은 중복성 문제로 인해 무작위 선택 방식보다 성능이 더 빠르게 저하되는 트레이드오프가 발생합니다.
03
모델의 크기에 따라 Many-Shot 예시를 수용하고 활용하는 능력이 다르게 나타납니다. Llama 3.3 70B와 같은 대형 모델은 적은 수의 예시로도 높은 성능을 내지만, 예시가 너무 많아지면 오버컨디셔닝으로 인해 성능이 오히려 하락하는 현상이 관찰됐습니다. 반면 Llama 3.1 8B 모델은 예시가 늘어날수록 성능이 꾸준히 개선되어, 충분한 프롬프트 길이가 모델 용량의 한계를 일부 보완할 수 있음을 시사합니다.
04
Chain-of-Thought(CoT)를 포함하는 Reinforced ICL은 일반적인 ICL과 달리 매우 적은 수의 예시에서 성능이 정점에 도달합니다. GPQA Diamond 벤치마크에서 단 4개의 추론 경로 예시만으로도 최고 성능을 기록했으며, 그 이상의 예시를 추가하면 모델의 주의력이 분산되어 성능이 정체되거나 하락했습니다. 이는 복잡한 추론 작업에서는 예시의 양보다 질적인 논리 구조를 보여주는 소수의 예시가 더 효과적임을 보여줍니다.

기술

  • Llama 3.1 8B
  • Llama 3.3 70B
  • SambaNova RDU
  • LMCache
  • MoonCake

활용 사례

  • 대규모 클래스 분류 (Extreme Label Classification)
  • 복잡한 정보 추출 (Information Extraction)
  • 구조화된 데이터 추론
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 23.수집 2026. 04. 23.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.