본문으로 건너뛰기

2025년 LLM 현황 보고서: 발전, 문제점 그리고 미래 예측

2025년 LLM 기술은 DeepSeek R1이 촉발한 추론 모델 혁명과 RLVR, GRPO 기법을 중심으로 효율성과 실용적 성능을 극대화하는 방향으로 진화했다.

섹션별 상세

01
DeepSeek R1은 강화학습(RL)을 통해 모델이 스스로 사고 과정을 생성하는 '추론 모델'의 대중화를 이끌었다. 특히 DeepSeek-V3 학습에 약 558만 달러, R1 추가 학습에 29만 달러라는 파격적으로 낮은 비용을 제시하며 고성능 모델 개발의 경제적 장벽을 허물었다.
일반 LLM과 추론 LLM의 답변 방식 차이를 보여주는 다이어그램.
Diagram추론 모델이 단순히 정답만 내놓는 것이 아니라 'Chain-of-Thought' 과정을 거쳐 단계별로 사고하는 과정을 시각화하여 설명한다.
DeepSeek-V3 모델의 단계별 학습 비용 표.
Chart671B 파라미터 모델을 학습하는 데 약 558만 달러가 소요되었음을 수치로 보여주며, 기존 예상보다 훨씬 저렴한 비용을 입증한다.
DeepSeek-R1의 추가 학습 비용 상세 표.
ChartV3 모델 위에 추론 능력을 입히는 데 단 29.4만 달러의 추가 비용이 들었음을 명시하여 RLVR의 효율성을 강조한다.
02
포스트 트레이닝 단계에서 RLVR(Verifiable Rewards)과 GRPO 알고리즘이 핵심 기술로 부상했다. 수학이나 코드처럼 정답이 명확한 도메인에서 결정론적인 보상을 제공함으로써, 값비싼 인간 피드백(RLHF) 없이도 모델의 문제 해결 능력을 획기적으로 개선할 수 있게 되었다.
계산기를 활용한 검증 가능한 보상(Verifiable Reward)의 예시.
Infographic모델의 출력을 외부 도구(계산기) 결과와 비교하여 정답 여부를 판단하는 RLVR의 핵심 메커니즘을 설명한다.
03
모델 아키텍처는 MoE(Mixture-of-Experts)와 효율적인 어텐션 기법(GQA, MLA 등)을 사용하는 방향으로 표준화되었다. Qwen3-Next나 Nemotron 3와 같이 선형 스케일링을 목표로 하는 Gated DeltaNet이나 Mamba-2 레이어를 도입하여 추론 효율성을 극대화하려는 시도가 늘어났다.
LLM 학습 단계별 강화학습 적용 지점을 나타낸 플로우차트.
Diagram프리트레이닝부터 포스트트레이닝, 그리고 추론 모델로 이어지는 기술적 진화 과정을 단계별로 구분하여 보여준다.
04
단순한 모델 학습을 넘어 추론 시간 스케일링(Inference-time Scaling)과 도구 사용(Tool Use)이 성능 차별화 요소가 되었다. 복잡한 문제 해결을 위해 모델이 더 많은 '생각'을 하도록 유도하거나, 외부 검색 엔진 및 계산기 API를 활용하여 할루시네이션을 줄이는 방식이 보편화되었다.
05
업계 전반에 벤치마크 점수만을 극대화하려는 '벤치맥싱(Benchmaxxing)' 현상이 심화되며 공개 데이터셋 오염 문제가 대두되었다. 이에 따라 단순한 점수 비교보다는 실제 사용 환경에서의 유용성과 도메인 특화 데이터의 중요성이 더욱 강조되고 있다.

용어 해설

그룹 상대 정책 최적화(GRPO)
별도의 비평가(Critic) 모델 없이 그룹 내 답변들의 상대적 보상을 계산하여 모델을 학습시키는 강화학습 알고리즘이다. 메모리 사용량을 획기적으로 줄여 대규모 모델의 추론 능력 학습에 최적화되어 있다.
검증 가능한 보상을 통한 강화학습(RLVR)
수학 정답이나 코드 실행 결과처럼 객관적으로 정오를 판별할 수 있는 '검증 가능한' 신호를 보상으로 사용하는 학습 방식이다. 인간의 주관적 피드백 없이도 모델이 복잡한 논리 구조를 스스로 학습하게 한다.
추론 시간 스케일링(Inference-time Scaling)
모델 학습 단계가 아닌 실제 답변 생성 시점에 더 많은 연산 자원과 시간을 투입하여 품질을 높이는 기법이다. 여러 번의 시도나 긴 사고 과정을 거치게 함으로써 복잡한 문제의 정답률을 높인다.
벤치맥싱(Benchmaxxing)
실제 유용성보다 벤치마크 점수를 높이는 데만 과도하게 집중하는 현상을 의미한다. 공개된 테스트 데이터가 학습에 포함되거나 특정 지표에만 최적화되어 모델의 실제 성능이 왜곡되는 문제를 야기한다.
전문가 혼합 아키텍처(MoE)
전체 파라미터 중 입력값에 따라 필요한 일부 '전문가' 네트워크만 활성화하여 연산하는 구조이다. 모델의 크기는 키우면서도 추론 비용과 속도를 효율적으로 유지할 수 있게 해준다.

기술

  • DeepSeek-R1
  • GRPO
  • RLVR
  • MoE
  • MLA
  • MCP

활용 사례

  • 수학 문제 풀이
  • 복잡한 코드 작성
  • 에이전트 시스템 구축
  • 도메인 특화 LLM 개발
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 12. 30.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.