TL;DR
Sebastian Raschka가 2026년 1월부터 5월까지 북마크한 LLM 연구 논문을 주제별로 정리한 큐레이션 목록입니다. 전체 출판물을 망라한 서지는 아니며, 저자의 연구·집필·강의·코딩 작업과 관련해 다시 찾기 쉬운 논문을 모은 개인 참고 목록에 가깝습니다. 2025년 목록보다 Agent harnesses, Tool Use, Long Context, Diffusion Language Models, Serving Infrastructure 관련 논문이 늘었고, 글에 포함된 첫 번째 장에서는 Hybrid Architecture와 긴 문맥 효율을 중심으로 Nemotron 3, Mamba-3, Gated DeltaNet-2 등을 연결합니다. 특히 Nemotron 3 Super는 Attention과 Mamba-2 레이어를 교차 배치하는 120B-A12B 모델로 소개되며, Nemotron 3 Nano 4B와 Nemotron 3 Ultra 550B-A55B도 함께 언급됩니다. 이후 Efficient Training and Scaling 장으로 이어지지만, 제공된 본문은 해당 장의 도입부에서 끝납니다.
섹션별 상세
용어 해설
- 하이브리드 아키텍처(Hybrid Architecture)
- — 서로 다른 연산 구조를 하나의 언어 모델 안에서 교차 배치하는 설계입니다. Nemotron 3는 일반 Attention 레이어와 Mamba-2 레이어를 번갈아 사용해 긴 문맥에서 Attention의 비용을 줄이는 방향을 취합니다. 긴 입력을 다루는 Agent 시스템의 추론 효율을 높이는 데 중요합니다.
- 상태 공간 모델(State Space Model)
- — 이전 입력의 정보를 상태로 압축해 순차 데이터를 처리하는 모델 구조입니다. Mamba 계열 레이어는 전체 토큰 간 Attention을 매번 계산하지 않고 상태 갱신을 통해 시퀀스를 처리합니다. 긴 문맥을 더 효율적으로 다루기 위한 대안 구조로 소개됩니다.
- Mixture-of-Experts
- — 여러 Expert 네트워크 중 일부만 입력마다 선택해 계산하는 모델 구조입니다. 글에서는 Expert 수를 늘리는 방식뿐 아니라 Embedding과 활성 파라미터의 배분이 성능에 미치는 영향도 관련 연구 주제로 묶습니다. 전체 파라미터 규모와 실제 계산량을 분리할 수 있다는 점이 핵심입니다.
- 추측 디코딩(Speculative Decoding)
- — 작은 모델이나 추가 예측 헤드가 다음 토큰을 미리 생성하고 큰 모델이 이를 검증하는 추론 방식입니다. Nemotron 3 관련 논문은 Multi-token Prediction을 이 방식과 연결된 Ablation 항목으로 다룹니다. 검증이 통과한 토큰을 한 번에 반영하면 생성 단계의 지연을 줄일 수 있습니다.
- KV 캐시(KV Cache)
- — Transformer가 이전 토큰의 Key와 Value를 저장해 다음 토큰 생성 때 같은 계산을 반복하지 않도록 하는 메모리 구조입니다. 문맥이 길어질수록 저장 공간과 메모리 이동 비용이 커져 효율적인 추론의 주요 과제가 됩니다. 글은 긴 문맥을 사용하는 Agent 환경의 확산과 함께 이 문제가 중요해졌다고 연결합니다.
기술
- Transformer
- Mamba-2
- Mamba-3
- Gated DeltaNet
- Gated DeltaNet-2
- NVFP4
- BF16
- Mixture-of-Experts
- Attention
- OpenClaw
- Qwen3.6
- Nemotron 3
활용 사례
- 연구 논문을 주제별로 다시 찾는 참고 목록
- 기사·책·강의·코드 예제 작성에 필요한 논문 검색
- 긴 문맥을 사용하는 Agent Harnesses
- Consumer Hardware에서의 Local Inference
- Speculative Decoding을 활용한 LLM 추론 효율화
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.