챕터별 상세
LLM의 기초와 파라미터
LLM은 자연어를 통해 임의의 작업을 수행할 수 있는 소프트웨어이다. 모델의 성능과 크기를 결정하는 핵심 요소는 Parameter이며, 이는 입력값에 대해 모델이 출력을 생성하는 방식을 결정하는 숫자들이다. 일반적으로 Parameter 수가 많을수록 모델의 성능이 뛰어나지만 실행 비용이 상승하는 트레이드오프가 존재한다. 학습된 모델을 실제로 사용하는 과정은 Inference라고 부르며, 이는 모델이 다음에 올 단어를 반복적으로 예측하는 과정이다.
프롬프트 엔지니어링과 시스템 메시지
Prompt는 LLM에 전달하는 요청이며, 이를 최적화하여 성능을 높이는 과정을 Prompt Engineering이라 한다. 명확한 지침 제공, 구조화된 텍스트 사용, 예시 제시 등이 주요 기법에 포함된다. 애플리케이션 개발 시에는 개발자가 모델의 역할과 규칙을 정의하는 System Message를 사용한다. 모델은 일반 사용자 메시지보다 System Message에 더 높은 우선순위를 두도록 설계되었다.
토큰과 컨텍스트 관리
모델은 텍스트를 직접 이해하지 못하며 Token이라는 숫자 단위로 변환하여 처리한다. 모델이 한 번에 처리할 수 있는 최대 Token 양을 Context Window라고 하며, 이 범위를 초과하면 이전 정보를 망각하거나 성능이 저하되는 Context Rot 현상이 발생한다. 이를 해결하기 위해 필요한 정보만 선별하여 Context Window를 채우는 과정이 Context Engineering이다. 이는 API 비용 절감과 모델의 정확도 유지에 필수적인 작업이다.
보안 위협과 가드레일
사용자가 교묘한 질문으로 모델의 규칙을 어기게 만드는 행위를 Prompt Injection이라 한다. 이는 시스템 프롬프트 유출이나 민감 데이터 노출, 권한 없는 API 실행 등의 위험을 초래한다. 이를 방지하기 위해 입력과 출력 단계에서 규칙 준수 여부를 검사하는 Guardrails를 적용한다. 또한 모델이 사실이 아닌 정보를 지어내는 Hallucination 현상을 억제하기 위해 프롬프트 개선과 외부 데이터 참조 기법이 사용된다.
RAG와 벡터 검색 아키텍처
RAG는 모델 외부의 최신 데이터를 검색하여 프롬프트에 주입함으로써 답변의 정확도를 높이는 기법이다. 문서를 작은 단위로 나누는 Chunking 과정을 거쳐 의미를 숫자로 표현한 Embedding Vector로 변환한다. 이렇게 변환된 데이터는 Vector Database에 저장되어 키워드가 아닌 의미 기반의 Semantic Search를 가능하게 한다. 키워드 검색과 의미 검색을 결합한 Hybrid Search를 통해 검색 품질을 더욱 개선할 수 있다.
AI 에이전트와 에이전틱 AI
AI Agent는 LLM이 도구(Tool)를 사용하여 스스로 행동을 수행하는 시스템이다. 에이전트의 자율성 수준에 따라 Agentic AI의 스펙트럼이 형성되며, 단순 도구 호출부터 스스로 도구를 생성하는 수준까지 발전하고 있다. 여러 에이전트가 협력하는 Multi-agent System은 복잡한 작업을 분담하여 처리 효율을 높인다. MCP(Model Context Protocol)는 이러한 도구와 컨텍스트를 모델에 연결하는 표준 규격 역할을 한다.
모델 최적화와 연산 비용
Fine-tuning은 특정 용도에 맞게 모델을 추가 학습시키는 과정으로, 때로는 작은 모델(SLM)이 거대 모델보다 특정 작업에서 더 높은 성능을 내기도 한다. SLM은 10B 이하의 파라미터를 가지며 온디바이스 실행이 가능해 비용과 프라이버시 면에서 유리하다. 연산 비용은 학습 시의 Train-time Compute와 사용 시의 Test-time Compute로 나뉜다. 최근 Reasoning Models는 답변 전 사고 과정을 거치는 Test-time Compute를 늘려 추론 능력을 극대화한다.
용어 해설
- 토큰(Token)
- — LLM이 텍스트를 처리하는 기본 단위이다. 단어를 더 작은 하위 단위(subwords)로 쪼개어 숫자로 매핑한 것이며, 모델의 처리 용량과 비용 계산의 기준이 된다.
- 컨텍스트 윈도우(Context Window)
- — LLM이 한 번에 처리할 수 있는 최대 텍스트 양이다. 입력 프롬프트, 이전 대화 기록, 검색된 문서 등이 이 범위 내에 포함되어야 하며 모델마다 그 크기가 다르다.
- 임베딩 벡터(Embedding Vector)
- — 텍스트의 의미를 다차원 공간상의 숫자로 표현한 것이다. 의미가 유사한 텍스트는 공간상에서 가깝게 위치하게 되어 키워드가 일치하지 않아도 의미 기반 검색이 가능해진다.
- 파인튜닝(Fine-tuning)
- — 사전 학습된 모델을 특정 데이터셋으로 추가 학습시켜 특정 용도에 최적화하는 기법이다. 범용 모델을 특정 도메인 지식이나 말투에 맞게 조정할 때 사용한다.
- 추론(Inference)
- — 학습된 모델을 사용하여 새로운 입력에 대한 결과를 생성하는 과정이다. 사용자가 프롬프트를 입력하고 모델이 답변을 내놓는 실제 서비스 단계를 의미한다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 16.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
