본문으로 건너뛰기

오픈 모델 AI 코딩 스택의 계층과 조합법

모델부터 MCP까지 오픈 AI 코딩 스택을 계층별로 조합하는 방법

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

오픈 모델을 활용한 AI 코딩 환경은 모델, 추론 제공업체, Gateway와 Router, Harness, Skills와 MCP라는 독립적인 계층으로 구성되며, 글은 이를 MIGHT Stack으로 묶습니다. 큰 모델은 모호하고 복잡한 작업에서 여러 제약을 추적하는 데 강하고, 작은 모델은 명확하게 범위가 정해진 작업을 더 빠르고 저렴하게 처리하므로 승자를 고르기보다 작업별 도구로 선택해야 합니다. 모델과 공급자를 바꿔도 Harness와 도구를 유지할 수 있고, 새 세션을 자주 시작하거나 계획·구현·검토를 서로 다른 모델에 나누면 문맥 관리와 비용 통제가 쉬워집니다. 최종적으로 오픈 모델의 가치는 단일 AI 코딩 제품을 선택하는 데 있지 않고, 필요에 따라 각 계층을 조합하고 교체하는 자신만의 AI 코딩 스택을 만드는 데 있습니다.

섹션별 상세

01
오픈 모델을 이용한 에이전트형 소프트웨어 개발은 모델을 직접 학습하거나 대규모 GPU 장비를 운영하지 않아도 시작할 수 있습니다. MIGHT Stack은 요청을 해석하는 Model, 모델을 실행하는 Inference, 요청을 분배하는 Gateways와 Routers, 대화를 관리하는 Harness, 작업 지식과 외부 도구를 제공하는 Skills와 MCP로 나뉩니다. 각 계층이 독립적이므로 개발자는 전체 시스템을 다시 만들지 않고 특정 모델이나 공급자만 교체하며 새 조합을 시험할 수 있습니다.
검은 배경의 도식이 Open Model AI Stack을 models, inference, gateways & routers, harness, tools의 다섯 계층으로 나눠 보여줍니다.
Diagram이미지는 MIGHT Stack의 계층 구조를 시각화하며, 상단의 models 아래에 Inference, Gateways와 Routers, Harness, Tools가 순차적으로 배치되어 있습니다. Inference 계층에는 SGLang, vLLM, TRT-LLM, Together AI가, Gateways와 Routers 계층에는 LiteLLM, OpenRouter, AI Gateway가 표시되어 글에서 설명한 모델 실행·라우팅·도구 연동의 분리 구조를 보강합니다.
02
큰 모델은 많은 파라미터와 학습 계산량을 바탕으로 여러 제약이 얽힌 문제와 모호한 요구를 처리하고, 긴 문맥에서 파일·로그·요구사항 사이의 관계를 유지하는 데 유리합니다. 글에서 예로 든 Kimi K3는 총 1.8T 파라미터와 104B 활성 파라미터를 가지며, 인증 시스템 리팩터링이나 Framework 업그레이드처럼 여러 단계의 판단이 필요한 작업에 적합한 모델로 제시됩니다. 반면 큰 모델은 더 느리고 비쌀 수 있으므로 모든 작업에 기본값으로 쓰기보다 복잡도와 모호성이 높은 요청에 배치하는 편이 합리적입니다.
03
작고 빠른 모델은 아키텍처를 추론하거나 숨은 요구사항을 찾아야 하는 부담이 적은 명확한 작업에서 큰 모델에 가까운 결과를 낼 수 있습니다. GLM 5.3 Flash는 총 320B 파라미터와 18B 활성 파라미터를 가지며, 글은 Kimi K3보다 약 6배 작고 약 20배 저렴한 예로 제시합니다. 함수 옵션 추가, 테스트 작성, 특정 오류 설명, 50줄 함수의 버그 검토처럼 입력과 출력 범위가 분명한 작업에 작은 모델을 쓰면 응답 지연과 요청 비용을 함께 낮출 수 있습니다.
04
모델 선택에서는 매주 출시되는 모델을 모두 직접 평가하기보다 The Open Frontier와 Artificial Analysis 같은 Leaderboard를 탐색의 출발점으로 사용할 수 있습니다. 다만 Leaderboard의 단일 점수는 실제 코드베이스에서 반복되는 특정 작업의 성능과 비용, 속도를 모두 반영하지 못하므로, 순위가 조금 낮은 모델도 자신의 업무에 맞으면 직접 시험할 가치가 있습니다. 모델을 고른 뒤에는 Cloud Inference Provider에서 API 요청을 보내고 토큰 단위로 비용을 지불하거나, Gateway를 통해 여러 Provider의 가격과 지연 시간을 비교할 수 있습니다.
05
Gateway와 Router는 서로 다른 Inference Provider를 하나의 API 뒤에 묶어 모델과 백엔드를 요청별로 바꾸게 해줍니다. OpenRouter와 Vercel AI Gateway 같은 Cloud Gateway는 여러 Provider를 통합하고, LiteLLM은 로컬이나 자체 서버에서 여러 계정과 Provider 사이를 연결하는 Router로 활용할 수 있습니다. 같은 모델 버전과 Sampling 설정을 사용하면 Provider가 달라도 기본 동작은 유사하지만, 가격·지연 시간·API 기능은 달라질 수 있으므로 모델과 실행 환경을 분리해 선택할 수 있습니다.
06
Harness는 모델이 직접 파일 시스템을 검색하거나 Shell 명령을 실행하는 구조가 아니라, 모델의 판단을 실제 도구 호출로 바꾸는 중간 애플리케이션입니다. 사용자가 인증 코드의 위치를 묻는 경우 모델이 auth·session·login 검색을 요청하고, Harness가 검색을 실행한 뒤 결과와 관련 파일을 다시 문맥에 넣어 모델이 답을 완성하게 합니다. 따라서 코딩 에이전트의 품질은 모델뿐 아니라 관련 문맥 수집, 도구 노출, 긴 대화 관리, Patch 적용, 변경 사항 표시, 권한 요청, 명령 실패 복구를 담당하는 Harness에도 좌우됩니다.
07
Skills는 특정 작업이나 도구 사용법을 재사용 가능한 지침으로 묶어 필요할 때 Harness가 불러오는 구성요소입니다. MCP는 Model Context Protocol의 약자로, 데이터베이스·API·파일 시스템·개발 도구를 공통 인터페이스로 연결해 각 통합마다 별도 구현을 만들지 않게 합니다. Skills.sh에서 커뮤니티 Skill을 찾고 mcp.so에서 기존 MCP 서버를 찾을 수 있으며, 이 계층을 추가하면 하나의 긴 Prompt에 모든 작업 지식을 넣지 않고 작업별 능력을 조합할 수 있습니다.
08
문맥이 길어지면 모델은 새 요청을 처리할 때 이전 Prompt, 응답, 첨부 파일, Shell 출력, 검색 결과, Tool Call과 실패한 접근법까지 함께 고려해야 합니다. 글은 한 작업을 끝낸 뒤 새 Session을 시작하고, 접근법을 바꾸거나 모델을 교체할 때도 새 대화를 여는 방식을 권장합니다. 계획에는 큰 모델, 개별 구현에는 작은 모델, 최종 검토에는 다시 큰 모델을 배치하고 구현 작업마다 새 Session을 만들면 각 모델이 불필요한 가정과 오래된 결과에 끌려가는 현상을 줄일 수 있습니다.
09
오픈 모델 스택의 핵심은 특정 회사의 제품 전체를 채택하는 대신 작업별로 모델, 가격과 성능에 맞는 Provider 또는 Gateway, 사용 방식에 맞는 Harness, 필요한 Skills와 Tools를 조합하는 데 있습니다. 글의 예시 조합은 OpenCode를 Harness로 쓰고 GLM 5.3 Flash를 Together AI에서 실행하며, UI 구축용 Skill과 Playwright MCP를 추가하는 구성입니다. 각 요소가 같은 회사에서 나올 필요가 없고 Ollama 같은 도구로 자신의 환경에서 모델을 실행할 수도 있으므로, 새 모델이 나와도 기존 작업 방식과 도구를 유지한 채 지능 계층만 교체할 수 있습니다.

용어 해설

Mixture-of-Expert
Mixture-of-Expert는 하나의 대형 모델 안에 여러 전문화된 Expert를 두고, 토큰을 생성할 때마다 일부 Expert만 활성화하는 구조입니다. 전체 파라미터 수는 크게 유지하면서 실제 계산량을 줄여 추론 비용과 요구 컴퓨팅 자원을 낮추는 데 쓰입니다.
추론 제공업체(Inference Provider)
Inference Provider는 모델을 GPU에서 실행하고 API를 통해 입력과 출력을 주고받게 하는 서비스입니다. 사용자는 모델을 직접 배포하지 않고 토큰 단위로 비용을 지불하며, 여러 모델을 빠르게 시험할 수 있습니다.
Gateway 및 Router(Gateway and Router)
Gateway와 Router는 여러 Inference Provider와 모델을 하나의 API 뒤에 연결하는 계층입니다. 요청별로 모델과 백엔드를 선택하고 가격, 지연 시간, 성능을 비교할 수 있어 애플리케이션 코드를 크게 바꾸지 않고 공급자를 교체하게 해줍니다.
Harness
Harness는 사용자와 코드베이스, 모델 사이에서 대화를 유지하고 도구 실행을 중개하는 애플리케이션입니다. 모델이 검색이나 파일 읽기, 명령 실행을 요청하면 Harness가 실제 환경에서 작업을 수행하고 그 결과를 다시 모델의 문맥에 넣습니다.
Model Context Protocol
Model Context Protocol은 AI 에이전트가 데이터와 외부 도구에 공통 인터페이스로 연결되도록 하는 표준입니다. MCP 서버를 사용하면 Harness가 데이터베이스, API, 파일 시스템, 개발 도구와 통신할 때 각각 별도의 맞춤 통합을 만들 필요가 줄어듭니다.

기술

  • MIGHT Stack
  • Kimi K3
  • GLM 5.3 Flash
  • DeepSeek V4 Flash
  • MiniMax M3
  • The Open Frontier
  • Artificial Analysis
  • Together AI
  • OpenRouter
  • Vercel AI Gateway
  • LiteLLM
  • Claude Code
  • Codex
  • TogetherLink
  • PI
  • OpenCode
  • Amp
  • Skills
  • MCP
  • Model Context Protocol
  • skills.sh
  • mcp.so
  • Playwright MCP
  • Ollama

활용 사례

  • 기존 인증 시스템 리팩터링
  • 코드베이스의 Framework 업그레이드
  • Pull Request 검토
  • SQL 데이터베이스 성능 저하 원인 파악
  • 함수에 옵션 추가
  • 파일 단위 테스트 작성
  • 특정 오류 설명
  • 함수의 버그 검토
  • API 이름 변경과 호출자 수정
  • 브라우저 자동화를 포함한 UI 구축

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.