본문으로 건너뛰기

MIT 연구진, 소형 모델 협업으로 고성능 추론을 구현하는 'DisCIPL' 시스템 개발

MIT CSAIL 연구진이 대형 모델의 계획과 소형 모델의 병렬 처리를 결합하여, 고비용 추론 모델 수준의 정확도를 80% 낮은 비용으로 구현하는 DisCIPL 프레임워크를 공개했다.

섹션별 상세

01
DisCIPL(Distributional Constraints by Inference Programming with Language Models)은 '관리자(Boss)' 모델과 '추종자(Follower)' 모델로 구성된 계층적 구조를 채택했다. GPT-4o와 같은 대형 모델이 전체적인 해결 전략을 수립하면, Llama-3.2-1B와 같은 소형 모델들이 병렬로 세부 작업을 수행하여 최종 결과물을 생성한다.
중앙의 관리자 모델이 네 개의 소형 로봇 모델과 노드로 연결되어 작업을 분배하는 다이어그램이다.
DiagramDisCIPL 시스템의 핵심인 '보스-팔로워' 아키텍처를 시각화한 것이다. 대형 모델이 전략을 수립하고 소형 모델들이 병렬로 입력을 처리하여 최종 응답을 구성하는 협업 과정을 보여준다.
02
이 시스템은 2023년 MIT에서 개발한 'LLaMPPL'이라는 추론 프로그래밍 언어를 핵심 도구로 사용한다. LLaMPPL은 모델이 따라야 할 엄격한 규칙을 코드로 인코딩하여 소형 모델들이 오류 없이 작업을 수행하도록 강제하며, 시의 운율이나 특정 단어 위치 지정 같은 세밀한 제어가 가능하다.
03
성능 평가 결과, DisCIPL은 특정 단어 위치를 지정하는 문장 생성 작업에서 o1 수준의 정확도를 기록했으며, 여행 일정 계획 및 예산 관리와 같은 실무 작업에서 GPT-4o를 능가했다. 특히 텍스트 기반 추론 대신 파이썬 코드를 활용한 추론 방식을 통해 추론 길이를 40.1% 단축했다.
04
경제성 측면에서 DisCIPL은 업계 선두인 o1 모델 대비 약 80.2%의 비용 절감 효과를 입증했다. 이는 토큰당 비용이 수천 배 저렴한 소형 모델들을 병렬로 활용하고, 대형 모델의 개입을 최소화한 결과로, 대규모 추론 시스템의 확장성을 크게 높였다.
05
연구진은 이 프레임워크를 향후 수학적 추론 작업으로 확장하고, 사용자의 모호한 선호도까지 반영할 수 있도록 개선할 계획이다. 또한 동일한 모델이 관리자와 추종자 역할을 모두 수행하는 재귀적 접근 방식에 대한 연구도 진행 중이다.
자연어 지원을 받는 코드 생성, 가상 환경 계획, 로봇 제어의 세 가지 활용 사례를 보여주는 이미지이다.
InfographicDisCIPL 프레임워크가 적용될 수 있는 다양한 도메인을 설명한다. 텍스트 생성뿐만 아니라 코드 추론, 물리적 환경에서의 계획 수립 등 복잡한 제약 조건이 필요한 분야에 기술이 활용될 수 있음을 나타낸다.

용어 해설

DisCIPL
Distributional Constraints by Inference Programming with Language Models의 약자로, 대형 모델이 계획을 세우고 다수의 소형 모델이 이를 실행하도록 설계된 협업 추론 프레임워크이다. 복잡한 제약 조건이 있는 작업에서 효율성과 정확도를 동시에 확보하기 위해 개발되었다.
LLaMPPL
언어 모델의 출력을 정밀하게 제어하기 위해 MIT에서 개발한 확률적 프로그래밍 언어이다. 사용자가 원하는 특정 규칙이나 제약 조건을 코드로 인코딩하여 모델이 해당 가이드라인을 엄격히 따르도록 강제하는 역할을 수행한다.
자동 정형화(Auto-formalization)
자연어로 된 문제나 요구사항을 수학적 기호나 프로그래밍 코드로 자동 변환하는 기법이다. 이를 통해 언어 모델의 모호한 추론 과정을 명확한 논리 구조로 바꾸어 정확성과 검증 가능성을 높일 수 있다.
추론 효율성(Inference Efficiency)
AI 모델이 답변을 생성하는 과정에서 소비하는 계산 자원, 시간, 비용의 효율을 의미한다. 모델의 크기가 커질수록 추론 비용이 급증하기 때문에, 적은 자원으로 높은 성능을 내는 기법이 실무 배포에서 매우 중요하다.
병렬 추론(Parallel Inference)
하나의 큰 작업을 여러 개로 나누어 다수의 소형 모델이 동시에 처리하게 하는 방식이다. 순차적 처리보다 속도가 빠르며, 저렴한 소형 모델을 여러 개 활용함으로써 전체적인 운영 비용을 낮출 수 있다.

기술

  • GPT-4o
  • Llama-3.2-1B
  • LLaMPPL
  • Python

활용 사례

  • 예산 제약이 있는 여행 일정 계획
  • 엄격한 글자 수 및 단어 배치가 필요한 텍스트 생성
  • 복잡한 규칙을 따르는 코드 생성 및 검증
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 12. 13.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.