Macaron‑V1의 MoL 전문화 구성
텍스트 생성 및 개인 에이전트·코드 작업·Generative UI 출력을 지원한다35B (MoE)262K 컨텍스트MIT
Qwen3.6 MoE 기반에 네 개 LoRA 전문 어댑터를 라우팅하는 Mixture of LoRA 모델
TL;DR
Macaron‑V1‑Tall은 Qwen3.6-35B-A3B MoE 베이스에 네 개의 LoRA 전문 어댑터(L0~L3)를 결합한 Mixture of LoRA 모델로, 요청 단위 L0 라우터가 가장 적합한 어댑터를 선택해 대화·에이전트·코드·GenUI 작업을 처리한다. 베이스는 BF16 체크포인트로 제공되고 LoRA는 별도 파일로 보관되어 어댑터 교체만으로 빠른 실험과 경량 배포가 가능하다. 262K 컨텍스트를 지원하므로 장문 대화와 대규모 코드베이스 분석에 유리하며, Mixture-of-LoRA-Harness로 OpenAI 호환 서빙을 유지할 수 있다.
핵심 역량
- 대화 전문화 능력은 L0 Chat LoRA가 들어와 요청 분류 후 대화 문맥을 이어가며 지침 준수와 사용자 의도 유지에 초점을 둔다. 요청별로 L0가 적합성을 판단하고 이후 계속된 추론은 선택된 LoRA 내에서 수행되어 다른 전문 영역과의 간섭을 줄인다. 이 구조는 대화 중 도구 호출이나 장기 계획이 필요할 때도 일관된 상태를 유지하게 해준다.
- 개인 에이전트와 도구 사용은 L1 Agent LoRA가 담당하며 외부 도구 연동, 긴 호라이즌 계획, 상태 추적 같은 입력→처리→출력 흐름을 LoRA 내부에서 처리하도록 설계되었다. 도구 상호작용은 선택된 LoRA에서 관리되며 완료된 작업은 요약을 통해 다른 전문 LoRA로 전달할 수 있다. 따라서 멀티스텝 도구 워크플로에서 컨텍스트 분리와 전문성 유지가 가능하다.
- 코드 및 리포지토리 작업은 L2 Coding LoRA가 코드 이해·터미널 사용·SWE 작업을 대상으로 특화된 가중치로 동작한다. 로컬 체크아웃이나 리포지토리 스캔 후 코드 생성·수정·단위테스트 제안 같은 출력이 LoRA 내부 동작으로 최적화된다. 이 접근은 베이스 모델을 바꾸지 않고 코드 관련 성능을 개선하는 비용 효율적인 방법을 제공한다.
- Generative UI 생성과 UI4A 출력은 L3 GenUI LoRA가 담당하며 TSX 같은 UI 코드 생성과 미리보기 연동을 목표로 설계되어 있다. Macaron Artifacts와의 통합으로 생성된 UI 결과물을 브라우저에서 렌더링해 확인하는 개발 루프를 지원한다. UI 작업은 별도 어댑터에서 격리되어 UI 특유의 출력 형식과 상호작용 요구를 충족시킨다.
강점
- 모듈식 전문화는 특정 도메인(대화·에이전트·코드·UI)에 맞춘 LoRA를 활성화해 베이스 모델 교체 없이 영역별 성능 향상을 도모한다. 이 방식은 전체 파라미터를 재학습하지 않으므로 업데이트와 실험 주기가 짧다. 운영 환경에서는 전문 어댑터 교체만으로 기능 추가가 가능해 유지보수 비용을 낮춘다.
- 극장문 컨텍스트(262K)의 지원은 장기 대화나 대규모 코드베이스 해석 같은 작업에서 실질적 이점을 제공한다. 긴 문맥을 유지하면서도 LoRA 기반의 경량 전환으로 역할 간 간섭을 줄이도록 설계되어 있다. 이에 따라 리포지토리 전체를 대상으로 하는 코드 리팩토링 제안이나 문서 중심 작업에서 유용하다.
- 배포 효율성은 BF16 베이스와 LoRA 어댑터 분리로 개선되어, 베이스는 한 번 배포하고 여러 어댑터를 라우팅으로 전환하는 방식으로 리소스 사용을 최적화한다. Mixture-of-LoRA-Harness는 OpenAI 호환 인터페이스와 라우터 메타데이터 관리를 제공해 실무적 통합 비용을 낮춘다. 또한 MIT 라이선스는 상업적 통합을 제약 없이 진행할 수 있게 한다.
훈련 방식
모델은 Qwen3.6-35B-A3B MoE 베이스를 유지한 채 Macaron-V1의 전문화 체계를 적용해 사후 어댑터 형태로 네 개의 LoRA를 학습한 방식이다. 학습·후처리 파이프라인에는 MinT와 MindForge가 연계되어 있으며 LoRA는 rank=64로 구성되어 있다. 배포 시에는 BF16 베이스 체크포인트와 라우티드 LoRA를 결합해 실시간 라우팅과 역할별 추론을 가능하게 한다.
알아두면 좋은 것
- 모델은 Qwen3.6-35B-A3B MoE 베이스에 네 개의 LoRA 전문 어댑터를 조합한 Mixture of LoRA 구조로 구축되어 있으며, 요청별로 L0 라우터가 가장 적합한 전문 어댑터를 선택한다. BF16 베이스 체크포인트와 별도 LoRA 파일(loras/L0~L3)이 저장되어 있어 베이스 재사용성과 어댑터 교체가 용이하다. Macaron-V1-Tall은 개인비서·도구연동·코드·Generative UI를 주요 도메인으로 삼는다.
- 라이트웨이트 라우팅 구조는 초기 선택 이후 지속적 추론을 선택된 LoRA에서 진행하도록 설계되어, 역할 전환 비용을 줄이면서도 전문화된 처리를 유지한다. LoRA rank는 64로 설정되어 있으며, MoE 구성은 256 experts와 토큰당 8 experts 활성화라는 하드웨어·추론 패턴을 전제로 한다. 이 구성은 대규모 MoE의 장점을 살리면서 LoRA를 통해 빠른 전환과 경량 업데이트를 허용한다.
- 컨텍스트 길이는 262K로 설정되어 장문 대화, 대규모 코드베이스 분석, 문서 집약 작업에서 이점을 제공하며, Transformers 로드 예제는 trust_remote_code 옵션과 bfloat16 dtype을 권장한다. 자체 호스팅을 원할 경우 Mixture-of-LoRA-Harness를 사용해 라우터 메타데이터와 OpenAI 호환 endpoint를 유지할 수 있다. Macaron Artifacts는 GenUI의 미리보기와 플러그인 통합을 지원한다.
- 배포 방식은 BF16 베이스 체크포인트와 라우티드 LoRA 제공을 전제로 하며, 공개된 기술 스택에는 MinT와 MindForge라는 후처리 시스템이 언급되어 있다. 호스티드 API는 OpenAI 호환 chat-completions 엔드포인트를 제공해 기존 클라이언트와 연동이 쉽다. 라이선스는 MIT로 상업적·개발적 사용에 제약이 적다.
기술적 특징
- 베이스 아키텍처는 Qwen3.6 MoE로, 모델 구성은 40 layers, hidden size 2048, 16 attention heads, 2 KV heads, 총 256 experts이며 토큰당 8 experts를 활성화하도록 설정되어 있다. 이 구성은 MoE의 토큰별 전문가 활성화로 연산 효율을 확보하는 한편 LoRA로 세분화된 전문화를 허용한다. LoRA 어댑터는 rank 64로 학습되어 역할 전환 시 메모리·성능 균형을 맞춘다.
- 런타임 라우팅은 L0 라우터가 입력을 평가해 L0~L3 중 적합한 어댑터를 선택하는 흐름으로 동작하며, 선택된 어댑터 내에서 지속적 추론과 도구 호출이 수행된다. 라우터는 요청 단위로 결정하며, 완료된 작업은 요약을 통해 다른 어댑터와 공유할 수 있어 모듈 간 정보 전달이 가능하다. MoL 서빙 하니스는 이 과정을 OpenAI 호환 엔드포인트로 노출한다.
- 체크포인트 구성은 BF16 베이스 체크포인트와 별도 LoRA 파일 집합으로 이루어져 있어 베이스 재사용과 어댑터 교체가 용이하다. Transformers 예제는 trust_remote_code=True와 device_map="auto"를 권장하며, 실제 호스팅은 Mint 플랫폼을 통해 OpenAI 호환 API를 제공한다. Macaron Artifacts 연동은 GenUI 출력의 미리보기와 플러그인 기반 워크플로를 지원한다.
차별점
- 요청 단위 라우팅으로 여러 LoRA 어댑터를 실시간 전환하는 Mixture of LoRA 설계는 전문성 유지와 경량 업데이트를 동시에 달성한다. 전통적 단일 파인튜닝보다 어댑터 교체만으로 빠른 실험이 가능해 운영·실험 사이클이 단축된다. 라우터가 선택한 어댑터 내부에서 도구 상호작용을 유지함으로써 멀티스텝 워크플로의 상태 일관성이 확보된다.
- 매우 긴 컨텍스트 길이(262K)는 대규모 코드베이스 분석, 문서 중심 에이전트, 장기 대화 보존 등에서 경쟁 우위를 제공한다. 긴 문맥을 처리할 수 있으므로 리포지토리 전체를 대상으로 한 자동 수정을 요구하는 작업에서 실무적 효용이 높다. 이렇게 긴 문맥을 다루면서도 LoRA로 역할을 분리하는 점이 차별점이다.
- GenUI 전용 LoRA와 Macaron Artifacts 연동으로 TSX 기반 UI 생성과 브라우저 미리보기를 통합하는 워크플로를 제공해, UI 코드 생성→렌더→피드백 루프를 짧게 유지한다. 이 통합은 UI 중심 생성 작업을 별도의 전문 어댑터로 격리해 다른 작업군과 충돌 없이 수행하도록 한다. 플러그인은 Claude Code·Codex·Kimi Code 같은 도구와의 연동을 지원한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Macaron-V1 벤치마크 이미지 | 다중 벤치마크 표 | 이미지에 ChatBench, LivingBench, PinchBench, TerminalBench, UI4ABench 등 다수의 벤치마크 결과가 표 형태로 수록되어 있으며 Macaron-V1-Tall 열이 포함되어 있다. | — |
이미지 분석

58
Likes
1k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.