51.7M 경량 인프라 라우터, 엣지-클라우드 프롬프트 라우팅 모델
51.7M 파라미터 경량 라우터가 입력 프롬프트의 특성을 계산해 결정적 Route 토큰으로 엣지 또는 클라우드 모델로 라우팅한다.
TL;DR
이 모델은 SupraLabs가 Supra-1.5-50M-Base-exp를 기반으로 992 샘플로 미세조정한 51.7M 파라미터 경량 라우터로서 엣지 중심 인프라에서 프롬프트를 로컬 처리 또는 클라우드 오프로드로 결정하도록 설계되었다. 입력은 'Task: [Prompt] Analysis: ' 형식으로 포맷되며 모델은 도메인, 복잡도, 수학/코드 포함 여부를 멀티태스크 시퀀스로 산출한 뒤 결정적 Route 토큰을 반환해 상위 오케스트레이터가 간단히 파싱해 조치를 취할 수 있다. 학습은 bfloat16으로 5 에폭 동안 수행되었고 에폭 3에서 eval_loss 0.1342로 최적점을 기록해 그 시점의 체크포인트를 채택했으며 이로 인해 과적합 위험을 낮추는 운영적 장치가 마련되었다. 엣지 최적화와 결정적 출력 덕분에 낮은 지연으로 라우팅을 수행할 수 있으나 훈련 샘플 수가 992로 제한적이라는 점과 품질·회복력 관련 주장은 문서상 정성적 근거가 주로 제시되어 추가 검증이 필요하다.
핵심 역량
- 프롬프트의 의미적 도메인과 구조적 복잡도를 자동으로 식별해 라우팅 결정을 생성할 수 있다. 모델은 멀티태스크 시퀀스 출력을 통해 여러 플래그를 동시에 산출하므로 상위 시스템이 간단한 파싱으로 라우팅 정책을 적용할 수 있다. 이 과정은 로컬에서 처리 가능한 요청을 분리해 엣지 처리 비율을 높이는 데 유리하다.
- 프롬프트 텔레메트리 문자열을 결정적 형태로 출력해 후단 시스템의 일관된 처리 파이프라인 입력으로 사용될 수 있다. 출력 스키마는 'Domain | Complexity | Math | Code | Route | Justification' 형식을 따르며 파싱과 규칙 기반 오버라이드가 병행 가능하다. 결정적 생성은 운영 환경에서 재현성 있는 오프로드 정책 적용을 용이하게 한다.
- 저자원 환경에서 빠른 응답을 목표로 설계되어 엣지 장치와의 연동이 가능하다. 모델은 51.7M 파라미터 규모로 bfloat16 활용과 3840 토큰 시퀀스 최적화를 통해 낮은 CPU/GPU 오버헤드로 동작한다. 이로 인해 대기시간이 짧은 라우팅 결정을 실시간으로 제공할 수 있다.
- 모델은 키워드 일치가 아닌 의미 기반 판별을 통해 키워드 트랩과 같은 공격을 회피하도록 설계됐다. 훈련 데이터와 멀티태스크 시퀀스 구조는 토큰 단위 매칭 대신 문장 구조와 의미적 특성에 기반한 라우팅을 유도한다. 이로 인해 창작 텍스트와 코드·수학 구문을 구분하는 데 안정성이 확보됐다.
강점
- 매우 작은 파라미터 수(51.7M)로도 라우팅 의사결정을 수행하도록 설계되어 엣지 환경에서의 배포 비용과 리소스 요구가 낮다. bfloat16과 3840 토큰 최적화를 통해 긴 컨텍스트 처리와 저지연 응답을 동시에 달성하도록 균형을 맞췄다. 이러한 조합은 엣지-퍼스트 아키텍처에서 라우터를 경량 방화벽 역할로 배치할 때 유리하다.
- 입력 포맷과 멀티태스크 시퀀스 아키텍처는 결정적 출력을 유도해 운영 환경에서의 예측 가능성과 재현성을 높였다. greedy decoding 권장과 구조화된 출력 스키마는 후단 오케스트레이터의 규칙 기반 오버라이드와 결합하기 쉽다. 결과적으로 운영적 안정성과 정책 적용의 신뢰성이 확보된다.
훈련 방식
기본적으로 Supra-1.5-50M-Base-exp를 기반으로 한 미세조정 방식이 사용되었으며 SupraLabs/Prompt-Routing-Dataset(992 샘플)으로 5 에폭 동안 학습했다. 학습은 bfloat16 정밀도로 수행되어 메모리 효율성과 실행 속도를 고려한 설정이 적용되었다. 검증 손실이 에폭 3에서 최적점(0.1342)을 기록해 그 시점의 체크포인트를 채택하고 이후 상태는 자동으로 리와인드해 과적합을 억제했다.
알아두면 좋은 것
- 모델은 51.7M 파라미터의 소형 LLM으로 SupraLabs/Prompt-Routing-Dataset(992 샘플)으로 5 에폭 동안 미세조정되었다. 학습 중 평가 손실은 에폭 3에서 정점(0.1342)을 기록했고 해당 시점의 체크포인트가 최종 모델로 선택되며 late-stage 과적합을 방지하기 위해 자동 리와인드가 적용되었다. 훈련과 추론 모두 bfloat16 정밀도를 사용해 메모리 및 연산 효율을 확보했다.
- 추론 시 입력은 훈련에서 사용한 구조적 프레이밍 토큰('Task: [Prompt] Analysis: ')을 따르도록 요구된다. 출력은 파이프 구분 문자열로 정해진 텔레메트리 스키마를 반환하며 greedy decoding(do_sample=False)을 권장해 결정적 결과를 유지한다. 이 입력·출력 규약은 상위 오케스트레이터와의 연동을 단순화하고 라우팅 정책의 재현성을 보장한다.
- 엣지 중심의 운영을 위해 시퀀스 처리 길이 3840 토큰이 최적화되어 있고 문서상으로는 서브밀리초 수준의 생성 속도를 목표로 단언하고 있다. 이러한 최적화는 로컬 SLM과의 빠른 상호작용을 가능하게 해 오프로드 빈도를 줄이는 설계적 이점을 제공한다. 다만 성능 관련 수치는 내부 엣지 검증을 바탕으로 한 정성적·정량적 조합으로 표기되어 있다.
기술적 특징
- 멀티태스크 시퀀스 생성은 모델이 최종 Route 토큰을 출력하기 전에 도메인, 복잡도, Math/Code 여부 같은 보조 출력을 순차적으로 계산하도록 강제하는 설계다. 이 방식은 내부 표현의 활성화 맵을 유도해 소형 모델에서 흔히 발생하는 국소적 가중치 붕괴를 완화하는 효과를 갖는다. 따라서 라우팅 경계가 더 안정적이고 일관된 특성을 보인다.
- 훈련 과정에서 구조적 프레이밍 토큰('Task: ... Analysis: ')을 사용해 attention 정렬을 제어하고 출력 스키마의 일관성을 확보했다. 프레이밍은 모델이 초기 시퀀스에서 분석적 특성을 먼저 생성하도록 유도해 후속 라우팅 판단의 근거를 내부적으로 형성한다. 이 설계는 의미 기반 분류 성향을 강화해 키워드 트랩에 대한 회피 능력을 지원한다.
- 체크포인트 선택은 검증 손실의 정점(에폭 3, eval_loss 0.1342)을 기준으로 자동 리와인드를 적용해 late-stage memorization을 방지했다. 이 절차는 소량 데이터(992 샘플)로 미세조정할 때 과적합 위험을 낮추기 위한 운영적 조치다. 결과적으로 최종 모델은 일반화 기반의 성능 포인트에서 저장되었다.
- 추론 관점에서는 bfloat16 정밀도와 3840 토큰 시퀀스 최적화가 결합되어 서브밀리초 수준의 생성 목표를 달성하도록 구성됐다. 또한 do_sample=False로 greedy decoding을 권장해 결정적 출력을 유지함으로써 오케스트레이션 파이프라인의 일관성을 확보했다. 이러한 세팅은 엣지 장치에서의 낮은 지연과 예측 가능한 라우팅 동작에 기여한다.
차별점
- 본 모델은 단순 이진 분류기가 아니라 멀티태스크 시퀀스 생성을 통해 입력의 여러 특성을 순차적으로 산출하고 마지막에 라우트 토큰을 출력하는 구조를 채택했다. 이로 인해 의미적·구조적 특징을 내부적으로 활성화해 라우팅 결정을 내리므로 키워드 기반 규칙보다 더 세밀한 판단이 가능하다. 결과적으로 소형 모델이지만 라우팅 경계의 안정성을 확보할 수 있었다.
- 51.7M 파라미터라는 초경량화된 설계를 엣지 오케스트레이션 목적에 맞춰 최적화했다는 점이 차별화 요소다. bfloat16과 긴 시퀀스 최적화로 낮은 하드웨어 오버헤드를 유지하면서도 3840 토큰을 처리할 수 있도록 균형을 맞췄다. 이 설계는 엣지-클라우드 하이브리드 환경에서 라우터를 로컬 방화벽 겸 트래픽 제어기로 배치하는 데 적합하다.
- 학습 과정에서 검증 손실의 최적점을 기준으로 자동 리와인드를 적용해 late-stage 과적합을 회피한 운영 절차가 포함되어 있다. 소량 데이터(992 샘플)에 대해 에폭 3에서의 체크포인트 선택을 통해 일반화 성능을 우선시했다는 점이 운영 관점의 차별점이다. 이러한 체크포인트 정책은 라우터의 안전 경계와 일관성 확보에 기여한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| eval_loss | loss | 0.1342 | — |
128
Likes
2.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.