TL;DR
소형 언어 모델(SLM)은 제한된 하드웨어 환경에서 온디바이스 추론을 가능하게 하여 프라이버시와 응답 지연 측면에서 장점을 제공한다. 이 연구는 RAG 파이프라인에서 생성기 역할을 SLM으로 대체했을 때의 실제 품질과 지연을 수치로 확인하여 현장 배포 가능성을 검증했다. 결과는 일부 SLM이 GPU 없이도 실용적 수준의 정확도와 신뢰도를 달성했음을 시사한다.
왜 중요한가
소형 언어 모델(SLM)은 제한된 하드웨어 환경에서 온디바이스 추론을 가능하게 하여 프라이버시와 응답 지연 측면에서 장점을 제공한다. 이 연구는 RAG 파이프라인에서 생성기 역할을 SLM으로 대체했을 때의 실제 품질과 지연을 수치로 확인하여 현장 배포 가능성을 검증했다. 결과는 일부 SLM이 GPU 없이도 실용적 수준의 정확도와 신뢰도를 달성했음을 시사한다.
핵심 기여
러시아어 RAG 평가용 벤치마크 구축
논문은 공개 데이터와 하나의 독점 데이터를 결합하여 러시아어 질문응답 중심의 RAG 평가용 벤치마크를 구성했다. 각 데이터셋에서 임의로 100샘플씩 추출하여 총 500샘플 크기의 평가셋을 만들었고, 질문 유형별로 Factoid, Reasoning, Evidence-based 등으로 분류하여 성능 분석의 다양성을 확보했다. 샘플 길이 분포와 데이터셋 간 유사도(코사인 유사도 0.06~0.12) 등의 통계치를 제시하여 데이터의 이질성과 난이도를 정량화했다.
CPU 환경에서의 SLM 생성 성능 체계적 벤치마킹
연구진은 GGUF 호환성과 16GB RAM 내 추론 가능성 조건을 만족하는 후보 모델 17개를 선정하여 CPU 전용 환경에서 RAG 생성 품질과 지연을 측정했다. 주요 지표로 Correctness·Answer Relevance·Faithfulness를 사용했고, Qwen3-4B-Instruct-2507-Q5KM이 Correct 0.71, AnswerRelevance 0.89, Faithfulness 0.80을 보여 실무적 균형이 우수한 모델로 선택되었다. 모델별 평균 응답 시간과 언어 분포 분석을 함께 제공하여 배포 결정에 필요한 실무 정보를 포함했다.
LLM-as-a-Judge 선별과 다중 심사자 평가 파이프라인 확립
생성 결과 평가는 여러 후보 LLM 평가자를 먼저 검증하는 단계로 구성되었고, F1·Average Bad Score·상관계수 등을 이용해 신뢰성이 높은 평가자를 선택했다. 최종적으로 GPT-5-mini, Qwen3-8B, GLM-4.7를 선정했고 이들로 구성된 다중 심사자 시스템의 ICC는 0.96으로 일관성이 높게 나타났다. 이렇게 선별된 평가자들을 통해 생성 모델의 품질 지표를 안정적으로 측정했다.
핵심 아이디어 이해하기
대형 언어 모델(LLM)은 풍부한 내재 지식을 통해 높은 생성 품질을 달성하지만, 추론 단계에서 요구하는 컴퓨팅 자원과 메모리 요구량이 크기 때문에 온디바이스 배포에는 제약이 존재한다. 특히 생성 단계에서는 모델 크기가 응답 품질과 직접적으로 연관되지만, 모든 응용에서 대형 모델을 운용할 수 있는 하드웨어가 확보되는 것은 아니다. 이로 인해 현장 환경이나 프라이버시가 중요한 설정에서는 소형 언어 모델(SLM)에 의해 생성이 이루어져야 할 필요성이 증가했다.
본 연구는 RAG 구조에서 '검색'과 '생성'을 분리한 특성을 활용하여 생성기를 SLM으로 대체하는 접근을 채택했다. 먼저 외부 지식 베이스에서 관련 문서를 검색한 뒤, 검색된 문맥과 쿼리를 SLM에 입력하여 답변을 생성한다. 이 과정은 모델이 내재적 지식만으로 응답을 만들지 않게 하여 작은 모델로도 문장 수준의 사실성·근거성을 확보할 수 있도록 한다.
이 접근은 두 축에서 이점을 제공한다. 첫째, SLM은 GPU 없이도 CPU 상에서 실행 가능하도록 양자화와 GGUF 호환성 같은 구현적 조건을 만족시키면 현장 배포가 가능하다. 둘째, 평가 결과는 문맥 제공 여부가 생성 정확도에 큰 영향을 미친다는 점을 보여주었다; GPT-5-mini의 경우 Context 모드와 No-context 모드 사이 성능 차이가 컸고, 이는 RAG 파이프라인에서 검색 품질과 문맥 투입 방식이 작은 생성 모델의 성능 한계를 보완하는 핵심 요소임을 의미한다.
방법론
전체 접근은 데이터 구성·심사자 선별·모델 벤치마킹의 세 단계로 구성되었다. 데이터 구성 단계에서는 DaNetQA, SberQuAD, RuRAG Test, Grounded-RAG-QA-RU 등 공개 데이터에 하나의 독점 데이터셋을 더해 5개 데이터 소스에서 각각 100샘플씩 무작위 추출하여 총 500샘플 평가셋을 만들었다. 질문은 Qwen3-8B로 분류하여 Factoid, Reasoning, Evidence-based 등 유형을 지정했고, 평균 질문 길이 8.72 토큰, 평균 정답 길이 41.62 토큰 등 기본 통계를 산출했다.
심사자 선별 단계에서는 LLM-as-a-Judge 평가셋을 별도로 구축하여 올바른 응답과 인위적 오류 응답을 결합한 음성·양성 샘플로 평가자 모델들의 F1·Average Bad Score·Pearson 상관계수를 계산했다. 점수는 연속값 [0,1]로 산출되며 임계값 0.5로 이진화해 F1을 계산했고, 여러 지표를 복합 고려하여 최종 평가자 세 모델을 선택했다. 선택된 심사자들의 일치도를 ICC(0.96)로 확인하여 다중 심사자 합산의 신뢰성을 확보했다.
모델 벤치마킹 단계에서는 GGUF 지원, 오픈소스 여부, 16GB RAM 내 실행 가능성, CPU 전용 추론 가능성 등의 조건으로 후보 모델 17개를 선정했다. 각 모델은 Context 모드(검색 결과와 함께)로 평가되었고, GPT-5-mini는 비교를 위해 No-context 모드도 추가로 실행되었다. 평가는 Correctness·Answer Relevance·Faithfulness를 연속점수로 산출하고, 모델별 평균 응답 지연(초)을 측정하여 품질과 지연의 트레이드오프를 정량화했다.
주요 결과
주요 벤치마크 결과에서는 일부 SLM이 실무적으로 의미 있는 정확도와 근거성 수치를 보였다. Qwen3-4B-Instruct-2507-Q5KM은 Correctness 0.71, Answer Relevance 0.89, Faithfulness 0.80을 기록하여 품질·지연 회귀에서 균형이 우수한 모델로 선정되었다. 비교 기준으로 제시된 GPT-5-mini의 Context 모드 Correctness는 0.73으로, 최상위 LLM과 일부 SLM 간 성능 차이가 크지 않음을 보여주었다.
지연 측면에서는 모델별 편차가 크게 관찰되었고, 예컨대 Qwen3-4B-Instruct-2507-Q5KM의 평균 지연은 70.9초로 보고되었으며 소형 모델 중에서는 수십 초 수준에서 운영 가능한 경우가 있었다. 또한 Context 제공 여부가 성능에 큰 영향을 미쳤고, GPT-5-mini의 No-context 모드에서는 Correctness가 크게 하락하여 문맥 의존성이 강한 데이터셋 특성이 드러났다.
평가 파이프라인의 신뢰성 검증 결과로는 심사자 선별 단계에서 F1과 Average Bad Score를 기준으로 우수한 평가자들을 선택했고, 최종 다중 심사자 세트의 ICC가 0.96으로 높은 일관성을 보였다. 이 수치는 LLM-as-a-Judge 방식이 본 실험 구성에서는 안정적으로 작동했음을 나타낸다.
관련 Figure

이 도표는 일부 모델이 입력 언어(Russian)에 비해 영어 또는 혼합 언어로 응답을 생성하는 경향을 보였음을 시각적으로 확인시킨다. 문맥이 제공된 상태에서도 모델별로 출력 언어 선호도가 달라 결과의 언어적 일관성에 영향을 미친다는 점이 드러난다. 따라서 실제 온디바이스 배포 시에는 출력 언어 제어(프롬프트 설계나 포스트프로세싱)가 품질 관리의 중요한 요소임이 시사된다.
평가 대상 모델들이 생성한 응답의 문자(스크립트) 분포를 모델별로 비교한 막대형 차트이다.
기술 상세
전체 평가 파이프라인은 검색 모듈과 생성 모듈을 분리한 RAG 구조를 기반으로 설계되었다. 검색 단계는 외부 지식베이스에서 관련 문서를 반환하고, 생성 단계는 반환된 문맥과 쿼리를 함께 입력으로 받아 답변을 생성하는 방식이다. 논문에서는 문서 전처리·인덱싱·임베딩 전략 세부사항은 간략히 언급하였으나 생성 부분의 CPU 전용 실행 조건과 모델 파일 포맷(GGUF) 호환성에 중점을 두었다.
심사자 성능 평가를 위한 수리적 정의로는 F1 점수를 위해 연속 심사자 점수를 임계값 0.5로 이진화하여 정밀도와 재현율의 조화평균을 사용했고, Average Bad Score는 명백히 틀린 샘플(B)에 대해 모든 평가 메트릭(M)에 대한 평균 점수를 계산하는 방식으로 정의되었다. 또한 각 심사자 점수와 합의점수 간의 상관을 Pearson 계수로 측정하여 심사자 간 일관성을 정량화했다. 최종적으로 선택된 심사자 조합의 ICC는 0.96으로 보고되었다.
데이터 구성과 통계에서는 각 데이터셋에서 100샘플씩 무작위 추출하여 총 500샘플을 구성했고, 평균 질문 길이 8.72 토큰, 평균 정답 길이 41.62 토큰을 기록했다. 데이터셋 간 pairwise 코사인 유사도는 0.06~0.12로 이질성이 높았고, 질문 난이도는 Qwen3-8B로 평가한 평균 4.94 스케일 결과를 사용했다. 모델 선별 기준은 오픈소스 여부, GGUF 지원, 16GB RAM 내 실행 가능성, CPU 전용 추론 가능성으로 설정되어 현장 운용성에 초점을 맞추었다.
한계점
논문은 생성 단계에서의 SLM 성능에만 초점을 두어 임베딩 기법이나 랭킹 전략의 최적화는 고려하지 않았다. 모든 모델에 대해 동일한 프롬프트를 사용했기 때문에 모델별로 최적화된 프롬프트를 적용하면 성능이 달라질 가능성이 있다. 실험은 러시아어 데이터셋에 한정되어 있어 다른 언어로의 일반화 가능성은 추가 검증이 필요하다. 또한 평가에 포함된 독점 데이터는 공개 불가로 인해 완전한 재현성이 제한될 수 있다.
실무 활용
이 연구는 SLM을 RAG 파이프라인의 생성기로 운용할 때 CPU 온디바이스 배포가 실무적으로 가능한지를 실증했다. 벤치마크와 코드 저장소를 공개하여 실제 환경에서 모델 교체·지연 측정·언어 분포 확인을 반복 테스트할 수 있는 근거를 제공한다. 구현 조건(GGUF 호환성, 16GB RAM 내 실행)은 현장 배포 결정을 단순화하는 실무적 기준으로 활용될 수 있다.
- 프라이버시 제약이 있는 환경에서의 문서 기반 질의응답 서비스 구축
- 오프라인 또는 저대역 환경에서 동작하는 도메인 특화 챗봇의 온디바이스 배포
- 대규모 모델을 쓸 수 없는 엣지 장치에서의 주제별 문서 검색 후 응답 생성
- 교육·강연 자료 등의 대량 문서 집합을 로컬에서 질의응답용 지식베이스로 운영
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- RAG
- — Retrieval-Augmented Generation은 외부 문서에서 관련 정보를 검색하고 그 결과를 생성 모델 입력으로 제공하여 사실성 있는 응답을 생성하는 방식이다. 쿼리에 대해 문서 집합을 먼저 검색한 뒤, 검색된 문맥과 쿼리를 함께 모델에 입력하여 답변을 생성한다. 이 접근법은 모델의 내재적 지식 의존도를 낮추고 최신 또는 도메인 특화 지식을 활용할 수 있게 한다.
- LLM-as-a-Judge
- — LLM-as-a-Judge는 강력한 LLM을 자동 평가자로 활용하여 생성 결과의 정확성·일관성·근거성 등을 연속 점수로 매기는 방법이다. 평가자는 생성된 답변과 기준 문맥을 입력으로 받아 여러 기준에 대해 점수를 산출하고, 이 점수는 F1·상관계수 등 통계적으로 검증된다. 인간 평가 대비 확장 가능성이 높고 신속한 비교 시스템 구축에 적합하다.
- GGUF
- — GGUF는 경량 모델 배포를 위해 사용되는 모델 파일 포맷으로, 로컬 CPU 환경에서 모델 로딩과 추론을 단순화하기 위해 설계된 형식이다. 본 논문은 GGUF 호환성 기준을 모델 선별 조건에 포함하여 16GB RAM 환경에서의 로컬 추론 가능성을 보장했다. 이러한 포맷은 온디바이스 배포에서 메모리 사용과 호환성 관리에 실용적인 이점을 제공한다.
- Quantization
- — Quantization은 모델의 가중치와 연산을 낮은 비트 정밀도로 표현하여 메모리 사용량과 연산 비용을 줄이는 기법이다. 예컨대 float32 대신 int8 또는 int4로 표현하면 추론 시간과 메모리 요구량이 크게 감소하며, 소형 장치에서 대형 모델을 운용할 수 있게 한다. 본 연구 문맥에서는 CPU 온디바이스 추론 성능 확보를 위해 양자화가 평가 및 배포 단계에서 주요한 최적화 수단으로 작용한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.