본문으로 건너뛰기
LG AI Research조회 5

EXAONE 탑재 LG유플러스 익시오의 온디바이스 에이전틱 AI 고도화 프로젝트

EXAONE 4.0 1.2B 경량 모델을 온디바이스로 탑재하고 합성 데이터와 검증·재생성 파이프라인을 적용해 통화분석 평균 80점을 달성했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

LG AI연구원과 LG유플러스는 EXAONE 4.0 1.2B 경량 모델을 스마트폰 단말에 탑재하여 익시오의 통화분석과 AI 전화 대신 받기 기능을 온디바이스로 전환했으며, 합성 데이터 생성과 Teacher 기반 라벨의 Verification & Regeneration 파이프라인을 통해 학습 데이터를 현실적 통화 입력 특성에 맞게 확보했다. 처리 흐름은 STT로 변환된 노이즈가 포함된 통화 텍스트를 바탕으로 Teacher가 라벨을 생성하고 검증·재생성해 Student(EXAONE)에 멀티태스크로 학습시킨 뒤 단말에서 요약·키워드·후속조치 추천과 실시간 응답을 산출하는 방식이다. 실험에서는 EXAONE(합성데이터 적용)이 통화분석 평균 80.0점을 기록해 Gemini 2.0 Flash 대비 22.6점 높은 성능을 보였고, AI 전화 대신 받기에서는 Intent Accuracy와 Slot EM 등 정량 지표가 큰 폭으로 개선되어 온디바이스 경량 모델로도 서비스 수준의 품질 확보가 가능함이 확인되었다. 앞으로는 응대 자연스러움 개선과 단말 자원 최적화, 다양한 실제 환경에서의 지속 검증이 남은 과제로 제시된다.

빠른 이해

새로운 점

경량 1.2B 온디바이스 모델에 합성 데이터와 검증·재생성 파이프라인을 결합해 클라우드 기반 모델 대비 통화분석 성능을 크게 끌어올린 점

핵심 메커니즘

입력으로는 STT로 변환된 통화 텍스트와 대화 히스토리가 들어오고, 처리 단계에서는 합성 데이터 생성(기본 대화→발화 다양화→엔티티 치환)과 Teacher Model의 자동 라벨 생성 뒤 Verification & Regeneration으로 라벨 품질을 보정한 결과를 Student인 EXAONE 1.2B에 멀티태스크로 학습시킨 후 온디바이스에서 추론을 수행하며, 출력으로 통화 요약·키워드·엔티티·후속 조치 추천과 실시간 대화 응답을 생성한다.

핵심 수치

  • 통화분석 평균 점수 (EXAONE 4.0 w synthetic): 80.0- LLM-as-a-Judge(GPT-5.2) 기반 태스크 평균 점수
  • 통화분석 평균 점수 (Gemini 2.0 Flash): 57.4- 비교용 클라우드 모델
  • 통화분석 성능 격차: +22.6- EXAONE(w synthetic) - Gemini 2.0 Flash
  • AI 전화 대신 받기 Intent Accuracy 변화: 67.0 → 100.0- 합성 데이터 적용 전·후 비교
  • AI 전화 대신 받기 Slot Exact Match 변화: 30.51 → 73.40- 합성 데이터 적용 전·후 비교
  • AI 전화 대신 받기 Utterance (ROUGE-1): 38.40 → 81.06- 합성 데이터 적용 전·후 비교

섹션별 상세

프로젝트 개요와 목표

LG AI연구원과 LG유플러스는 EXAONE 4.0 1.2B 경량 모델을 스마트폰 단말에 탑재해 익시오(ixi-O)의 통화 관련 AI 서비스를 온디바이스로 전환하는 과제를 수행했다. 목표는 클라우드 의존도를 낮추어 개인정보를 단말 내에서 처리하고 응답 지연을 줄이며 운영비용을 절감하는 것이었으며 이를 위해 통화분석과 AI 전화 대신 받기 기능을 핵심 태스크로 정의했다. 프로젝트는 모델링·데이터 엔지니어링과 단말 최적화·서빙을 각 사가 분담하여 실서비스 제약을 고려한 멀티태스크 학습과 배포 전략을 동시에 추진했다.

EXAONE 4.0 1.2B 모델 선택 근거

온디바이스 적용을 위해 EXAONE 4.0 1.2B 경량 모델을 베이스로 선택했으며 이 모델은 스마트폰 환경에서 서빙 가능한 모델 크기와 65K 토큰 수준의 긴 컨텍스트 처리 능력을 갖추고 있다. 선택 시 고려한 기술적 요인은 한국어 이해·지시 이행 성능과 긴 컨텍스트에서의 STT 기반 통화 스크립트 처리 능력, 그리고 멀티태스크 학습으로 메모리와 유지보수를 최소화하려는 운영 요구였다. 이러한 설계는 단일 모델로 통화 요약, 키워드·엔티티 추출, 후속 조치 추천, 실시간 대화 응답을 모두 제공하려는 목표와 직접 연관된다.

AI 통화분석 파이프라인과 데이터 전략

통화분석 태스크는 STT로 변환된 노이즈가 포함된 대화 스크립트에서 요약·키워드·엔티티·후속조치 추천을 생성해야 하며 이를 위해 합성 데이터 생성과 Teacher→Verification→Regeneration→Student 학습 흐름을 설계했다. 합성 데이터 생성은 Base Dialogue Generation, Utterance Diversification, Entity Replacement의 세 단계로 실제 통화에서 발생할 STT 오인식·문장 단절·발화 중복 등을 모사하여 데이터 커버리지를 확장했다. Teacher Model이 생성한 라벨은 원문 충실성·형식 준수·정보 일관성 관점에서 검증하고 오류가 있는 항목만 재생성하여 라벨 신뢰도를 높인 뒤 EXAONE 학습에 투입함으로써 실제 통화 특성에 강건한 성능을 확보했다.

AI 전화 대신 받기 설계와 합성 데이터 생성 방식

AI 전화 대신 받기 기능은 Task-oriented Dialogue로 재정의되어 각 턴에서 Intent·Slot·Belief State를 갱신하고 다음 시스템 발화를 생성하는 구조로 학습 데이터를 설계했다. 대화 정책은 Flowchart를 FSM(Finite State Machine)으로 추상화하여 가능한 전이 경로를 전개하고, Machine-to-Machine 시뮬레이션에서 User Simulator와 System Simulator가 턴 단위로 주고받는 발화를 기록해 라벨이 포함된 학습 인스턴스를 자동 생성했다. 이 방식은 예외적 흐름과 다양한 발화 패턴을 포함하여 Intent 분류와 슬롯 추출, 상태 추적을 안정적으로 학습시키는 데 기여했다.

평가 설계와 실험 결과

평가는 LLM-as-a-Judge 방법으로 GPT-5.2를 Judge로 사용하여 태스크별 루브릭에 따라 0~5점 척도로 점수를 환산했고, 자동 지표와 인간 평가를 병행하여 모델 품질을 검증했다. 통화분석 전체 평균에서 EXAONE 4.0(w synthetic)은 80.0점을 기록하여 Gemini 2.0 Flash 대비 22.6점 높은 성능을 보였고 요약·키워드·후속 태스크에서 특히 큰 개선이 나타났다. AI 전화 대신 받기 태스크에서는 합성 데이터 적용 시 Intent Accuracy가 67.0에서 100.0으로, Slot Exact Match가 30.51에서 73.40으로 개선되는 등 정량 지표에서 뚜렷한 개선이 확인되었으며 인간 평가는 응대 자연스러움에서 클라우드 모델 대비 소폭 낮음을 보였다.
근거
  • 합성 데이터와 Verification & Regeneration 파이프라인을 적용한 EXAONE 4.0 모델이 통화분석 태스크에서 평균 80.0점을 기록하여 Gemini 2.0 Flash 대비 22.6점 높은 성능을 보였다. 실험 결과 표 및 본문 '실험 결과' 섹션에 제시된 표2 및 관련 문단
  • AI 전화 대신 받기 태스크에서 합성 데이터를 적용하면 Intent Accuracy는 67.0에서 100.0으로, Slot Exact Match는 30.51에서 73.40으로 개선되었다. AI 전화 대신 받기 정량평가 결과 표(표3) 및 관련 문단

결론과 향후 과제

이번 과제는 경량화된 EXAONE 모델이 온디바이스 환경에서 통화분석과 실시간 대화 응대 태스크를 서비스 수준으로 수행할 수 있음을 실험적으로 확인했다. 온디바이스 처리로 개인정보 유출 위험과 네트워크 지연을 낮추었고 합성 데이터와 라벨 검증 파이프라인이 실제 통화 특성에 맞춘 성능 향상에 핵심적인 역할을 했다. 향후 과제는 응대 자연스러움 개선을 위한 표현 다양성 보강, 에너지·메모리 최적화의 추가 개선, 그리고 외부 환경 변화에 대한 지속적 검증을 통한 서비스 안정성 확보가 될 것이다.

용어 해설

온디바이스 에이전틱 AI(On-device Agentic AI)
온디바이스 에이전틱 AI는 중앙 클라우드를 거치지 않고 단말에서 자율적으로 의사결정과 연속적 태스크 수행을 하는 구조로, 입력된 센서·음성 데이터 처리와 상태 관리·도구 호출을 단말 내부 추론으로 실행하여 지연 최소화와 개인정보 보호를 확보하는 것이 핵심이다. 이 방식은 에이전트형 작업(대화형 응대, 통화분석 등)을 로컬 환경에서 실행하기 위해 모델 경량화, 메모리 절감, 긴 컨텍스트 처리 및 서빙 최적화가 필수 요건으로 작동한다. 통신 서비스에 적용될 때는 실시간성·보안·에너지 제약을 균형있게 관리하는 구현 전략이 중요하다.
합성 데이터 생성(Synthetic Data Generation)
합성 데이터 생성은 실제 수집이 어려운 대화 흐름과 STT 노이즈를 모사하기 위해 LLM 기반으로 기본 대화 생성, 발화 다양화, 엔티티 치환을 순차 적용해 현실적 입력을 대량으로 만드는 과정이다. 이 절차는 구어체, 발화 중단, 오인식 패턴을 인위적으로 삽입하여 Student 모델이 실제 통화 입력에서 강건해지도록 학습 분포를 확장하는 역할을 한다. 합성 데이터는 라벨링 비용과 개인정보 제약을 줄이면서도 커버리지를 확보하는 수단으로 평가·검증 기법과 함께 사용되어야 한다.
검증 및 재생성(Verification & Regeneration)
Verification & Regeneration은 Teacher Model이 생성한 라벨을 원문 대화와 대조해 원문 충실성·형식 준수·정보 일관성 관점에서 검증하고, 오류나 누락이 발견된 항목만을 대상으로 LLM 재생성을 통해 라벨 품질을 개선하는 절차이다. 이 절차는 Teacher의 자동 생성 능력을 그대로 신뢰하지 않고 오류를 체계적으로 제거하여 Student 학습에 투입되는 학습 신호의 신뢰도를 높인다. 특히 STT 노이즈와 구어체가 혼재하는 통화 분석 태스크에서 라벨 오탐과 허구(hallucination)를 줄이는 데 효과적이다.
유한 상태 기계(Finite State Machine)
Finite State Machine은 대화 정책을 명시적 상태와 전이 규칙으로 모델링하여 각 턴에서 필요한 Intent, Slot, Belief State, 시스템 발화를 생성하도록 하는 구조적 표현 방식이다. AI 전화 대신 받기와 같은 Task-oriented Dialogue에서는 가능한 시나리오를 FSM으로 전개해 합성 데이터의 경로를 통제하고 예외 흐름을 포함한 라벨링을 자동화하는 데 활용된다. FSM은 데이터 생성의 예측 가능성과 라벨 일관성을 확보하는 수단으로 기능한다.

기술

  • STT
  • EXAONE 4.0 1.2B
  • Finite State Machine
  • Machine-to-Machine 합성 시뮬레이션

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 07. 27.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.