본문으로 건너뛰기

소형 언어 모델을 활용한 대규모 다국어 상품명 최적화

LocRegen은 7B 모델로 다국어 상품명의 중복을 제거해 47B 모델보다 낮은 오류율을 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

전자상거래 상품명은 같은 정보가 반복되면 읽기 어려워지지만, Large Language Model을 대규모로 사용하면 계산 비용이 커집니다. Amazon Science의 연구진은 반복 표현을 재구성하고 바꿔 쓰면서 핵심 상품 속성을 유지하는 LocRegen 시스템을 7B 모델 기반으로 구성했습니다. 5개 언어 실험에서 LocRegen의 중복 상품명 비율은 2.4%로 47B Mixture-of-Experts 모델의 3.5%보다 낮았고, 전체 오류율도 3.8% 대 8.4%로 낮았습니다. 비용 효율적인 하드웨어와 허용 가능한 지연 시간을 함께 확보해 대규모 상품명 처리에 적합한 접근으로 평가됐습니다.

빠른 이해

새로운 점

7B 모델 기반 LocRegen이 47B Mixture-of-Experts 모델보다 낮은 중복률과 오류율을 기록했다는 점입니다.

핵심 메커니즘

다국어 상품명을 입력하면 LocRegen이 반복 정보의 원인을 파악하고 문장 재구성과 바꿔 쓰기를 거쳐 중복 표현을 제거한 결과를 생성하며, 핵심 상품 속성은 유지합니다.

핵심 수치

  • 중복 상품명 비율: LocRegen 2.4% · 47B 모델 3.5%- 5개 언어 실험
  • 전체 오류율: LocRegen 3.8% · 47B 모델 8.4%- 핵심 상품 속성 누락을 포함한 모든 오류 범주
  • 모델 규모: LocRegen 7B · 비교 모델 47B- 47B 모델은 Mixture-of-Experts 구조

섹션별 상세

01

다국어 상품명 최적화 과제

전자상거래 상품명에는 같은 정보가 반복되는 경우가 있어 가독성과 사용자 경험을 떨어뜨립니다. 반복 단어를 재구성하거나 바꿔 쓰면 상품명을 짧게 만들 수 있지만, 대규모 서비스에서 Large Language Model을 사용하면 높은 계산 비용이 발생합니다. 따라서 핵심 상품 속성을 유지하면서 중복만 제거하고, 실제 배포 비용과 지연 시간까지 낮추는 방법이 필요합니다.
02

LocRegen의 소형 모델 접근법

LocRegen은 다국어 상품명에서 반복이 생기는 원인을 먼저 파악한 뒤 소형 언어 모델로 중복 정보를 제거하도록 구성한 시스템입니다. 입력 상품명에서 반복 표현을 재구성하고 바꿔 쓰되, 상품의 핵심 속성이 빠지지 않도록 결과를 생성하는 흐름을 사용합니다. 이 구조는 더 큰 모델의 계산량을 그대로 감당하지 않고도 상품명 간결화와 속성 보존을 함께 처리하려는 목적을 가집니다.
03

5개 언어 실험 결과

5개 언어를 대상으로 한 실험에서 7B 모델을 사용하는 LocRegen의 중복 상품명 비율은 2.4%로, 47B Mixture-of-Experts 모델의 3.5%보다 낮았습니다. 핵심 상품 속성 누락을 포함한 모든 오류 범주의 전체 오류율도 LocRegen은 3.8%, 47B 모델은 8.4%로 측정됐습니다. 더 작은 모델이 두 지표에서 더 낮은 오류를 기록했다는 점이 상품명 최적화 품질과 계산 효율을 함께 고려해야 하는 이유가 됩니다.
04

대규모 배포의 의미

LocRegen은 비용 효율적인 하드웨어에서 더 큰 모델보다 낮은 오류율을 유지하면서 허용 가능한 지연 시간을 확보했습니다. 상품명 최적화 과정은 많은 상품을 반복 처리해야 하므로 모델 크기에 따른 계산 비용과 처리 속도가 운영 가능성을 좌우합니다. 이 결과는 47B 모델이 필요한 작업처럼 보이는 다국어 상품명 정리에도 7B 기반 시스템을 적용할 여지가 있음을 뜻합니다.

용어 해설

Mixture-of-Experts
여러 개의 전문 하위 모델 중 입력에 필요한 일부만 선택해 계산하는 구조입니다. 전체 모델을 모두 실행하지 않아 연산량을 줄일 수 있지만, 이 글에서는 47B Mixture-of-Experts 모델과 7B 모델의 상품명 최적화 성능을 비교하는 기준으로 사용됩니다.
중복 상품명 비율(Redundant Title Rate)
상품명에 반복되거나 불필요한 정보가 남아 있는 비율입니다. LocRegen의 출력에서 중복이 남은 상품명의 비중을 측정하며, 2.4%와 3.5%처럼 낮을수록 상품명이 더 간결하게 정리되었음을 뜻합니다.
전체 오류율(Overall Error Rate)
상품 속성 누락을 포함해 모든 오류 범주에서 잘못된 결과가 발생한 비율입니다. 상품명의 중복 제거뿐 아니라 핵심 속성 보존까지 함께 평가하며, LocRegen은 3.8%, 47B 모델은 8.4%를 기록했습니다.
허용 가능한 지연 시간(Acceptable Latency)
상품명 하나를 처리하는 데 걸리는 시간이 실제 대규모 서비스 운영에 적합한 수준임을 뜻합니다. 이 글에서는 LocRegen이 비용 효율적인 하드웨어에서 허용 가능한 지연 시간을 유지해 대규모 배포에 적합하다고 평가됩니다.

기술

  • LocRegen
  • small language models
  • 7B model
  • 47B mixture-of-experts model
  • large language models
  • machine translation
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 15.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.