본문으로 건너뛰기

How2Everything: 실생활 절차 수행 능력 평가 및 개선을 위한 웹 데이터 마이닝 프레임워크

웹에서 추출한 35만 개의 절차 데이터를 활용해 LLM의 단계별 지침 생성 능력을 평가하고 치명적 오류를 줄여 성능을 10점 이상 향상시키는 프레임워크다.

섹션별 상세

01
실생활 절차 데이터의 중요성과 기존 평가 방식의 한계가 명확하다. 챗봇 대화의 상당 부분이 단계별 안내 요청임에도 불구하고, 이혼 서류 제출이나 전기 배선 수리 같은 절차를 실제로 실행하여 검증하는 것은 불가능에 가깝다. 기존 벤치마크는 표면적인 텍스트 유사도에 의존하기 때문에 필수 단계 누락이나 순서 오류 같은 치명적인 결함을 잡아내지 못하는 구조적 한계를 지닌다.
02
How2Mine 파이프라인을 통해 대규모 실생활 절차 데이터를 구축했다. DCLM 웹 코퍼스에서 튜토리얼 스타일의 페이지를 식별한 뒤 GPT-4.1을 활용해 요리, 법률, 전자제품 등 14개 주제에 걸쳐 351,162개의 구조화된 절차를 추출했다. 이 과정에서 UI 의존적이거나 비논리적인 절차를 필터링하고 5~15단계 사이의 유효한 지침만을 남겨 데이터의 품질을 확보했다.
03
How2Bench와 How2Score를 통해 정밀한 평가 체계를 수립했다. How2Bench는 모델이 특정 목표에 대해 정해진 단계 수만큼 정확한 지침을 생성하도록 요구하는 7,000개 규모의 벤치마크다. How2Score는 단순히 문장이 자연스러운지가 아니라, 절차를 완수하지 못하게 만드는 '치명적 오류'가 있는지 여부를 측정한다. 이를 위해 GPT-5의 판단을 모방하도록 학습된 8B 규모의 오픈 모델인 How2Judge를 배포하여 저비용으로 재현 가능한 평가를 가능하게 했다.
04
프레임워크를 활용한 모델 학습 결과 유의미한 성능 향상이 확인됐다. How2Score를 보상 신호로 사용하여 모델을 학습시킨 결과, Qwen3-8B-Inst 모델의 성능이 38.5점에서 48.6점으로 10.1점 향상되었다. 특히 학습 과정에서 출력 길이를 제어하지 않으면 모델이 평가 모델을 속이기 위해 불필요하게 긴 답변을 생성하는 '보상 해킹' 현상이 발견되어, 명시적인 길이 제어 설계의 중요성이 입증되었다.

용어 해설

치명적 오류(Critical Failure)
절차를 수행하는 사용자가 목표를 달성하지 못하게 만드는 핵심적인 결함이다. 필수 단계 누락, 순서 오류, 모순된 지침 등이 포함되며, 단순한 텍스트 유사도 측정으로는 파악하기 어려운 실제 작동 가능 여부를 결정짓는 요소다.
폐쇄 루프 평가(Closed-loop Evaluation)
데이터 마이닝, 모델 평가, 성능 개선이 하나의 반복적인 시스템 내에서 상호작용하며 이루어지는 구조다. 웹 데이터를 참조 앵커로 활용해 실행 기반 검증이 어려운 영역에서도 대규모로 모델의 능력을 측정하고 개선할 수 있게 한다.
보상 신호(Reward Signal)
강화학습이나 파인튜닝 과정에서 모델이 생성한 결과물의 품질을 수치화하여 학습 방향을 안내하는 지표다. 이 아티클에서는 How2Score 판별 모델이 생성한 점수를 보상으로 사용하여 모델이 치명적 오류를 덜 범하도록 유도한다.
지식 증류(Distillation)
거대 모델(Teacher)이 가진 복잡한 판단 능력을 더 작고 효율적인 모델(Student)에게 전수하는 기법이다. 본 연구에서는 GPT-5의 고비용 판단 능력을 8B 규모의 Qwen 3 모델에 이식하여 저비용으로 재현 가능한 평가 도구인 How2Judge를 구축했다.
층화 추출(Stratified Sampling)
모집단을 서로 겹치지 않는 여러 개의 층(Strata)으로 나누고 각 층에서 표본을 추출하는 통계적 방법이다. 14개의 다양한 주제에 걸쳐 데이터의 다양성을 확보하고 특정 분야에 편중되지 않은 벤치마크를 구성하기 위해 사용되었다.

기술

  • GPT-4.1
  • GPT-5
  • Qwen 3
  • DCLM Web Corpus
  • WebOrganizer

활용 사례

  • 단계별 가이드 생성 챗봇 최적화
  • AI 에이전트의 계획 수립 능력 평가
  • 실생활 절차 데이터셋 구축
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 10.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.