본문으로 건너뛰기

소형 모델용 구조화 CoT 데이터셋 Scaffold-CoT

Scaffold-CoT가 소형 모델의 추론을 고정 구조와 오류 교정 예시로 학습시킵니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Scaffold-CoT는 5B 미만 소형 언어 모델의 자유 형식 CoT가 만드는 혼란과 부정확성을 줄이기 위해 모든 예시를 Inventory, Interaction, Execution의 세 구간으로 고정한 약 4M개, 약 3B 토큰 규모 데이터셋입니다. 18개 domain과 798개 subdomain에 걸쳐 최대 2048토큰 예시를 제공하며, antihal·selfcheck 영역 약 681k개로 지식 경계와 자기 오류 수정까지 학습하게 구성했습니다. 전체 도구 호출 예시 약 279k개 중 87,162개는 도구를 실제 실행한 결과를 포함하고, 각 예시에 실제 실패와 복구가 들어갑니다. 작성자는 30~50%의 생성물을 제거하는 품질 관리와 11,293개 누수 예시 제거를 거쳤으며, LFM과 Gemma의 초기 시험에서 벤치마크와 체감 응답 품질이 개선됐다고 밝혔습니다.

실용적 조언

  • 학습에 사용할 때는 이미 SFT된 모델보다 base model을 우선 사용해야 하며, 작성자는 base model에서 유의미하게 더 나은 결과를 관찰했다고 밝혔습니다.
  • 특정 작업 실패를 겨냥하려면 metadata.domain과 metadata.subdomain으로 필요한 영역만 필터링하고, 실제 도구 실행 예시만 사용하려면 metadata.subdomain == "multi_step_real_execution"을 적용할 수 있습니다.

섹션별 상세

01
작성자는 5B 미만 모델에서 자유 형식 CoT가 능력을 크게 늘리지 못하고 오히려 구조가 흐트러진 부정확한 응답을 만든다고 관찰했습니다. Scaffold-CoT는 모든 예시에 Inventory, Interaction, Execution을 같은 순서로 적용해 모델이 사고의 배치 형식을 매번 다시 결정하지 않도록 합니다. 형식이 고정되므로 정규식으로 스캐폴드가 깨졌는지 판별할 수 있고, 네 가지 깊이 계층과 약 5.6배의 길이 차이로 문제에 따라 짧거나 긴 추론을 선택하도록 학습시킵니다.
02
데이터셋은 code 669,517개, general 643,561개, antihal 502,151개 등 18개 domain과 798개 subdomain으로 전체 예시를 분류하며 라벨 없는 잔여 영역을 두지 않았습니다. 각 예시는 정확한 domain과 비어 있지 않은 subdomain을 metadata에 담아 특정 작업이나 실패 유형만 골라 학습할 수 있습니다. 작성자는 이런 세분화가 소형 모델의 주제별 일반화 한계를 보완하고 배포 목적에 맞는 specialization을 돕는다고 설명했습니다.
03
소형 모델의 취약점으로 지식 경계를 넘는 답변, 잘못된 전제 수용, 추론 중 오류 방치가 지목됐고, antihal·antihal_kb_refined·selfcheck를 합쳐 약 681k개 예시를 배치했습니다. selfcheck는 논리적 비약, 잘못된 가정, 용어 혼동, 방향 오류, 상관관계와 인과관계 혼동, 단위 오류 등 12개 오류 유형으로 나뉩니다. 따라서 단순히 정답을 모방하는 출력보다 모르는 범위를 밝히고 중간 실수를 찾아 수정하는 행동을 별도로 학습할 수 있습니다.
python
ds = load_dataset("Specific-Labs/Scaffold-CoT", split="train")
tools = ds.filter(lambda r: r["metadata"]["domain"] == "tool_use_complex")

Hugging Face 데이터셋을 불러온 뒤 metadata의 domain 값으로 복잡한 도구 사용 예시만 필터링합니다.

04
tool_use와 tool_use_complex에는 약 279k개의 도구 호출 연쇄가 있으며, 그중 87,162개는 harness가 모든 도구를 실제 실행하고 결과를 transcript에 붙인 예시입니다. 실제 실행 예시는 평균 4.2회 호출을 포함하고 모두 실제 실패와 복구를 담아, 모델이 받지 않은 도구 결과를 꾸며내는 문제를 구조적으로 차단합니다. 다만 고정된 도구가 내는 결과 문장은 다소 반복적이고 prompt와 추론 부분은 다양하다는 한계가 함께 적혔습니다.
05
품질 관리는 최대 2048토큰 제한의 실제 측정, 기계적·의미적 중복 제거, LLM Judge를 통한 수정과 우수 예시 선택, 스캐폴드 형식 점검으로 수행됐습니다. 전체 생성물의 30~50%를 버렸고, 동일한 시작 문장이 데이터의 2%를 넘지 않도록 제한했으며, selfcheck에는 실제 수정이 있고 antihal에는 실제 지식 경계가 드러나는지 행동 검사를 적용했습니다. 누수 점검에서는 깨진 스캐폴드, 닫히지 않은 think 블록, 생성기 잔여물, 템플릿 자리표시자가 있는 11,293개인 0.31%의 예시를 제거했습니다.

용어 해설

연쇄 사고(Chain-of-Thought)
언어 모델이 최종 답변에 도달하기까지 중간 추론 단계를 생성하는 방식입니다. 이 글에서는 자유 형식 CoT가 소형 모델에서 혼란과 부정확성을 키울 수 있다는 문제를 보완하기 위해 고정된 구조와 함께 사용됩니다.
추론 스캐폴드(Scaffold)
모델이 입력과 제약을 정리하고 상호작용을 거쳐 답을 산출하도록 돕는 고정된 추론 틀입니다. Scaffold-CoT는 모든 예시에 Inventory, Interaction, Execution을 같은 순서로 배치해 형식 재결정에 드는 용량을 줄입니다.
출력 보정(Calibration)
모델이 아는 것과 모르는 것을 구분하고, 잘못된 전제나 중간 오류를 감지해 답변의 확신과 내용을 조절하는 능력입니다. 이 데이터셋은 지식 경계, 전제 감사, 자기 수정 예시를 별도 영역으로 크게 구성합니다.
도구 호출(Tool Calling)
모델이 외부 도구를 선택하고 호출한 뒤 반환된 결과를 다음 추론에 반영하는 처리 방식입니다. 일부 예시는 도구를 실제로 실행해 결과를 대화 기록에 삽입하므로, 도구 출력 자체를 임의로 만들어내는 오류를 구조적으로 막습니다.
지도 미세 조정(Supervised Fine-Tuning)
입력과 목표 출력으로 구성된 예시를 사용해 모델의 응답 형식과 작업 수행 방식을 학습시키는 방법입니다. 글 작성자는 이미 SFT된 모델보다 base model을 사용한 학습에서 더 나은 결과를 관찰했다고 밝혔습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 03.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.