TL;DR
Scaffold-CoT는 5B 미만 소형 언어 모델의 자유 형식 CoT가 만드는 혼란과 부정확성을 줄이기 위해 모든 예시를 Inventory, Interaction, Execution의 세 구간으로 고정한 약 4M개, 약 3B 토큰 규모 데이터셋입니다. 18개 domain과 798개 subdomain에 걸쳐 최대 2048토큰 예시를 제공하며, antihal·selfcheck 영역 약 681k개로 지식 경계와 자기 오류 수정까지 학습하게 구성했습니다. 전체 도구 호출 예시 약 279k개 중 87,162개는 도구를 실제 실행한 결과를 포함하고, 각 예시에 실제 실패와 복구가 들어갑니다. 작성자는 30~50%의 생성물을 제거하는 품질 관리와 11,293개 누수 예시 제거를 거쳤으며, LFM과 Gemma의 초기 시험에서 벤치마크와 체감 응답 품질이 개선됐다고 밝혔습니다.
실용적 조언
- 학습에 사용할 때는 이미 SFT된 모델보다 base model을 우선 사용해야 하며, 작성자는 base model에서 유의미하게 더 나은 결과를 관찰했다고 밝혔습니다.
- 특정 작업 실패를 겨냥하려면 metadata.domain과 metadata.subdomain으로 필요한 영역만 필터링하고, 실제 도구 실행 예시만 사용하려면 metadata.subdomain == "multi_step_real_execution"을 적용할 수 있습니다.
섹션별 상세
ds = load_dataset("Specific-Labs/Scaffold-CoT", split="train")
tools = ds.filter(lambda r: r["metadata"]["domain"] == "tool_use_complex")Hugging Face 데이터셋을 불러온 뒤 metadata의 domain 값으로 복잡한 도구 사용 예시만 필터링합니다.
용어 해설
- 연쇄 사고(Chain-of-Thought)
- — 언어 모델이 최종 답변에 도달하기까지 중간 추론 단계를 생성하는 방식입니다. 이 글에서는 자유 형식 CoT가 소형 모델에서 혼란과 부정확성을 키울 수 있다는 문제를 보완하기 위해 고정된 구조와 함께 사용됩니다.
- 추론 스캐폴드(Scaffold)
- — 모델이 입력과 제약을 정리하고 상호작용을 거쳐 답을 산출하도록 돕는 고정된 추론 틀입니다. Scaffold-CoT는 모든 예시에 Inventory, Interaction, Execution을 같은 순서로 배치해 형식 재결정에 드는 용량을 줄입니다.
- 출력 보정(Calibration)
- — 모델이 아는 것과 모르는 것을 구분하고, 잘못된 전제나 중간 오류를 감지해 답변의 확신과 내용을 조절하는 능력입니다. 이 데이터셋은 지식 경계, 전제 감사, 자기 수정 예시를 별도 영역으로 크게 구성합니다.
- 도구 호출(Tool Calling)
- — 모델이 외부 도구를 선택하고 호출한 뒤 반환된 결과를 다음 추론에 반영하는 처리 방식입니다. 일부 예시는 도구를 실제로 실행해 결과를 대화 기록에 삽입하므로, 도구 출력 자체를 임의로 만들어내는 오류를 구조적으로 막습니다.
- 지도 미세 조정(Supervised Fine-Tuning)
- — 입력과 목표 출력으로 구성된 예시를 사용해 모델의 응답 형식과 작업 수행 방식을 학습시키는 방법입니다. 글 작성자는 이미 SFT된 모델보다 base model을 사용한 학습에서 더 나은 결과를 관찰했다고 밝혔습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.