TL;DR
Specific-Labs가 소형 모델의 자유 형식 Chain-of-Thought를 보완하기 위해 Inventory, Interaction, Execution 세 구간을 고정한 약 4M 예시 규모의 Scaffold-CoT 데이터셋을 공개했습니다. 데이터셋은 약 3B 토큰, 최대 2048 토큰 예시, 18개 domain과 798개 subdomain으로 구성되어 code·Calibration·Tool Calling·selfcheck 같은 작업별 학습을 지원합니다. 실제 도구를 실행한 87,162개 예시와 12개 오류 유형으로 나뉜 selfcheck 데이터가 포함되어 출력 형식과 오류 복구를 검증할 수 있습니다. 영어만 지원하고 형식 유연성이 낮으며 542개 예시에 불필요한 domain label이 남아 있다는 한계가 있고, 초기 LFM과 Gemma 4 실험에서는 benchmark와 체감 품질의 개선이 관찰됐습니다.
실용적 조언
- 특정 실패 유형이나 작업에 맞춰 학습하려면 metadata의 domain과 subdomain을 기준으로 데이터셋을 먼저 좁히는 방식이 적합합니다. 예를 들어 tool_use_complex만 선택하면 복잡한 도구 호출 체인을 별도로 학습할 수 있고, multi_step_real_execution subdomain을 사용하면 실제 실행 결과가 포함된 예시만 고를 수 있습니다. 작성자가 제공한 load_dataset과 filter 코드는 이 선택 과정을 바로 재현하는 기본 형태입니다.
- Scaffold-CoT를 학습할 때는 작성자의 권고대로 이미 SFT된 모델보다 base model을 우선 비교하는 편이 좋습니다. 학습 후에는 Inventory, Interaction, Execution 헤더가 유지되는지 Regex로 검사하고, selfcheck 예시에서 실제 오류 수정이 발생하는지 별도로 평가해야 합니다. 모델의 형식 준수뿐 아니라 benchmark 점수와 도구 실패 복구율을 함께 측정해야 구조화 추론의 효과를 구분할 수 있습니다.
섹션별 상세
용어 해설
- 사고 과정 추론(Chain-of-Thought)
- — Chain-of-Thought는 모델이 답만 출력하지 않고 중간 추론 단계를 생성하는 방식입니다. 이 글에서는 소형 모델의 자유 형식 추론이 불안정하다는 문제를 보완하기 위해 고정된 단계 구조를 학습시키는 방식으로 활용됩니다.
- 파인튜닝(Fine-tuning)
- — Fine-tuning은 이미 학습된 모델을 특정 데이터셋의 입력과 출력 패턴에 맞춰 추가 학습하는 과정입니다. 글에서는 Scaffold-CoT를 base model에 학습시키는 편이 이미 SFT된 모델보다 초기 실험에서 더 나았다는 경험이 제시됩니다.
- 불확실성 보정(Calibration)
- — Calibration은 모델이 아는 범위와 모르는 범위를 구분하고 확신의 정도를 답변에 반영하는 과정입니다. Scaffold-CoT는 지식 경계 확인, 잘못된 전제 점검, 자체 오류 수정 예시를 묶어 소형 모델의 과도한 확신과 환각을 줄이는 데 초점을 둡니다.
- 도구 호출(Tool Calling)
- — Tool Calling은 모델이 외부 함수나 도구를 호출하고 반환된 결과를 다음 추론에 사용하는 방식입니다. 이 데이터셋에는 실제 도구를 실행한 뒤 결과를 대화 기록에 삽입한 예시가 포함되어 도구 결과를 임의로 만들어내는 경로를 차단합니다.
- 정규표현식(Regex)
- — Regex는 문자열이 특정 패턴을 따르는지 기계적으로 검사하는 표현식입니다. 모든 예시가 Inventory, Interaction, Execution 순서를 따르므로 Fine-tuning 후 모델 출력에서 Scaffold가 깨졌는지를 자동 판별하는 데 사용할 수 있습니다.
코드 예제
ds = load_dataset("Specific-Labs/Scaffold-CoT", split="train")
tools = ds.filter(lambda r: r["metadata"]["domain"] == "tool_use_complex")Hugging Face 데이터셋을 불러온 뒤 metadata의 domain 값이 tool_use_complex인 예시만 필터링합니다.
언급된 도구
예시 프롬프트에서 middleware chain을 실행하는 서비스 구성 요소로 등장합니다.
예시 프롬프트에서 health check 대상 endpoint를 프로비저닝하는 도구로 등장합니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.