본문으로 건너뛰기

Thimble, 도구 호출만 학습하는 4,800만 파라미터 모델

Thimble은 도구 호출의 선택만 모델에 맡기고 JSON 구조는 문법으로 고정한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

자유 텍스트 모델에 문법을 덧붙이는 대신 도구 호출에 필요한 다섯 가지 선택만 학습하는 48M 파라미터 모델 Thimble이 제안됐다. 모델은 도구 선택과 인자 값 같은 판단만 수행하고 JSON의 괄호·구두점·스키마 키는 문법 계층이 출력해, 선언되지 않은 도구 호출과 깨진 JSON을 구조적으로 막는다. 문법 적용 전후 결과는 150개 행에서 모두 같았고 자유 생성의 약 11%에서 발생한 깨진 JSON을 제거했지만, 엄격한 완전 일치 점수는 mobile actions 86.3, droidcall 52.5, seal-tools in-domain 33.1이었으며 미학습 카탈로그에서는 약 28로 낮아졌다. 선택적 인자와 병렬 스키마 인스턴스화, Java·JS 방언, 768 토큰 컨텍스트가 주요 약점으로 남았다.

실용적 조언

  • 자체 도구 카탈로그에 맞추려면 제공된 adapt 스크립트로 모델을 특화할 수 있으며, 원문은 합성 데이터 비용을 약 56달러로 제시한다. 48M 파라미터 모델을 사용하기 때문에 600M급 모델보다 카탈로그별 재학습 비용을 낮추는 설계가 가능하다. 다만 미학습 카탈로그에서는 함수 선택이 먼저 무너지므로, 인자 형식만 맞는지 확인하지 말고 도구 선택 정확도를 별도로 측정해야 한다.
  • 유사한 도구 호출 시스템을 만들 때는 모델이 JSON 전체를 생성하게 두기보다 선택이 필요한 지점과 문법적으로 고정할 부분을 분리하는 방식이 유효하다. 스키마 키와 호출 가능한 도구 목록을 디코더가 제한하면 깨진 JSON이나 선언되지 않은 호출을 구조적으로 차단할 수 있다. 선택적 인자, 병렬 호출, Java·JS 방언, 768 토큰 컨텍스트는 별도 테스트 묶음으로 두고 실패율을 확인해야 한다.
  • 저장소의 findings 파일에는 span copying 점수 30 하락, pointer heads 점수 16 하락, 모든 학습률에서 RLOO 발산 등 11개의 부정적 결과가 기록되어 있다. 이 기록은 성공한 구성만 비교하는 것보다 어떤 설계가 실패했는지 먼저 걸러내는 데 활용할 수 있다. 같은 시스템을 재현하거나 확장할 때는 최종 점수뿐 아니라 이런 실패 조건과 평가 카탈로그의 학습 포함 여부도 함께 기록하는 편이 안전하다.

섹션별 상세

01
기존 제약 디코딩은 자유 텍스트 생성으로 학습한 모델에 문법을 덧붙인 뒤 토큰 치유와 병합 토큰의 로짓 마스킹으로 불일치를 보정한다. 작성자는 반대로 도구 호출에 필요한 다섯 가지 판단인 호출 거부 또는 실행, 도구 선택, 선택적 인자 포함 여부, 인자 값, 종료 또는 계속을 먼저 정하고 모델·학습 손실·디코더를 그 구조에 맞췄다. 그 결과 모델은 대화나 산문을 생성하지 않고 함수 스키마와 요청을 읽어 호출 목록 또는 빈 목록만 출력한다.
02
Thimble에서는 모델이 다섯 판단 지점에서만 선택하고, 중괄호·따옴표·쉼표·스키마의 인자 키 같은 나머지 JSON 구조는 문법 계층이 직접 출력한다. 따라서 결과는 항상 파싱 가능한 JSON이며 선언하지 않은 도구를 호출하거나 스키마 밖의 인자 키를 만드는 표현이 불가능하다. 문법을 끈 결과와 켠 결과가 한 평가 모음의 150개 행 모두에서 일치해, 문법이 모델의 의도와 충돌하기보다 이미 선택한 결과의 형식적 실패를 차단한 것으로 나타났다.
03
이 접근의 핵심 이득은 정확도 상승보다 신뢰성 확보에 있다. 자유 생성에서 약 11%의 행이 깨진 JSON을 내보냈지만, 문법 제약은 이런 구조적 실패를 표현할 수 없게 만들었다. 엄격한 완전 일치 점수는 학습에 포함된 카탈로그 기준으로 mobile actions 86.3, droidcall 52.5, seal-tools in-domain 33.1이었고, 미학습 카탈로그에서는 약 28까지 떨어졌다.
04
일반화의 병목은 인자 추출보다 함수 선택으로 나타났다. 선택적 인자를 양방향으로 처리하는 경우가 가장 큰 실패 묶음이었고, 하나의 스키마를 병렬로 여러 번 인스턴스화하는 점수는 12.0으로 낮았다. Java와 JS 스키마 방언, 768 토큰 컨텍스트도 약점으로 측정되어 카탈로그가 학습 범위를 벗어나면 구조 보장만으로 선택 정확도를 보완하기 어렵다.

용어 해설

제약 디코딩(Constrained Decoding)
모델이 생성할 수 있는 토큰이나 구조를 문법으로 제한하는 디코딩 방식이다. Thimble은 중괄호·따옴표·쉼표·스키마 키를 문법 계층에서 직접 출력해 JSON 파싱 오류와 허용되지 않은 도구 호출을 차단한다.
함수 스키마(Function Schema)
도구 호출에 필요한 함수 이름과 인자 구조를 정의한 형식이다. Thimble은 입력된 스키마에 포함된 도구와 인자 키만 호출 결과에 사용할 수 있도록 제약을 걸어 호출 형식의 범위를 제한한다.
토큰 치유(Token Healing)
토큰 경계 때문에 발생하는 잘못된 문자열 생성을 보정하는 기법이다. 원문은 자유 텍스트 모델에 문법을 덧붙이는 기존 방식이 병합 토큰의 로짓 마스킹과 토큰 치유를 추가로 관리해야 한다고 설명하며, Thimble은 이 문제를 전용 토크나이저와 디코더 설계로 피한다.
RLOO 강화학습(RLOO)
여러 샘플의 보상 비교를 활용해 모델 정책을 조정하는 강화학습 방식이다. Thimble의 부정적 결과 파일에는 학습률을 바꿔도 RLOO가 매번 발산한 실험 결과가 포함되어 있어, 해당 학습 접근의 실패 사례를 확인할 수 있다.
엄격한 완전 일치 평가(Strict Exact Match)
예측한 도구와 인자 구성이 정답과 완전히 일치하는지 측정하는 평가 기준이다. 원문은 mobile actions에서 86.3, droidcall에서 52.5, in-domain seal-tools에서 33.1의 점수를 이 기준으로 보고하며, 미학습 카탈로그에서는 약 28까지 하락했다고 밝혔다.

언급된 도구

Thimble중립링크

함수 스키마와 요청을 입력받아 문법 제약이 적용된 도구 호출 또는 빈 목록을 출력하는 48M 파라미터 도구 호출 계층이다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.