TL;DR
자유 텍스트 모델에 문법을 덧붙이는 대신 도구 호출에 필요한 다섯 가지 선택만 학습하는 48M 파라미터 모델 Thimble이 제안됐다. 모델은 도구 선택과 인자 값 같은 판단만 수행하고 JSON의 괄호·구두점·스키마 키는 문법 계층이 출력해, 선언되지 않은 도구 호출과 깨진 JSON을 구조적으로 막는다. 문법 적용 전후 결과는 150개 행에서 모두 같았고 자유 생성의 약 11%에서 발생한 깨진 JSON을 제거했지만, 엄격한 완전 일치 점수는 mobile actions 86.3, droidcall 52.5, seal-tools in-domain 33.1이었으며 미학습 카탈로그에서는 약 28로 낮아졌다. 선택적 인자와 병렬 스키마 인스턴스화, Java·JS 방언, 768 토큰 컨텍스트가 주요 약점으로 남았다.
실용적 조언
- 자체 도구 카탈로그에 맞추려면 제공된 adapt 스크립트로 모델을 특화할 수 있으며, 원문은 합성 데이터 비용을 약 56달러로 제시한다. 48M 파라미터 모델을 사용하기 때문에 600M급 모델보다 카탈로그별 재학습 비용을 낮추는 설계가 가능하다. 다만 미학습 카탈로그에서는 함수 선택이 먼저 무너지므로, 인자 형식만 맞는지 확인하지 말고 도구 선택 정확도를 별도로 측정해야 한다.
- 유사한 도구 호출 시스템을 만들 때는 모델이 JSON 전체를 생성하게 두기보다 선택이 필요한 지점과 문법적으로 고정할 부분을 분리하는 방식이 유효하다. 스키마 키와 호출 가능한 도구 목록을 디코더가 제한하면 깨진 JSON이나 선언되지 않은 호출을 구조적으로 차단할 수 있다. 선택적 인자, 병렬 호출, Java·JS 방언, 768 토큰 컨텍스트는 별도 테스트 묶음으로 두고 실패율을 확인해야 한다.
- 저장소의 findings 파일에는 span copying 점수 30 하락, pointer heads 점수 16 하락, 모든 학습률에서 RLOO 발산 등 11개의 부정적 결과가 기록되어 있다. 이 기록은 성공한 구성만 비교하는 것보다 어떤 설계가 실패했는지 먼저 걸러내는 데 활용할 수 있다. 같은 시스템을 재현하거나 확장할 때는 최종 점수뿐 아니라 이런 실패 조건과 평가 카탈로그의 학습 포함 여부도 함께 기록하는 편이 안전하다.
섹션별 상세
용어 해설
- 제약 디코딩(Constrained Decoding)
- — 모델이 생성할 수 있는 토큰이나 구조를 문법으로 제한하는 디코딩 방식이다. Thimble은 중괄호·따옴표·쉼표·스키마 키를 문법 계층에서 직접 출력해 JSON 파싱 오류와 허용되지 않은 도구 호출을 차단한다.
- 함수 스키마(Function Schema)
- — 도구 호출에 필요한 함수 이름과 인자 구조를 정의한 형식이다. Thimble은 입력된 스키마에 포함된 도구와 인자 키만 호출 결과에 사용할 수 있도록 제약을 걸어 호출 형식의 범위를 제한한다.
- 토큰 치유(Token Healing)
- — 토큰 경계 때문에 발생하는 잘못된 문자열 생성을 보정하는 기법이다. 원문은 자유 텍스트 모델에 문법을 덧붙이는 기존 방식이 병합 토큰의 로짓 마스킹과 토큰 치유를 추가로 관리해야 한다고 설명하며, Thimble은 이 문제를 전용 토크나이저와 디코더 설계로 피한다.
- RLOO 강화학습(RLOO)
- — 여러 샘플의 보상 비교를 활용해 모델 정책을 조정하는 강화학습 방식이다. Thimble의 부정적 결과 파일에는 학습률을 바꿔도 RLOO가 매번 발산한 실험 결과가 포함되어 있어, 해당 학습 접근의 실패 사례를 확인할 수 있다.
- 엄격한 완전 일치 평가(Strict Exact Match)
- — 예측한 도구와 인자 구성이 정답과 완전히 일치하는지 측정하는 평가 기준이다. 원문은 mobile actions에서 86.3, droidcall에서 52.5, in-domain seal-tools에서 33.1의 점수를 이 기준으로 보고하며, 미학습 카탈로그에서는 약 28까지 하락했다고 밝혔다.
언급된 도구
함수 스키마와 요청을 입력받아 문법 제약이 적용된 도구 호출 또는 빈 목록을 출력하는 48M 파라미터 도구 호출 계층이다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.