왜 중요한가
스프레드시트는 데이터 중심 워크플로의 핵심 도구로, 실세계의 복잡한 다단계 작업을 자동화하려면 단일 명령어가 아닌 다수의 연산과 레이아웃 변화가 필요하다. Spreadsheet-RL은 Excel 환경에서의 온-폴리시 RL 파인튜닝을 통해 스프레드시트 작업의 장기 흐름을 다루는 정책을 학습하고, 도메인 지식이 필요한 작업에서도 일반화 성능을 높인다. 데이터 수집 파이프라인과 Excel 런타임 하니스, 그리고 도메인 벤치마크 Domain-Spreadsheet의 공개로 재현성과 확장이 가능해졌다.
핵심 기여
End-to-end RL post-training for spreadsheet tasks
스프레드시트 도메인에 특화된 RL 파인튜닝 파이프라인을 제시하고, 실제 엑셀 환경에서 multi-turn 상호작용을 통해 목표를 달성하도록 정책을 업데이트한다.
Automated large-scale data generation
Spreadsheet Data Agent를 이용해 공개 포럼으로부터 초기-최종 스프레드시트 쌍을 대규모로 자동 수집하고, 규칙 기반 필터링으로 오염을 제거한다.
Spreadsheet-native tool harness
헤먼스는 스프레드시트의 고유 연산 도구를 노출하여 모델이 내부적으로 파이썬으로 재구현하는 것을 방지하고, 견고한 워크플로를 통해 장기 의사결정을 지지한다.
GRPO-based training objective
GRPO를 사용해 verifiable rewards로 정책을 업데이트하고 KL 제약으로 안정성을 보장한다. 보상은 최종 도출된 스프레드시트가 오커럴과 일치하는지에 따라 결정된다.
Open-source evaluation and domain benchmark
SpreadsheetBench와 Domain-Spreadsheet를 공개 벤치마크로 제공해 일반화 가능성과 재현성을 검증한다.
핵심 아이디어 이해하기
출발점: 일반적인 LLM 프롬프트 기반 스프레드시트 접근은 다단계 워크플로우를 안정적으로 다루지 못한다. 기초 아이디어: 다-turn 의사소통과 도구 사용을 결합한 on-policy RL로, 환경으로부터 얻은 실행 결과를 바탕으로 정책을 점진적으로 개선한다. 해결 원리: Spreadsheet-RL은 (1) Spreadsheet Data Agent로 대규모 현실적 데이터 생성, (2) Spreadsheet Gym에서 Excel 런타임과 도구 세트를 제공하는 하니스, (3) GRPO 기반 비평가적 보상으로 정책을 안전하게 업데이트하는 체계를 제시한다. 달라지는 점: 스프레드시트 특성상 단순 성공/실패 신호가 부족하므로, 롤아웃마다 보상 신호를 얻고 이를 기반으로 정책을 조정하는 방식이 학습 효율을 크게 올린다. 결과적으로, 같은 4B 모델에서도 프롬프트 중심 접근보다 더 높은 Task 성공률과 워크플로 효율을 달성한다.
방법론
전체 접근 은 세 부분으로 구성된다. 첫째, Task Generation with Spreadsheet Data Agent에 의해 seed 메타데이터를 수집하고 Oracle Final Spreadsheet를 구성한다. 둘째, Spreadsheet Gym은 실제 Microsoft Excel 환경에서 다-turn 상호작용을 가능하게 하는 런타임과 각종 도구를 제공하는 하니스이며, Read-only inspection과 Write 작업을 안전하게 분리한다. 셋째, GRPO 기반의 비판적 학습 파이프라인은 정책 πθ를 갱신하는데 사용되며, 보상은 Dpred와 Do의 영역이 일치하는지에 따라 결정된다. 계산 흐름의 핵심은 입력 Di, T를 받아 y_i를 생성하고, πθ(y_i|Di,T;G)와 πold(y_i|Di,T;G)의 비율 ri(θ)를 정의하고, 이 값을 이용해 샘플의 기대치를 최대화하는 것이다. 보상 R(o)는 출력이 유효하면 Dpred와 Do의 일치 여부를 통해 결정되고, 실패 시 0으로 처리된다. GRPO의 업데이트는 그룹 상대 이점과 KL 제약을 사용해 다양성과 안정성을 동시에 추구한다. 학습은 60 단계의 실험 설정으로 진행되며, 4B 규모의 Qwen 모델을 사용한다. Granularity를 위해 per-rollout 파일 시스템 격리를 도입하고 Excel 기반 재계산을 비동기로 수행한다.
관련 Figure

Spreadsheet Data Agent, Spreadsheet Gym, Harness 간의 상호작용과 RL 파이프라인 흐름을 제시한다. 독자에게 시스템 구성이 어떻게 맞물려 작동하는지 한눈에 보여주는 도식이다.
Spreadsheet-RL 아키텍처 개요 다이어그램

데이터 수집, 데이터 합성, 룰 기반 필터링, 학습 파이프라인의 흐름을 시각화한다. 학습 데이터의 구성과 파이프라인의 연결고리를 설명하는 보조 도표로 활용된다.
데이터 수집 및 학습 파이프라인 흐름

도메인 지식 기반 데이터 수집 흐름을 보여주며 Domain-Spreadsheet 벤치마크의 구성 요소를 시각화한다.
Domain-Spreadsheet 예시 다이어그램

훈련 데이터의 행/열/작업 수 분포를 시각화해 데이터 규모의 특성을 보여준다.
훈련 데이터의 스프레드시트 사이즈 분포 차트

스프레드시트 연산 유형별 분포를 제시하여 학습 데이터의 편향과 작업 특성을 파악하게 한다.
RL Training Data의 Sheet Operation 분포

프롬프트 설계에서 자주 사용된 동사-명사 구를 분석해 모델의 추론 흐름과 도구 호출의 경향을 파악한다.
훈련 프롬프트의 동사-명사 구 분포
주요 결과
주요 벤치마크에서의 성능 향상은 다음과 같다. SpreadsheetBench에서 Qwen3-4B-Thinking-2507의 Pass@1이 12.0%에서 Spreadsheet-RL 후 23.4%로 증가했다. 도메인 벤치마크 Domain-Spreadsheet에서의 전체 Pass@1은 8.4%에서 17.2%로 상승했다. RL 훈련 과정에서 보상 평균은 0.21에서 0.33으로 상승했고, 응답 길이는 약 16k에서 11k로 감소하며 상호작용 횟수도 약 20에서 11로 감소했다. 이러한 결과는 RL 후반에서 Task 성공률 증가뿐 아니라 워크북 편집의 효율성 증가를 시사한다.
기술 상세
전체 아키텍처는 Spreadsheet Data Agent, Spreadsheet Gym, Spreadsheet Native Tool Harness로 구성된다. Spreadsheet Data Agent는 seed 메타데이터를 수집하고 Oracle DO를 생성하기 위해 Coding Agent(예: Claude Code, Codex)로 초기 워크북을 실행한다. Spreadsheet Gym은 실제 Excel 365 런타임을 사용하며 per-rollout workspace를 통해 동시 실행 간의 파일 간섭을 방지한다. Harness Prompt는 역할, 도구 라우팅 규칙, 동시 읽기/쓰기 호출 규칙을 명시한다. 학습 목표 L_GRPO(θ)는 아래와 같이 정의된다. L_GRPO(θ) = E_{Di,T} [ (1/N) Σ_{i=1}^N min( ri(θ) A_i, clip(ri(θ), 1−ε, 1+ε) A_i ) ] − β D_KL(πθ ∥ πold). ri(θ) = πθ(y_i | Di,T; G) / πold(y_i | Di,T; G). 여기서 A_i는 그룹 상대 이점이며, ε은 클리핑 임계값이다. 이 식은 다양한 추론 전략의 탐색을 허용하면서도, 학습이 동료들 대비 개선되도록 안정성을 확보한다. 보상 함수 R(o)는 Dpred가 Do와 일치하는 경우에만 1을 주고, 그렇지 않으면 0을 준다. Spreadsheet Gym의 보상은 Excel에서 재계산을 수행한 뒤 도출된 값과 오커럴의 값을 비교하여 확인한다. 학습 데이터는 일반화 평가를 위한 Domain-Spreadsheet를 포함해 5928개의 고품질 샘플로 구성되며, 각 샘플은 Task Instruction, Initial Spreadsheets, Oracle Final Spreadsheet로 구성된다. 60 스텝의 학습은 4x NVIDIA H100에서 수행되며, 총 40시간의 wall-clock 시간을 필요로 한다. A.11 Verifier API를 통해 비동기 보상 계산을 수행하며, 보상은 0/1 이진값으로 산출된다. A.12 GRPO 목표는 응답 yi들의 군별 상대 이익과 π θ와 πold 간 KL 제약을 포함하는 구조로 설정된다. A.14 학습 하이퍼파라미터는 4k 토큰 길이의 프롬트/응답, 온도0.6, top-p 0.95, top-k 20, 배치 64, 롤아웃 N=16, 최대 어시스턴트 턴 20, 학습률 1e-6, KL 손실 0.001, 60 스텝 학습으로 진행된다.
한계점
A.1에서 기술한 한계로, 현재 실험은 경량 모델에 집중되며 대규모dense 모델이나 MoE 모델에 대한 확장은 향후 연구 과제로 남아 있다. A.2에서 SheetAgent 재현이 직접적인 벤치마크 비교에 포함되기 어렵고, 도메인-스프레드시트의 완전한 재현은 아직 진행 중이다.
실무 활용
Spreadsheet-RL은 오픈 소스로 데이터, 환경, 하니스, 파이프라인을 제공하여 재현성과 확장을 가능하게 한다. 실무에서는 엑셀 기반의 데이터 분석 자동화에 적용할 수 있다.
- 도메인별 재무 모델 자동화
- 공급망 관리에서 KPI 대시보드 자동 갱신
- HR 데이터 분석과 보상 벤치마킹 자동화
- 부동산 포트폴리오 가치 분석 자동화
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 스프레드시트 Gym(Spreadsheet Gym)
- — 대형 언어 모델이 파일 기반 스프레드시트를 다루는 멀티턴 RL 환경으로, Excel 기능을 코드 샌드박스와 함께 인터랙션 형식으로 다룰 수 있게 하는 실행 환경이다.
- GRPO
- — GRPO는 on-policy RL로, verifiable outcome-based rewards를 사용해 정책을 업데이트하는 학습 알고리즘이다. 그룹-샘플링된 롤아웃으로 베이스라인을 대체하고 KL 제약으로 정책 업데이트를 안정화한다.
- Domain-Spreadsheet
- — 도메인별 직무 지식과 워크플로우를 반영한 스프레드시트 벤치마크 데이터세트로, 금융·공급망·인사·부동산 등 다양한 도메인을 포괄한다.
- 스프레드시트 런타임(Spreadsheet Gym Runtime)
- — 실제 Excel 환경에서 스프레드시트 편집을 수행하는 실행 엔진으로, 다중 런타임의 작업 공간을 분리해 실시간으로 수정을 기록하고 재계산을 수행한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.