본문으로 건너뛰기

DEONTICBENCH: 규칙 기반 추론을 위한 벤치마크

LLM이 의료나 법률 같은 고위험 환경에 도입되면서 명시적인 규칙을 정확히 따르는 능력이 중요해졌다. 이 논문은 단순 수학 문제를 넘어 복잡한 법령과 정책을 해석하는 능력을 평가하는 대규모 데이터셋을 제공하며, 심볼릭 코드 생성을 통한 추론의 신뢰성 확보 방안을 제시한다.

용어 해설

의무 논리 추론(Deontic Reasoning)
명시적인 규칙이나 법령 하에서 의무(obligations), 허용(permissions), 금지(prohibitions) 사항을 판단하고 추론하는 능력이다. 법률 해석이나 정책 준수 여부를 판단할 때 필수적이며, 단순한 사실 관계 파악을 넘어 복잡한 규범적 논리 구조를 이해해야 한다.
기호 논리 추론(Symbolic Reasoning)
자연어 문제를 컴퓨터가 실행 가능한 기호적 코드(예: Prolog)로 변환하여 논리 엔진에서 실행하는 방식이다. 딥러닝 모델의 확률적 추론과 달리 논리적 단계가 명확히 드러나며, 결과에 대한 엄밀한 검증과 해석이 가능하다는 장점이 있다.
프롤로그(Prolog)
논리 프로그래밍 언어로, 사실(facts)과 규칙(rules)을 정의하고 이에 대한 질의를 수행하는 데 특화되어 있다. 법률 조항을 실행 가능한 코드로 변환하여 복잡한 조건부 논리를 계산하는 심볼릭 솔버(Symbolic Solver)의 핵심 도구로 사용된다.
그룹 상대 정책 최적화(GRPO)
DeepSeek-V3 등에서 사용된 강화학습 기법으로, 별도의 비평가(Critic) 모델 없이 샘플링된 그룹 내의 상대적 보상을 기반으로 정책을 업데이트한다. 이 논문에서는 Prolog 코드 생성 품질을 높이기 위해 이를 변형한 Dr. GRPO를 적용했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 06.수집 2026. 04. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.