본문으로 건너뛰기

LLM 심사보다 관계 검사가 연구 오류를 잘 잡는다

LLM 심사 점수보다 typed relation check가 연구 memo의 근거·논지·거래 불일치를 정확히 포착합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 글은 LLM 심사자의 1~10점 점수만으로 연구 memo의 품질을 평가하면 내부적으로 신뢰할 수 없는 결함을 놓칠 수 있다는 점을 합성 데이터 실험으로 확인합니다. 저자는 객체 유형과 관계를 정의한 Ontology를 JSON Schema로 표현하고, 추출 결과에 Python 기반 결정론적 관계 검사 열 개를 적용해 거래·논지·근거·위험 사이의 연결을 직접 확인했습니다. 인용을 모두 지운 결함은 심사 점수가 오히려 +0.17 움직였고 반대 근거만 남긴 경우에는 +0.03에 그쳤지만, 두 결함 모두 관계 검사에서 100% 포착됐으며 심사자의 잡음은 0.27이었습니다. 따라서 문체 품질에는 LLM 심사자를 활용하되, 운영상 중요한 내부 일관성에는 객체를 추출한 뒤 관계 검사를 병행하는 구성이 적합하다는 결론입니다.

섹션별 상세

01
이 실험은 에이전트 Ontology를 객체와 관계의 typed inventory로 정의하고, 강한 모델의 종합 점수 평가를 기본 대안으로 삼아 둘의 차이를 측정합니다. 연구 memo에는 memo, market-state claim, thesis, trade, risk라는 다섯 객체 유형과 거래가 논지를 따라야 한다는 열 개 관계가 들어갑니다. 지식 그래프나 OWL 대신 JSON Schema와 Python 함수만 사용해 약 35달러의 API 비용으로 전체 하네스와 감사 기록을 재현할 수 있게 구성했습니다.
02
실험 입력은 두 종목, 계좌의 기존 포지션, 60일 가격 자료, 다섯 개 뉴스 항목으로 구성된 두 데이터 패킷입니다. 네 개 모델이 패킷마다 열 번씩 memo를 작성해 80개를 만들었고, 손으로 작성한 기준 memo 두 개도 추가했습니다. Opus 5를 LLM 심사자로 사용해 각 memo를 세 번 1~10점으로 평가하는 한편, 별도 모델이 typed object를 추출한 뒤 순수 Python 관계 검사 열 개를 실행했습니다.
03
저자는 각 관계에 대응하는 아홉 가지 결함을 깨끗한 memo에 문장 편집으로 주입하고, 동일한 깨끗한 원본과 짝지어 심사 점수 변화와 검사 적중률을 비교했습니다. 거래 방향 뒤집기, 존재하지 않는 출처 인용, 반대 근거만 둔 논지, 전체 인용 삭제, 잘못된 위험 대상, 논지 없는 거래, 삭제된 위험 무효화 조건, 근거 없는 사실, 기존 포지션 삭제가 결함 목록에 포함됐습니다. 90개 seeded memo를 각각 두 번 추출하고 세 번 심사했으며, 변경 diff가 한 가지 결함만 담는지 확인하는 게이트는 90개 중 네 번 작동했습니다.
04
LLM 심사자는 문장이 겉보기에도 어색해지는 결함에는 민감했지만, 근거를 모두 삭제하거나 논지를 반박하는 인용만 남긴 결함에는 거의 반응하지 않았습니다. 전체 인용을 제거한 경우 점수 변화는 +0.17, 반대 근거만 인용한 경우는 +0.03으로 심사자 잡음 0.27보다 작았고, 두 결함은 관계 검사에서 모두 100% 포착됐습니다. 반대로 자기 논지와 충돌하는 거래는 심사 점수가 3.73점 하락했고, 출처 없는 중대한 사실은 3.30점 하락해 사람이 읽어도 어색한 오류와 내부 신뢰성 결함 사이의 차이를 드러냈습니다.
아홉 가지 결함 유형별 LLM 심사 점수 변화와 관계 검사 적중률을 나란히 비교한 막대그래프입니다.
Chart왼쪽 패널은 거래가 논지와 충돌하는 결함에서 -3.73점, 근거 없는 중대한 사실에서 -3.30점처럼 문장이 어색해지는 오류에 심사 점수가 크게 반응하는 모습을 나타냅니다. 반면 인용을 모두 삭제한 경우 +0.17, 반대 근거만 인용한 경우 +0.03으로 심사자 잡음 ±0.27 안에 머뭅니다. 오른쪽 패널에서는 인용 삭제, 반대 근거 인용, 존재하지 않는 출처 인용, 논지 없는 거래, 논지와 충돌하는 거래가 모두 100% 포착돼 표면적 점수와 내부 관계 검사의 차이를 드러냅니다.
05
깨끗한 80개 memo에서도 심사 점수와 관계 위반 수의 상관계수는 r = 0.106에 불과했습니다. 심사 점수는 Opus 5 8.95, GPT-5.6 8.75, Kimi K3 8.10, Gemini 3.1 6.98 순이었지만, 관계 위반 수는 Opus 5와 GPT-5.6이 memo당 0.35, Gemini 3.1이 0.25, Kimi K3가 0.05였습니다. Kimi K3는 내부 일관성이 가장 높았지만 심사 점수에는 그 특성이 거의 반영되지 않았고, Opus 5가 자신이 작성한 memo를 평균 8.95로 평가한 자기 선호 가능성도 남았습니다.
네 개 writer model의 평균 LLM 심사 점수와 memo당 관계 위반 수를 비교한 그래프입니다.
Chart왼쪽 패널에서 Opus 5와 GPT-5.6은 각각 8.95와 8.75로 가장 높은 심사 점수를 받고 Kimi K3는 8.10으로 세 번째입니다. 오른쪽 패널의 관계 위반 수는 Opus 5와 GPT-5.6이 각각 memo당 0.35인 반면 Kimi K3는 0.05로 가장 낮아, 심사 순위와 내부 일관성 순위가 일치하지 않습니다. 그래프에는 80개 unseeded memo와 judge score 대 violation count의 상관계수 r = 0.106, 그리고 심사 모델이 writer 중 하나인 Opus 5라는 조건도 함께 표시돼 있습니다.
06
Ontology 검사는 모든 결함을 동일하게 포착하지 못했으며, no_risk와 ignored_position의 적중률은 각각 45%와 50%였습니다. 위험 인식과 기존 포지션 인식이 특정 섹션에만 남는 속성이 아니라 memo 전체에 퍼져 있어, 제한된 문장 편집으로 완전히 지우기 어려웠기 때문입니다. 또한 추출 모델이 뉴스 본문을 참고해 빠진 citation ID를 보충하거나 존재하지 않는 포지션 인식을 되살리면서 일부 결함을 조용히 수정했으므로, 추출 프롬프트에 원문에 없는 ID를 추가하지 말라는 제약을 넣고 두 추출 결과의 안정성을 별도로 측정해야 했습니다.
07
저자가 제안하는 운영 순서는 에이전트 출력이 포함한다고 주장하는 객체를 먼저 정하고, 깨졌을 때 가장 문제가 되는 관계 다섯 개를 우선 함수로 작성한 뒤, 문체 평가용 rubric을 추가하는 방식입니다. 추출 단계에는 모델 호출 한 번이 필요하지만 관계 검사는 비용이 없고, 오늘 실패한 동일한 규칙을 내일도 재현할 수 있어 점수가 흔들리는 LLM 심사보다 회귀 테스트에 적합합니다. 이 구조는 근거 기반 action을 생성하는 support triage, code-review bot, medical intake, deal memo 같은 작업에도 객체 이름만 바꿔 적용할 수 있습니다.

용어 해설

온톨로지(Ontology)
에이전트 출력이 포함한다고 주장하는 객체의 유형과 객체 사이에 반드시 성립해야 하는 관계를 정리한 목록입니다. 이 글에서는 memo, market-state claim, thesis, trade, risk를 객체로 두고, 거래가 논지를 따라야 한다는 식의 관계를 JSON Schema와 Python 함수로 검사합니다. 이를 통해 문장의 인상보다 내부 일관성을 판별합니다.
관계 검사(Relation Check)
추출된 객체 사이의 규칙이 지켜졌는지 결정론적으로 확인하는 함수입니다. 거래 방향과 논지의 방향이 맞는지, 논지가 실제 뉴스 항목을 인용하는지처럼 입력 객체와 관계를 직접 비교하고, 실패한 객체의 식별자를 함께 반환합니다. 모델 점수보다 수정 가능한 오류 위치를 제공한다는 점이 핵심입니다.
LLM 심사자(LLM Judge)
다른 LLM의 출력을 미리 정한 기준에 따라 점수로 평가하는 방식입니다. 이 실험에서는 Opus 5가 memo를 분석·근거·실행 가능성·위험 기준으로 1점부터 10점까지 평가하고, 같은 memo를 세 번 판정해 점수 변동을 측정합니다. 종합적인 문체 평가는 가능하지만 내부 관계의 위반 위치는 알려주지 못합니다.
JSON Schema
JSON 데이터가 어떤 객체와 필드를 가져야 하는지 구조와 제약 조건으로 정의하는 형식입니다. 글의 실험에서는 memo, market-state claim, thesis, trade, risk를 유형화한 추출 결과의 뼈대로 사용하고, Python의 결정론적 함수가 이 구조를 입력으로 받아 관계를 검사합니다. 별도 지식 그래프나 OWL은 사용하지 않습니다.
정보 추출(Extraction)
자연어 memo에서 주장, 출처, 논지, 거래, 위험 같은 typed object를 구조화된 스키마로 옮기는 단계입니다. 추출 모델이 원문에 없는 출처 ID를 보충하면 결함이 사라진 것처럼 보일 수 있으므로, 원문에 명시되지 않은 인용을 추가하지 못하게 지시하고 두 번의 추출 결과 안정성도 확인해야 합니다.

기술

  • JSON Schema
  • Python
  • OpenRouter
  • Opus 5
  • GPT-5.6
  • Kimi K3
  • Gemini 3.1 Pro

활용 사례

  • 근거 기반 투자 연구 memo
  • support triage
  • code-review bot
  • medical intake
  • deal memo
  • 증거에서 action을 도출하는 에이전트
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.