본문으로 건너뛰기

생의학 모순 탐지에서 정보 부족을 거부하지 못하는 모델

신중한 prompt는 거부율을 높였지만 조건 누락 쌍의 모순 판정은 오히려 늘었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

모순 탐지 모델이 정보 부족을 제대로 거부하는지 ManConCorpus의 728개 생의학 주장 쌍으로 검사한 결과, 입력의 77.1%에서 핵심 조건이 빠져 결정론적 비교 검사는 적격 모순을 하나도 찾지 못했습니다. qwen3:14b와 qwen3:8b에 네 가지 prompt를 적용하자 NOT_ENOUGH_INFO 비율은 각각 70.3%와 86.3%까지 올랐지만, 8회 실행 중 7회에서는 조건이 누락된 쌍을 오히려 더 자주 CONTRADICTION으로 판정했습니다. 같은 모델에서도 prompt만으로 판정의 45%가 바뀌었으며, ground truth 부재와 제한된 모델 수 때문에 결론은 정확도가 아니라 근거에 맞는 판정 여부에 관한 결과로 한정됩니다.

실용적 조언

  • retrieved docs에서 conflict surfacing이나 contradiction detection을 실행할 때는 두 주장만 바로 비교하지 말고 모집단, 중재, 비교 대상, 결과 측정값 등 필요한 비교 축의 존재 여부를 먼저 검사해야 합니다. 축이 양쪽에 모두 채워지지 않으면 CONTRADICTION이나 NO_CONTRADICTION 대신 NOT_ENOUGH_INFO로 보류하는 흐름을 둘 수 있습니다. 이 글의 결정론적 검사는 6개 축이 모두 양쪽에 있을 때만 후보를 허용했으며, ManConCorpus의 728쌍에서는 적격 쌍이 0건이었습니다.
  • prompt를 바꿀 때는 NOT_ENOUGH_INFO 비율만 보지 말고 조건이 명시된 경우와 누락된 경우의 CONTRADICTION 방향도 함께 비교해야 합니다. 같은 모델에서 prompt wording만으로 45%의 판정이 바뀌었고, 신중한 prompt는 거부율을 높였지만 조건 누락 쌍의 모순 판정 증가를 없애지 못했습니다. 각 실행의 원시 판정과 파싱 상태를 저장하고 sign test 및 재실행 일치율을 계산하면 이런 방향성의 재현 여부를 감사할 수 있습니다.

섹션별 상세

01
작성자는 모순 탐지기가 정확한지보다 근거가 부족할 때 판정을 거부하는지를 측정하기 위해 ManConCorpus를 사용했습니다. 데이터셋에는 24개 systematic review, 전문가가 주석을 단 259개 주장, 잠재적 모순으로 표시된 728개 쌍이 포함됐습니다. 그러나 728쌍 중 77.1%는 적어도 한쪽에 모집단, 중재 또는 결과 측정값이 빠져 있었고, 모집단은 55.9%에서 누락돼 문장 단위 파이프라인의 비교 가능성이 크게 제한됐습니다.
02
작성자의 결정론적 비교 가능성 검사는 양쪽 주장에 필요한 6개 축이 모두 있는 경우만 모순 후보로 인정했으며, 728쌍 가운데 조건을 충족한 쌍은 하나도 없었습니다. 따라서 이 기준의 결과는 0건의 모순과 0의 재현율이었지만, 이는 실제 모순이 없다는 뜻이 아니라 입력만으로 판정할 자격이 있는 쌍이 없었다는 뜻입니다. 전체 초록과 전문가 PICO 질문이 아니라 파이프라인에 전달되는 한 문장만 보면 정보 손실이 판정 가능성을 먼저 제거합니다.
03
두 local model인 qwen3:14b와 qwen3:8b는 CONTRADICTION, NO_CONTRADICTION, NOT_ENOUGH_INFO의 세 선택지로 728쌍 전체를 판정했습니다. 처음에는 조건이 제시됐는지와 관계없이 거부율이 통계적으로 같았지만, 고정한 네 가지 prompt를 두 모델에 모두 적용한 5,824개 판정에서는 파싱 실패가 없었습니다. NOT_ENOUGH_INFO 비율은 qwen3:14b에서 28.4%에서 70.3%로, qwen3:8b에서 19.6%에서 86.3%로 증가해 신중한 prompt가 거부율 자체는 바꿨습니다.
04
거부율이 높아져도 판정 방향은 교정되지 않았으며, 8회 실행 중 7회에서 조건이 빠진 주장 쌍을 조건이 명시된 쌍보다 더 자주 CONTRADICTION으로 분류했습니다. 이 방향성의 부호 검정은 p=0.035였고, 가장 신중한 prompt에서 역전 폭은 +9.8 percentage points, p=0.004로 가장 컸습니다. 같은 모델에서도 prompt wording만 바꿨을 때 판정의 45%가 달라졌으며, 두 모델 간 불일치가 큰 115쌍에서는 14b가 NOT_ENOUGH_INFO를 고른 반면 8b는 NO_CONTRADICTION을 골라 정보 부재를 부정적 발견처럼 처리했습니다.
05
이 결과는 실제 모순을 맞혔는지가 아니라 텍스트가 결론을 뒷받침하는지에 관한 warrant를 측정한 것입니다. 참된 모순에 대한 ground truth가 없고 16개 검정 중 개별적으로 유의한 실행은 3개뿐이며, 두 모델 모두 한 family에 속한다는 제한이 있습니다. 축 annotation은 한 모델이 수행했지만 재실행과 null decision의 97.5%가 일치했고, audit script가 모든 수치를 다시 계산해 PASS/FAIL을 출력하도록 구성됐습니다.

용어 해설

PICO 프레임워크(PICO)
임상 질문을 Population, Intervention, Comparison, Outcome으로 구조화하는 방식입니다. 이 글에서는 전문가가 작성한 PICO 질문 아래에 여러 주장을 묶었지만, 실제 모델 입력에는 초록 전체가 아닌 개별 문장과 주장 쌍만 들어가 비교 조건이 빠지는 문제가 핵심 쟁점이 됐습니다.
모순 탐지(Contradiction Detection)
두 텍스트의 주장이 동시에 성립할 수 없는지 판별하는 작업입니다. 생의학 주장에서는 모집단, 중재, 비교 대상, 결과 같은 조건이 일치해야 모순을 판단할 수 있는데, 조건이 빠진 문장에 억지로 긍정·부정 판정을 내리면 근거 없는 결론이 만들어질 수 있습니다.
정보 부족 판정(NOT_ENOUGH_INFO)
주어진 텍스트만으로는 두 주장의 관계를 결정할 수 없다고 거부하는 분류 결과입니다. 이 글에서는 CONTRADICTION과 NO_CONTRADICTION 사이의 제3 선택지로 사용했으며, 조건이 누락된 입력에서 모델이 이 선택지를 얼마나 일관되게 고르는지와 실제 모순 판정 방향을 함께 측정했습니다.
부호 검정(Sign Test)
각 비교 결과의 방향만 이용해 한쪽으로 치우친 변화가 우연인지 평가하는 비모수 검정입니다. 이 실험에서는 8개 실행 중 7개에서 조건이 빠진 쌍의 CONTRADICTION 비율이 더 높았다는 방향성을 검정하는 데 사용됐고, p=0.035가 산출됐습니다.

언급된 도구

qwen3:14b중립

조건이 명시되거나 누락된 생의학 주장 쌍을 CONTRADICTION, NO_CONTRADICTION, NOT_ENOUGH_INFO로 분류하는 local model

qwen3:8b중립

동일한 세 가지 판정 선택지로 728개 주장 쌍을 평가하는 local model

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 27.수집 2026. 08. 28.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.