TL;DR
모순 탐지 모델이 정보 부족을 제대로 거부하는지 ManConCorpus의 728개 생의학 주장 쌍으로 검사한 결과, 입력의 77.1%에서 핵심 조건이 빠져 결정론적 비교 검사는 적격 모순을 하나도 찾지 못했습니다. qwen3:14b와 qwen3:8b에 네 가지 prompt를 적용하자 NOT_ENOUGH_INFO 비율은 각각 70.3%와 86.3%까지 올랐지만, 8회 실행 중 7회에서는 조건이 누락된 쌍을 오히려 더 자주 CONTRADICTION으로 판정했습니다. 같은 모델에서도 prompt만으로 판정의 45%가 바뀌었으며, ground truth 부재와 제한된 모델 수 때문에 결론은 정확도가 아니라 근거에 맞는 판정 여부에 관한 결과로 한정됩니다.
실용적 조언
- retrieved docs에서 conflict surfacing이나 contradiction detection을 실행할 때는 두 주장만 바로 비교하지 말고 모집단, 중재, 비교 대상, 결과 측정값 등 필요한 비교 축의 존재 여부를 먼저 검사해야 합니다. 축이 양쪽에 모두 채워지지 않으면 CONTRADICTION이나 NO_CONTRADICTION 대신 NOT_ENOUGH_INFO로 보류하는 흐름을 둘 수 있습니다. 이 글의 결정론적 검사는 6개 축이 모두 양쪽에 있을 때만 후보를 허용했으며, ManConCorpus의 728쌍에서는 적격 쌍이 0건이었습니다.
- prompt를 바꿀 때는 NOT_ENOUGH_INFO 비율만 보지 말고 조건이 명시된 경우와 누락된 경우의 CONTRADICTION 방향도 함께 비교해야 합니다. 같은 모델에서 prompt wording만으로 45%의 판정이 바뀌었고, 신중한 prompt는 거부율을 높였지만 조건 누락 쌍의 모순 판정 증가를 없애지 못했습니다. 각 실행의 원시 판정과 파싱 상태를 저장하고 sign test 및 재실행 일치율을 계산하면 이런 방향성의 재현 여부를 감사할 수 있습니다.
섹션별 상세
용어 해설
- PICO 프레임워크(PICO)
- — 임상 질문을 Population, Intervention, Comparison, Outcome으로 구조화하는 방식입니다. 이 글에서는 전문가가 작성한 PICO 질문 아래에 여러 주장을 묶었지만, 실제 모델 입력에는 초록 전체가 아닌 개별 문장과 주장 쌍만 들어가 비교 조건이 빠지는 문제가 핵심 쟁점이 됐습니다.
- 모순 탐지(Contradiction Detection)
- — 두 텍스트의 주장이 동시에 성립할 수 없는지 판별하는 작업입니다. 생의학 주장에서는 모집단, 중재, 비교 대상, 결과 같은 조건이 일치해야 모순을 판단할 수 있는데, 조건이 빠진 문장에 억지로 긍정·부정 판정을 내리면 근거 없는 결론이 만들어질 수 있습니다.
- 정보 부족 판정(NOT_ENOUGH_INFO)
- — 주어진 텍스트만으로는 두 주장의 관계를 결정할 수 없다고 거부하는 분류 결과입니다. 이 글에서는 CONTRADICTION과 NO_CONTRADICTION 사이의 제3 선택지로 사용했으며, 조건이 누락된 입력에서 모델이 이 선택지를 얼마나 일관되게 고르는지와 실제 모순 판정 방향을 함께 측정했습니다.
- 부호 검정(Sign Test)
- — 각 비교 결과의 방향만 이용해 한쪽으로 치우친 변화가 우연인지 평가하는 비모수 검정입니다. 이 실험에서는 8개 실행 중 7개에서 조건이 빠진 쌍의 CONTRADICTION 비율이 더 높았다는 방향성을 검정하는 데 사용됐고, p=0.035가 산출됐습니다.
언급된 도구
조건이 명시되거나 누락된 생의학 주장 쌍을 CONTRADICTION, NO_CONTRADICTION, NOT_ENOUGH_INFO로 분류하는 local model
동일한 세 가지 판정 선택지로 728개 주장 쌍을 평가하는 local model
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.