본문으로 건너뛰기

LLM의 성급한 판정을 막는 CFC 실험

CFC가 증거 없는 LLM의 상태 이전을 막았지만, 3회 실험에 그친 탐색 결과입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 LLM이 정답을 맞히는지보다 확보한 증거만으로 결정을 정당하게 닫을 수 있는지를 확인하는 Comparative Feedback Control (CFC)을 테스트했습니다. 모델은 누락된 증거를 부정적 증거로 취급하거나 provenance가 사라진 상태를 다른 주장으로 옮기고, 작업을 끝내라는 압박 속에서 존재하지 않는 규칙을 추가해 결정을 확정했습니다. 교차 세션 실험에서 기준 조건은 3회 중 1회 근거 없는 REJECTED 상태를 이전했지만, CFC provenance 규칙을 적용한 조건은 3회 모두 주장을 미해결 상태로 유지했습니다. 다만 표본이 작고 탐색적인 결과라서 일반적인 benchmark나 신뢰성 개선의 증거가 아니며, 작성자는 Zenodo 자료와 함께 실험 설계 비판 및 adversarial case를 요청했습니다.

실용적 조언

  • LLM이 최종 결정을 내리기 전에 결론을 뒷받침하는 증거가 해당 주장에 직접 연결되는지와 누락된 증거를 부정적 증거로 바꾸고 있지 않은지를 별도 단계에서 확인해야 합니다.
  • 상태값을 세션 사이에서 전달할 때는 상태의 원래 주장과 provenance를 함께 저장하고, 연결 정보가 사라지면 승인이나 거부 대신 미해결 상태를 유지하는 규칙을 둘 수 있습니다.
  • CFC를 실제 평가에 적용할 때는 기준 조건과 제어 규칙 조건을 여러 번 반복 실행하고, 의도적으로 provenance를 훼손하는 adversarial case를 별도로 추가해 효과의 재현성을 확인해야 합니다.

섹션별 상세

01
작성자는 LLM의 정답률보다 모델이 결정을 닫을 만큼 충분한 증거를 실제로 확보했는지를 평가해야 한다고 봤습니다. 소규모 행동 테스트에서 누락된 증거를 부정적 증거로 취급하거나, 요구사항이 바뀐 뒤에도 오래된 인증서를 재사용하거나, 종료된 절차를 해결된 주장으로 오인하는 오류를 점검했습니다. 이 관점은 최종 답변의 표면적 정확성보다 증거와 결론 사이의 연결을 통제하는 문제에 초점을 둡니다.
02
모델은 처음에는 불확실성을 올바르게 인식하다가도 작업을 끝내라는 압박을 받으면 존재하지 않는 규칙을 추가해 결정을 닫는 경향을 보였습니다. CFC는 결론을 확정하기 전에 남은 증거가 해당 판단을 정당화하는지 확인하도록 하는 명시적 제어 규칙으로 작동했습니다. 따라서 입력된 증거에서 바로 결론을 내리는 대신, 증거의 충분성과 주장과의 연결을 먼저 확인하는 처리 순서를 유도합니다.
03
교차 세션 provenance 실험에서는 기준 조건에서 3회 중 1회가 근거 없는 REJECTED 상태를 다른 주장으로 이전했습니다. CFC provenance 규칙을 적용하자 3회 모두 해당 주장을 미해결 상태로 유지했습니다. 다만 작성자는 표본이 작고 탐색적인 실행이라서 이 수치가 CFC의 일반적인 신뢰성 향상을 입증하는 benchmark는 아니라고 명시했습니다.
04
작성자는 통합 보고서와 결과 표, 증거 패키지를 Zenodo에 공개하고 실험 설계에 대한 비판과 제어 규칙을 무너뜨릴 adversarial case를 요청했습니다. 이는 성공 사례만으로 규칙을 정당화하기보다 실패 메커니즘이 실제로 재현되는지 확인하려는 검증 방향입니다. 후속 검증에서는 더 많은 실행과 의도적으로 provenance를 훼손하거나 종료 절차와 해결된 주장을 혼동하게 만드는 사례가 필요합니다.

용어 해설

비교 피드백 제어(Comparative Feedback Control)
Comparative Feedback Control (CFC)는 LLM이 결정을 마무리하기 전에 남은 증거가 결론을 정당화하기에 충분한지 비교·점검하는 제어 규칙입니다. 불확실성을 임의의 추가 규칙으로 메우지 못하게 해 근거 없는 최종 판정을 줄이는 데 초점을 둡니다.
출처 추적성(Provenance)
Provenance는 특정 상태나 증거가 어느 주장과 어떤 근거에 연결되는지 추적하는 속성입니다. 이 연결이 사라지면 모델이 한 주장에 붙은 REJECTED 상태를 근거 없이 다른 주장으로 옮길 수 있어, 결정의 정당성을 확인하는 핵심 조건이 됩니다.
부정적 증거(Negative Evidence)
Negative Evidence는 어떤 사실이 없다는 점을 부정적인 판단의 근거로 사용하는 경우를 뜻합니다. 글의 실험에서는 누락된 증거를 자동으로 부정적 증거로 간주하는 오류가 LLM의 성급한 결정 종결과 연결되는지 점검했습니다.
미해결 주장(Unresolved Claim)
Unresolved Claim은 현재 확보된 증거만으로 승인이나 거부를 정당화할 수 없어 결론을 닫지 않은 주장입니다. CFC의 provenance 규칙을 적용한 실험에서는 근거 없는 REJECTED 상태 이전을 막고 주장을 미해결 상태로 유지하는 결과를 확인했습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 18.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.